Vis Aware (Визуальное распознавание)

Vis Aware — это дополнение для NVDA, предоставляющее возможности OCR, описания изображений с помощью ИИ, автоматического распознавания и управления компьютером с помощью ИИ.

Vis Aware требует NVDA 2026.1 или новее. Для большинства облачных движков требуется подключение к интернету и учётные данные сервиса. Ollama используется для локального самостоятельного развёртывания (например, Google Gemma).

Быстрый старт

  1. Откройте Меню NVDA > Параметры > Настройки Vis Aware.... На вкладке Общие вы можете войти в свою учётную запись Китайского сообщества NVDA (www.nvdacn.com) для использования связанных бесплатных сервисов сообщества. Затем выберите и настройте другие движки по мере необходимости на соответствующих панелях OCR, Описание изображений или ИИ-агент.

  2. Нажмите NVDA+alt+1 для выбора режима (типа возможности): OCR, Описание изображений или ИИ-агент.

  3. Нажмите NVDA+alt+2 для выбора движка, поддерживаемого этим режимом. Выберите движок, который вы настроили на шаге 1.

  4. Переместите объект навигатора на содержимое, которое хотите распознать, или нажмите NVDA+alt+3 для выбора другого источника распознавания (например, изображения или файла изображения в буфере обмена).

  5. Нажмите NVDA+alt+пробел один раз для выполнения распознавания с использованием выбранной возможности или для запуска или остановки Агента. Для обычного распознавания:

Режимы и источники распознавания

Vis Aware предоставляет три режима:

OCR и описание изображений могут использовать следующие источники распознавания:

Режим ИИ-агента захватывает полный экран напрямую и не использует выбранный источник распознавания.

Команды

Следующие команды имеют назначенные жесты по умолчанию:

| Команда | Жест по умолчанию | | --- | --- | | Выполнить распознавание с текущими настройками | NVDA+alt+пробел | | Задать дополнительный вопрос о предыдущем описании изображения | NVDA+alt+q | | Переключение режимов распознавания по кругу | NVDA+alt+1 | | Переключение движков для текущего режима по кругу | NVDA+alt+2 | | Переключение источников распознавания по кругу | NVDA+alt+3 |

Следующие команды не имеют жеста по умолчанию:

После назначения жеста команде Описывает изображения в буфере обмена нажмите его один раз, чтобы отобразить результат в документе результатов распознавания NVDA. Нажмите дважды подряд, чтобы показать результат в доступном для просмотра сообщении или озвучить его, в зависимости от настройки Показывать текстовые результаты в доступном для просмотра сообщении.

Результаты распознавания

Когда результаты OCR содержат координаты, нажатие Enter или Пробел на тексте в документе результатов распознавания выполняет щелчок в соответствующем месте распознанной области экрана.

Результаты распознавания могут отображаться в виртуальном документе NVDA или, в зависимости от настройки, в диалоговом окне режима обзора. Режим обзора отображает поддерживаемый Markdown и математические формулы. Результаты также можно копировать в буфер обмена.

Сохраняется только предыдущий результат распознавания из текущего сеанса NVDA. Для движков описания изображений, поддерживающих дополнительные вопросы, команда дополнительного вопроса открывает диалог с несколькими шагами и транслирует озвучиваемые ответы, если это поддерживается. В этом диалоге Control+Enter отправляет вопрос, а Escape отменяет запрос или закрывает диалог. Используйте Просмотреть форматированное содержимое, чтобы просмотреть начальное описание или последний ответ в режиме обзора.

Дополнительные вопросы поддерживаются Google Gemini, Google Gemma, Kimi, VIVO BlueLLM Vision и Ollama Vision. Вне диалога беседы потоковый вывод доступен только тогда, когда не используется режим обзора.

Автоматическое распознавание

Автоматическое распознавание по умолчанию отключено. На панели Автоматическое распознавание выберите OCR или описание изображений, затем выберите текущий движок или конкретный включенный движок. Поля подсказки и модели переопределяют этот движок только для автоматического распознавания. Оставьте подсказку пустой, чтобы использовать краткую подсказку Vis Aware по умолчанию (от 20 до 30 символов, без Markdown), и выберите Использовать модель, выбранную в настройках движка, чтобы следовать его обычной модели. Если поддерживается, используйте Получить модели для загрузки доступных имён моделей.

Автоматическое распознавание выполняется в фоновом режиме, когда системный фокус, курсор режима обзора или объект навигатора перемещается на поддерживаемый графический элемент управления. Результат озвучивается автоматически и сохраняется как предыдущий результат; дополнительные вопросы доступны, если поддерживаются движком.

Для веб-графики Vis Aware обычно использует URL-адрес изображения и использует снимок экрана объекта, если URL-адрес недоступен. Предпочитать снимки экрана для веб-изображений сначала распознаёт содержимое, отображаемое на экране, и переходит к URL-адресу, если снимок экрана не может быть захвачен.

Режим ИИ-агента

ИИ-агент запрашивает задачу, начинает с активного окна и может работать в разных окнах. Он может щёлкать, печатать, нажимать клавиши, прокручивать, перетаскивать, перемещаться, ожидать и запрашивать у вас информацию при необходимости. Действия не подтверждаются по одному, поэтому следите за сеансом и останавливайте его при необходимости.

Каждый шаг ИИ-агента отправляет выбранному сервису полноэкранный снимок, который может включать содержимое других окон. Не запускайте ИИ-агента, пока на экране видна конфиденциальная информация.

ИИ-агент не может быть запущен, пока включена шторка экрана.

Настройки

Откройте Меню NVDA > Параметры > Настройки Vis Aware....

Диалог настроек содержит следующие панели:

Отключённые движки пропускаются при обычном использовании и переключении движков. В каждом режиме должен оставаться включённым хотя бы один движок.

Для PaddleOCR / PaddleOCR-VL настройки OCR поддерживают размещённый API задачи AI Studio, развёрнутый сервис AI Studio или самостоятельно размещённый сервис PaddleOCR.

Для движков Ollama введите полный URL-адрес API или хост и порт, например localhost:11434. Корневой URL-адрес API по умолчанию: http://localhost:11434/api. Используйте Получить модели для загрузки имён моделей, затем выберите модель. Если модель не выбрана, используется первая модель, возвращённая Ollama. Необязательный ключ API отправляется как токен Authorization: Bearer. Движки Ollama требуют модель с поддержкой зрения, например Gemma 4; Ollama OCR предоставляет координаты экрана только тогда, когда модель возвращает действительные структурированные данные OCR.

Движки Kimi по умолчанию используют официальный базовый URL-адрес Kimi Code, совместимый с OpenAI: https://api.kimi.com/coding/v1; введите ключ API Kimi Code для этой конечной точки. Для открытой платформы Kimi используйте https://api.moonshot.cn/v1 с ключом из Kimi Open Platform. Для международной платформы используйте https://api.moonshot.ai/v1 с ключом из международной платформы Kimi. Не смешивайте ключи и конечные точки. Kimi K3 — модель по умолчанию; параметры модели и режима мышления различаются в зависимости от конечной точки и семейства моделей.

Движки DeepSeek используют официальный API, совместимый с OpenAI. Установите базовый URL-адрес https://api.deepseek.com, создайте ключ в DeepSeek API console и введите его в настройках движка. Модель зрения по умолчанию: deepseek-v4-flash-vision-exp; она используется как для описания изображений, так и для движков ИИ-агента.

Включённые движки

Движки OCR:

Движки описания изображений:

Движки ИИ-агента:

Доступность движка зависит от его сервиса и конфигурации.

Apple Vision (OCR Server)

Apple Vision (OCR Server) — это локальный сетевой движок OCR. Vis Aware отправляет выбранное изображение в OCR Server, приложение с открытым исходным кодом для iOS, которое распознаёт текст с помощью Apple Vision и возвращает координаты текста. Облачная учётная запись OCR не требуется, но компьютер и iPhone должны иметь доступ друг к другу в одной локальной сети.

Текущее приложение требует iOS 18.4 или новее. Старейшие поддерживаемые iPhone: iPhone XS, iPhone XS Max, iPhone XR и iPhone SE (2-го поколения).

Чтобы настроить движок:

  1. Установите OCR Server из App Store на iPhone.
  2. Подключите iPhone и компьютер к одной локальной сети, затем откройте OCR Server. Его сервер запускается автоматически и отображает адрес для использования.
  3. Откройте Меню NVDA > Параметры > Настройки Vis Aware... > OCR, включите и выберите Apple Vision (OCR Server), затем введите отображаемый адрес, например 192.168.1.10:8000.

Соединения OCR Server используют неаутентифицированный, незашифрованный HTTP. Используйте этот движок только в доверенной локальной сети; в публичных или ненадёжных сетях передаваемые изображения и возвращаемые результаты OCR могут быть перехвачены или изменены.

Держите OCR Server открытым и экран iPhone включённым во время использования движка. Для непрерывной работы следуйте инструкциям вышестоящего проекта по режиму Guided Access в iOS. Вышестоящий проект также документирует использование приложения и API сервера.

Рекомендуемая автономная настройка: Gemma 4 через Ollama

Для автономной, самостоятельно размещаемой настройки мы рекомендуем запускать модель Gemma 4 с поддержкой зрения локально с Ollama. После загрузки модели и указания URL-адреса API на локальный сервис Vis Aware отправляет изображения в этот локальный сервис. Если вы используете удалённый адрес Ollama, размещённый кем-то другим, данные отправляются в этот удалённый сервис.

Данные и учётные данные

Распознавание отправляет выбранное изображение и, если применимо, подсказку в сервис, настроенный для выбранного движка. Каждый шаг ИИ-агента отправляет полноэкранный снимок экрана выбранному сервису; снимок может включать другие окна. Ознакомьтесь с политикой обработки данных сервиса и избегайте отправки конфиденциального содержимого.

Ручное распознавание из источника, отличного от буфера обмена, требует отключения шторки экрана. Пароль NVDACN защищён с помощью Windows DPAPI. Другие сохранённые API-ключи хранятся в незашифрованном виде в конфигурации NVDA. Помните о безопасности данных перед созданием или распространением портативной копии NVDA.

Лицензия

Этот проект распространяется под лицензией GNU General Public License версии 2. Подробности см. в файле COPYING.txt.