Vis Aware (Визуальное распознавание)

Vis Aware — это дополнение для NVDA, предназначенное для OCR, описания изображений с помощью ИИ, автоматического распознавания и управления компьютером с использованием ИИ-агента.

Для работы Vis Aware требуется NVDA 2026.1 или новее. Большинство внешних движков требуют подключения к Интернету и учетных данных сервиса. Для локального запуска используется Ollama (например, для Google Gemma).

Быстрый старт

  1. Откройте Меню NVDA > Настройки > Параметры Vis Aware.... На вкладке Основные вы можете войти в свою учетную запись NVDA Chinese Community (www.nvdacn.com) для использования соответствующих бесплатных сервисов сообщества. Затем выберите и настройте другие движки на вкладках OCR, Описание изображений или ИИ-агент по мере необходимости.
  2. Нажмите NVDA+alt+1 для выбора режима (типа распознавания): OCR, Описание изображений или ИИ-агент.
  3. Нажмите NVDA+alt+2 для выбора движка, поддерживаемого в этом режиме. Выберите движок, который вы настроили на шаге 1.
  4. Переместите объект навигатора на содержимое, которое хотите распознать, или нажмите NVDA+alt+3, чтобы выбрать другой источник распознавания (например, изображение или файл изображения в буфере обмена).
  5. Нажмите NVDA+alt+пробел один раз для выполнения распознавания с использованием выбранной функции или для запуска/остановки агента. Для обычного распознавания:
  6. Одно нажатие отображает результат в документе результатов распознавания NVDA. Для результатов OCR вы можете использовать Enter или Пробел для нажатия на координаты, соответствующие тексту; это полезно при распознавании окна.

  7. Поведение при двойном нажатии зависит от того, установлен ли флажок Показывать текстовые результаты в сообщении с режимом обзора в основных настройках. Если флажок установлен, результат отображается в диалоге режима обзора NVDA, что удобно для математических формул, таблиц или структурированного содержимого, требующего рендеринга Markdown. Если флажок не установлен, NVDA только озвучивает результат распознавания и не показывает диалог.

Режимы и источники распознавания

Vis Aware предоставляет три режима:

OCR и описание изображений могут использовать следующие источники распознавания:

Режим ИИ-агента захватывает весь экран напрямую и не использует выбранный источник распознавания.

Команды

Для следующих команд назначены стандартные жесты:

Команда Жест по умолчанию
Выполнить распознавание с текущими настройками NVDA+alt+пробел
Задать уточняющий вопрос о предыдущем описании изображения NVDA+alt+q
Переключение режимов распознавания NVDA+alt+1
Переключение движков для текущего режима NVDA+alt+2
Переключение источников распознавания NVDA+alt+3

Для следующих команд не назначены жесты по умолчанию:

После назначения жеста для команды Описать изображения в буфере обмена, нажмите его один раз, чтобы отобразить результат в документе результатов распознавания NVDA. Нажмите дважды быстро, чтобы показать результат в сообщении с режимом обзора или озвучить его, в зависимости от настройки Показывать текстовые результаты в сообщении с режимом обзора.

Результаты распознавания

Если результаты OCR содержат координаты, нажатие Enter или Пробел на тексте в документе результата распознавания имитирует щелчок по соответствующему месту в распознанной области экрана.

Результаты распознавания могут отображаться в виртуальном документе NVDA или, в зависимости от настройки, в диалоге с режимом обзора. Режим обзора отображает поддерживаемый Markdown и математические формулы. Результаты также можно скопировать в буфер обмена.

В текущей сессии NVDA сохраняется только предыдущий результат распознавания. Для движков описания изображений, поддерживающих уточняющие вопросы, команда уточняющего вопроса открывает диалог с несколькими шагами и воспроизводит потоковые ответы, если это поддерживается. В этом диалоге Ctrl+Enter отправляет вопрос, а Escape отменяет запрос или закрывает диалог. Используйте Просмотреть отформатированное содержимое, чтобы просмотреть начальное описание или последний ответ в режиме обзора.

Уточняющие вопросы поддерживаются Google Gemini, Google Gemma, Kimi, VIVO BlueLLM Vision и Ollama Vision. Вне диалога потоковый вывод доступен только когда режим обзора не используется.

Автоматическое распознавание

Автоматическое распознавание по умолчанию отключено. На вкладке Автоматическое распознавание выберите OCR или описание изображений, затем выберите текущий движок или конкретный включенный движок. Поля "Запрос" и "Модель" переопределяют настройки этого движка только для автоматического распознавания. Оставьте запрос пустым, чтобы использовать краткий запрос Vis Aware по умолчанию (от 20 до 30 символов, без Markdown), и выберите Использовать модель, выбранную в настройках движка, чтобы использовать его обычную модель. Если поддерживается, используйте Получить модели для загрузки доступных имен моделей.

Автоматическое распознавание работает в фоновом режиме, когда системный фокус, курсор режима обзора или объект навигатора перемещается на поддерживаемый графический элемент. Результат озвучивается автоматически и сохраняется как предыдущий результат; уточняющие вопросы доступны, если они поддерживаются движком.

Для веб-графики Vis Aware обычно использует URL изображения, а если URL недоступен, использует снимок экрана объекта. Предпочитать снимки экрана для веб-изображений сначала распознает содержимое, отображаемое на экране, и возвращается к URL, если сделать снимок экрана невозможно.

Режим ИИ-агента

ИИ-агент запрашивает задачу, начинает с активного окна и может работать между окнами. Он может нажимать, печатать, нажимать клавиши, прокручивать, перетаскивать, перемещаться, ожидать и запрашивать у вас информацию при необходимости. Действия не подтверждаются по одному, поэтому следите за сеансом и останавливайте его при необходимости.

На каждом шаге ИИ-агент отправляет выбранному сервису снимок всего экрана, который может содержать содержимое других окон. Избегайте запуска ИИ-агента, когда на экране видна конфиденциальная информация.

ИИ-агент не может запускаться, пока включена Штора экрана.

Настройки

Откройте Меню NVDA > Настройки > Параметры Vis Aware....

Диалог настроек содержит следующие вкладки:

Отключенные движки пропускаются при обычном использовании и переключении движков. В каждом режиме должен быть включен как минимум один движок.

Для PaddleOCR / PaddleOCR-VL настройки OCR поддерживают API хостинговой задачи AI Studio, развернутый сервис AI Studio или самостоятельно размещенный сервис PaddleOCR.

Для движков Ollama введите полный URL API или хост и порт, например localhost:11434. Корневой URL API по умолчанию — http://localhost:11434/api. Используйте Получить модели для загрузки имен моделей, а затем выберите модель. Если модель не выбрана, используется первая модель, возвращенная Ollama. Необязательный ключ API отправляется как токен Authorization: Bearer. Движки Ollama требуют модель с поддержкой зрения, например Gemma 4; Ollama OCR предоставляет координаты экрана только если модель возвращает корректные структурированные данные OCR.

Движки Kimi по умолчанию используют официальный Base URL, совместимый с Kimi Code OpenAI: https://api.kimi.com/coding/v1. Введите ключ API, выпущенный для этой конечной точки. Чтобы использовать публичный API Kimi, установите базовый URL на https://api.moonshot.ai/v1 и используйте публичный ключ API. Kimi K3 является моделью по умолчанию; параметры модели и "мышления" различаются в зависимости от конечной точки и семейства моделей.

Включенные движки

Движки OCR:

Движки описания изображений:

Движки ИИ-агента:

Доступность движка зависит от его сервиса и конфигурации.

Apple Vision (OCR Server)

Apple Vision (OCR Server) — это движок OCR в локальной сети. Vis Aware отправляет выбранное изображение в OCR Server, приложение с открытым исходным кодом для iOS, которое распознает текст с помощью Apple Vision и возвращает координаты текста. Учетная запись облачного OCR не требуется, но компьютер и iPhone должны быть доступны друг для друга в одной локальной сети.

Текущее приложение требует iOS 18.4 или новее. Поддерживаемые модели iPhone: iPhone XS, iPhone XS Max, iPhone XR и iPhone SE (2-го поколения).

Настройка движка:

  1. Установите OCR Server из App Store на iPhone.
  2. Подключите iPhone и компьютер к одной локальной сети, затем откройте OCR Server. Сервер запускается автоматически и отображает адрес для использования.
  3. Откройте Меню NVDA > Настройки > Параметры Vis Aware... > OCR, включите и выберите Apple Vision (OCR Server), затем введите отображаемый адрес, например 192.168.1.10:8000.

Соединения с OCR Server используют неаутентифицированный, незашифрованный HTTP. Используйте этот движок только в доверенной локальной сети; в публичных или ненадежных сетях передаваемые изображения и возвращаемые результаты OCR могут быть перехвачены или изменены.

Держите OCR Server открытым и экран iPhone включенным во время использования движка. Для непрерывной работы следуйте инструкциям вышестоящего проекта для iOS Guided Access. В вышестоящем проекте также документировано использование приложения и API сервера.

Рекомендуемая локальная конфигурация: Gemma 4 через Ollama

Для локальной автономной работы мы рекомендуем запускать модель Gemma 4 с поддержкой зрения локально через Ollama. После загрузки модели и настройки URL API на локальный сервис Vis Aware будет отправлять изображения в этот локальный сервис. Если вы используете удаленный адрес Ollama, принадлежащий другому лицу, данные будут отправляться в этот удаленный сервис.

Данные и учетные данные

Распознавание отправляет выбранное изображение и, при необходимости, запрос в сервис, настроенный для выбранного движка. Каждый шаг ИИ-агента отправляет снимок всего экрана в выбранный сервис; снимок может содержать другие окна. Ознакомьтесь с политикой обработки данных сервиса и избегайте отправки конфиденциального содержимого.

Для ручного распознавания из источника, отличного от буфера обмена, требуется отключить Штору экрана. Пароль NVDACN защищен с помощью Windows DPAPI. Другие сохраненные ключи API хранятся в незашифрованном виде в конфигурации NVDA. Помните о безопасности данных перед созданием или передачей портативной копии NVDA.

Лицензия

Этот проект лицензирован под GNU General Public License version 2. Подробности см. в COPYING.txt.