Документация по Vision Assistant Pro

Всего загрузок: 62 863

Vision Assistant Pro — это продвинутый мультимодальный ИИ-ассистент для NVDA. Он использует передовые ИИ-движки для интеллектуального чтения экрана, перевода, голосового диктования и анализа документов.

Это дополнение было выпущено для сообщества в честь Международного дня инвалидов.

1. Настройка и конфигурация

Перейдите в Меню NVDA > Параметры > Настройки > Vision Assistant Pro. Диалог настроек организован в 9 доступных вкладок: Подключение, Живой ассистент, Поведение ИИ, Языки перевода, Чтение документов, Видео, CAPTCHA, Запросы и Дополнительно.

1.1 Вкладка «Подключение»

1.2 Вкладка «Живой ассистент»

Примечание: Эта вкладка появляется только тогда, когда Google Gemini (или совместимый с Gemini пользовательский провайдер) является вашим активным провайдером.

1.3 Вкладка «Поведение ИИ»

1.4 Вкладка «Языки перевода»

1.5 Вкладка «Чтение документов»

1.6 Вкладка «Видео»

1.7 Вкладка «CAPTCHA»

1.8 Вкладка «Запросы»

1.9 Вкладка «Дополнительно» и глобальное ведение журнала

Перейдите на вкладку «Дополнительно», чтобы настроить глобальное ведение журнала дополнения:
- Включить отдельный файл журнала: Включает запись всех операционных событий, трафика API и ошибок во всех модулях дополнения в отдельный файл (vision_assistant.log).
- Уровень журнала: Выберите детализацию между Отладка (Все детали), Информация (Общая информация), Предупреждение (Только предупреждения) и Ошибка (Только ошибки).
- Хранить журналы: Установите автоматический срок хранения для автоматической очистки старых записей журнала (от 1 часа до 90 дней).
- Управление журналом: Используйте Открыть файл журнала, Открыть папку журнала или Очистить файл журнала, чтобы просматривать или очищать данные журнала напрямую без перезапуска NVDA и без вмешательства в стандартные журналы NVDA.

1.10 Резервное копирование и восстановление настроек

Вкладка «Дополнительно» также включает раздел «Резервное копирование и восстановление»:
- Резервное копирование: Сохраняет вашу конфигурацию в один JSON-файл. При нажатии вы выбираете, что включить: Всё (настройки, пользовательские метки, прогресс OCR и историю) или Только настройки.
- Восстановление: Загружает ранее сохранённую резервную копию для восстановления вашей конфигурации и данных в любое время, на любом компьютере или после переустановки NVDA. Вам будет предложено подтвердить действие, поскольку восстановление заменяет все ваши текущие настройки и данные.

2. Слой команд и сочетания клавиш

Чтобы избежать конфликтов клавиатуры, это дополнение использует Слой команд.
1. Нажмите NVDA + Shift + V (главная клавиша), чтобы активировать слой (вы услышите звуковой сигнал).
2. Отпустите клавиши, затем нажмите одну из следующих одиночных клавиш:

Клавиша Функция Описание
Shift + A AI Operator Автономная операция: Скажите ИИ выполнить задачу на экране. Повторное нажатие немедленно прерывает активные операции.
E UI Explorer Интерактивный клик: Определяет и нажимает элементы интерфейса в любом приложении.
T Умный переводчик Переводит текст под курсором навигатора или выделенный текст.
Shift + T Переводчик буфера обмена Переводит содержимое буфера обмена.
R Редактор текста Резюмирование, исправление грамматики, объяснение или выполнение пользовательских запросов.
V Объектное зрение Описывает текущий объект навигатора.
O Зрение полного экрана Анализирует весь макет и содержимое экрана.
Shift + V Анализ видео Анализирует локальные видеофайлы или онлайн-видео с YouTube, Instagram, TikTok или Twitter (X).
Control + V Локальная запись видео Записывает немое видео вашего экрана и анализирует действия и макет.
D Чтение документов Расширенное чтение PDF, изображений и текстовых/HTML-файлов с выбором диапазона страниц.
F Умное действие с файлом Контекстно-зависимое распознавание выбранного изображения, PDF или TIFF-файлов.
M Транскрипция и озвучивание медиа Транскрибирует или озвучивает аудио/видеофайлы (MP3, WAV, MP4 и т. д.) на ваш целевой язык.
C Решение CAPTCHA Захватывает и решает CAPTCHA.
Shift + C Прямой чат Открывает прямой текстовый интерфейс чата с ИИ.
S Умное диктование Преобразует речь в текст. Нажмите, чтобы начать запись, снова, чтобы остановить/ввести текст.
Control + T Голосовой перевод Транскрибирует, переводит и вводит результат на основе ваших языковых настроек.
Control + L Живой ассистент Совместный пилот в реальном времени (только Gemini): Начинает или завершает живую голосовую и экранную беседу с ИИ-ассистентом.
I Отчёт о статусе Объявляет текущий прогресс (например, «Сканирование...», «Ожидание»).
L Метка объекта Семантическая разметка ИИ: Навсегда маркирует текущий элемент/иконку в фокусе.
Shift + L Управление/сканирование меток Открывает менеджер меток (если они есть) или сканирует приложение на предмет безымянных элементов.
U Проверка обновлений Вручную проверяет GitHub на наличие последней версии дополнения.
Пробел Возврат последнего результата Показывает последний ответ ИИ в окне чата для просмотра или уточнения.
H Справка по командам Отображает список всех доступных сочетаний клавиш.
Control + H История Открывает диалог истории, в котором перечислены ваши прошлые чаты и документы, с фильтрацией по типу и опциями удаления/очистки.
Alt + S Настройки Открывает диалог настроек Vision Assistant Pro.
Alt + Q Отчёт об исчерпанных ключах Сообщает количество ключей Gemini API, превысивших дневную квоту, и время их сброса.
Alt + M Аудит маршрутизации Сообщает модели ИИ, выбранные в расширенной маршрутизации.
Вверх / Вниз Навигация по быстрым настройкам Перемещается между категориями быстрых настроек (Провайдер, Модель и т. д.) в слое.
Влево / Вправо Изменение быстрой настройки Изменяет значение выбранной быстрой настройки.

3. Чат и история

Окна чата и диалог истории работают во всех функциях, поэтому вы можете просматривать беседы и продолжать с того места, где остановились.

3.1 Сочетания клавиш в окне чата

Когда открыто окно чата (Прямой чат, чат документа, редактирование и т. д.), вы можете просматривать беседу с помощью:
- Alt + Вниз: Читает следующее сообщение.
- Alt + Вверх: Читает предыдущее сообщение.
- Alt + C: Копирует текущее сообщение.

3.2 История (Control + H)

Нажмите Control + H в слое команд, чтобы открыть диалог «История» с вашими прошлыми чатами и документами, с возможностью фильтрации по типу (Все / Чаты / Документы). Откройте чат, чтобы продолжить разговор — включая прикреплённые файлы, которые автоматически прикрепляются заново — или откройте документ и продолжайте чтение. Нажмите Delete на любом элементе, чтобы удалить его, или Очистить всё, чтобы очистить весь список.

4. AI Operator — Автономное управление компьютером

AI Operator превращает Vision Assistant Pro из пассивного читателя в активного помощника, который может взаимодействовать с вашим компьютером от вашего имени. Вы можете попросить его описать экран, ответить на вопросы о том, что он видит, или даже взять управление на себя — нажимать кнопки, перетаскивать элементы, вводить текст и перемещаться по приложениям с помощью команд на естественном языке.

В чём самое большое преимущество? Он отлично работает в совершенно недоступном программном обеспечении. Если вы застряли в пользовательском приложении, на удалённом рабочем столе или на веб-сайте, где ваш скринридер полностью замолкает, оператору это не мешает. Поскольку он «видит» экран визуально, он может находить, читать и взаимодействовать с элементами, у которых нет никаких меток доступности.

Как это работает

  1. Нажмите NVDA + Shift + V, затем нажмите Shift + A (или используйте прямое сочетание клавиш), чтобы открыть диалог AI Operator.
  2. Введите на простом языке, что вы хотите сделать (например, «Нажми кнопку Сохранить», «Что говорит сообщение об ошибке?» или «Переименуй файл в final.pdf»).
  3. ИИ проанализирует ваш экран, определит соответствующие элементы и выполнит действие или предоставит ответ. Если задача требует нескольких шагов, оператор будет продолжать работу до завершения.
  4. Нажмите Shift + A снова в любой момент, чтобы немедленно прервать выполняющуюся операцию.

Поддерживаемые действия

Оператор понимает широкий спектр команд:
- Описание и ответ: «Опиши макет экрана» или «Что говорит сообщение об ошибке?»
- Нажатие: «Нажми кнопку Сохранить»
- Правый клик: «Щёлкни правой кнопкой по файлу»
- Двойной клик: «Дважды щёлкни по документу»
- Перетаскивание: «Перетащи документ в папку Архив»
- Ввод текста: «Введи 'Привет, мир!' в поле поиска»
- Прокрутка: «Прокрути вниз три раза»
- Нажатие клавиш: «Нажми Enter», «Нажми Tab», «Нажми Escape»
- Многошаговые задачи: «Открой Проводник, найди отчёт и переименуй его в final.pdf»

Важные примечания

5. Анализ видео и аудиодескрипция

Примечание: Функции анализа видео и аудиодескрипции строго поддерживаются провайдером Google Gemini. Убедитесь, что ваш активный провайдер в настройках дополнения установлен на Google Gemini.

Vision Assistant Pro представляет мощные возможности обработки видео, разработанные специально для незрячих пользователей. Он может анализировать как онлайн-видео, так и локальные записи экрана, чтобы предоставлять детальные визуальные описания и генерировать профессиональные сценарии аудиодескрипции (SRT).

5.1 Локальная запись экрана (Control + V)

Если вы столкнулись с немым видео, анимацией или руководством на экране, вы можете захватить его напрямую:
1. Нажмите NVDA + Shift + V, чтобы войти в слой команд, затем нажмите Control + V.
2. Дополнение будет незаметно записывать ваш экран в фоновом режиме.
3. Нажмите Control + V снова, чтобы остановить запись.
4. Затем ИИ проанализирует записанный видеосегмент и предоставит детальное описание сцены, персонажей и действий.

5.2 Анализ видео (Shift + V)

Вы можете анализировать как локальные видеофайлы, так и онлайн-видео. Просто выберите локальный видеофайл в Проводнике Windows или скопируйте ссылку на онлайн-видео в буфер обмена. Вы также можете нажать Shift + V в любом месте (например, внутри медиаплеера), чтобы открыть диалог, где можно выбрать видеофайл или вставить URL вручную.
- Поддерживаемые онлайн-платформы: YouTube, Instagram, TikTok и Twitter (X).
- ИИ автоматически обнаружит локальный файл или URL, обработает видео и предоставит комплексное визуальное описание и аудиосводку.

5.3 Генерация аудиодескрипции (SRT)

Для более структурированного восприятия дополнение может генерировать профессиональные сценарии аудиодескрипции в стандартном формате SubRip (SRT).
- Умная расстановка по паузам: ИИ прослушивает аудиодорожку и специально привязывает свои визуальные описания к естественным паузам и тишине, чтобы интеллектуально минимизировать перекрытие с диалогами.
- Отслеживание персонажей: Движок выполняет предварительный проход для извлечения различных персонажей на основе неизменных черт лица. Он создаёт глобальный словарь для точного отслеживания и маркировки персонажей в разных сценах без путаницы.
- Дословный OCR текста: Любой текст, появляющийся на экране (вывески, телефоны, титры), строго цитируется дословно.
- Как использовать: Чтобы прослушать сгенерированные субтитры, поместите файл .srt в ту же папку, что и видеофайл, и дайте ему точно такое же имя. Затем настройте ваш медиаплеер (например, VLC или PotPlayer) так, чтобы он направлял текст субтитров непосредственно вашему скринридеру или TTS-движку во время воспроизведения.

5.4 Синхронизированное звуковое повествование (экспорт MP3)

Помимо создания текстовых SRT-файлов, дополнение функционирует как полноценный инструмент производства аудиодескрипции, синтезируя описания в речь и смешивая их с видео. Теперь вы можете выбрать Gemini Live TTS в качестве голосового движка, который использует API Gemini Live для генерации высокореалистичного, неограниченного голосового повествования. При генерации MP3 для локальных видеофайлов доступны несколько режимов смешивания:
- Стандартная AD (Смешивание голоса): Повествование накладывается непосредственно на аудио видео. Вам будет предложено применить Audio Ducking (снижение громкости фонового звука во время описаний), чтобы обеспечить чёткость повествования.
- Расширенная AD (Пауза аудио): Движок приостанавливает исходное аудио видео во время описаний, гарантируя, что вы не пропустите ни единого слова оригинального диалога или повествования ИИ.
- Видео с YouTube: Для источников YouTube (которые не загружаются локально) экспорт MP3 будет строго содержать синхронизированную голосовую дорожку ИИ без фонового аудио видео.

6. Транскрипция и озвучивание медиа (M)

Аудиотранскриптор был полностью перестроен для поддержки как аудио-, так и видеофайлов (MP3, WAV, MP4, MKV и т. д.). Нажмите M в слое команд, чтобы выбрать медиафайл и выбрать один из 3 режимов работы:
1. Транскрибировать (на исходном языке): Точно транскрибирует произнесённую речь на исходном языке.
2. Транскрибировать и перевести (на целевой язык): Транскрибирует речь и переводит её на настроенный целевой язык.
3. Озвучить и перевести (на целевой язык) (только Gemini): Мощная новая функция, которая транскрибирует речь, переводит её на целевой язык и синтезирует озвученную аудиодорожку с помощью TTS-движка дополнения.

7. Расширенное чтение документов и изображений

Чтение документов превращает ваши документы в чистый читаемый текст — так что вы можете читать, переводить и слушать всё, от сканированной книги до стопки фотографий. Он обрабатывает многостраничные PDF-файлы, сложные изображения, форматы iPhone HEIC и даже текстовые (.txt) и HTML-файлы (.html, .htm), которые открываются мгновенно без OCR или обработки ИИ. Выберите несколько файлов одновременно, и они будут объединены в один непрерывный документ в порядке страниц. Доступны три движка OCR — Chrome (Быстрый), ИИ (Расширенный) для лучшего сохранения макета и Нет (извлечение текстового слоя) для поисковых PDF — выбирается в Настройках → Чтение документов.

Как это работает

  1. Нажмите NVDA + Shift + V, затем D, чтобы открыть Чтение документов — или сначала выделите файл в Проводнике, затем нажмите D / F, чтобы полностью пропустить диалог выбора файла.
  2. Выберите один или несколько PDF-файлов или изображений. Дополнение сканирует их и объявляет общее количество страниц.
  3. В диалоге «Параметры» выберите диапазон страниц (С/По). Вы также можете отметить Перевести вывод и выбрать целевой язык или включить Описывать изображения в тексте при OCR.
  4. Извлечение текста начинается в фоновом режиме пакетами. Вы можете закрыть окно в любое время и продолжить позже — ничего не теряется.
  5. Когда страницы готовы, читайте их в просмотрщике: перемещайтесь между страницами, переходите на любую страницу, задавайте вопросы ИИ, сохраняйте текст или генерируйте аудиоповествование.

7.1 Пакетная обработка и возобновление

Вам не нужно читать огромный документ за один раз. Выберите диапазон страниц (например, 1-20) или оставьте значения по умолчанию для обработки всего документа, и ИИ извлечёт все страницы в фоновом режиме. Если NVDA зависнет или вы прервёте сканирование, дополнение запомнит ваш прогресс и предложит Возобновить именно с того места, где вы остановились — даже после перезапусков. Завершённые документы также кэшируются, поэтому повторное открытие их (из Недавних документов или через D) загружает текст мгновенно без повторного запуска OCR, если только исходные файлы не изменились.

7.2 Умное действие с файлом

Вам не всегда нужно сначала открывать документ. В Проводнике Windows просто выделите PDF-файл, изображение или текстовый/HTML-файл и нажмите D (Чтение документов) — или выделите PDF-файл или изображение и нажмите F (Умное действие с файлом) — внутри слоя команд. Дополнение мгновенно пропускает диалог выбора файла и начинает обработку выделенного файла. Выбор нескольких файлов одновременно обрабатывает их вместе как один документ.

7.3 Элементы управления просмотрщиком документов и сочетания клавиш

Когда окно просмотрщика документов открыто, вы можете использовать следующие функции:

Сочетания клавиш

Кнопки и элементы управления

7.4 Недавние документы (D)

Нажатие D в слое команд сначала показывает недавно прочитанные документы. Выберите один, чтобы продолжить со страницы, на которой вы остановились — даже если OCR уже завершён — или нажмите Открыть файл... (Ctrl + O), чтобы выбрать файл как обычно.

8. Семантическая разметка ИИ и UI Explorer

Застряли в приложении с повсеместными «неподписанными кнопками»? Движок семантической разметки ИИ решает эту проблему навсегда.

8.1 Постоянная разметка объектов (L)

Сфокусируйте ваш скринридер на неподписанной графике или кнопке и нажмите L в слое команд. ИИ визуально рассмотрит кнопку, определит её функцию и применит постоянную метку.
В отличие от старых инструментов разметки скринридеров, это дополнение использует продвинутую гибридную систему «подписи объекта» (AutomationId/ControlID). Ваши пользовательские метки будут сохраняться при изменении размера окна, переключении мониторов и обновлениях приложений!

8.2 Полное сканирование приложения (Shift + L)

Нажмите Shift + L, чтобы сканировать всё активное окно сразу. ИИ найдёт все неподписанные элементы и разумно назовёт их за один раз. Позже вы можете управлять, переименовывать или массово удалять эти метки из встроенного менеджера меток.

8.3 UI Explorer (E)

Нужно взаимодействовать с элементом без ручной навигации к нему? Нажмите E, чтобы активировать UI Explorer. ИИ просканирует экран и сгенерирует доступный список всех кликабельных элементов (игнорируя системный шум, такой как панели задач). Выберите элемент из списка, и дополнение мгновенно нажмёт его за вас.

9. Живой голосовой ассистент

Живой ассистент превращает Vision Assistant Pro в совместного пилота в реальном времени.
(Примечание: Эта функция доступна только для Google Gemini и совместимых с Gemini пользовательских провайдеров).

10. Пользовательские запросы и переменные

Вы можете управлять запросами в Настройках > Запросы > Управление запросами....

Сочетания клавиш для пользовательских запросов

Назначьте любому пользовательскому запросу собственное сочетание клавиш прямо в менеджере запросов и запускайте его мгновенно с вашим текущим выделением или контекстом:
- Одиночная клавиша (например, 1, p или F3): Работает внутри слоя команд, а также глобально как NVDA + Shift + клавиша.
- Комбинация клавиш (например, Control + Shift + 1, Alt + P или Insert + 1): Работает глобально самостоятельно.

Поддерживаемые переменные

11. Примеры использования в реальной жизни (Какую функцию мне использовать?)

Vision Assistant Pro содержит множество продвинутых инструментов. Вот несколько распространённых сценариев, которые помогут вам выбрать правильный:


Примечание: Для всех функций ИИ требуется активное подключение к интернету. Многостраничные документы обрабатываются автоматически.

12. Поддержка и сообщество

Будьте в курсе последних новостей, функций и релизов:
- Telegram-канал: t.me/VisionAssistantPro
- GitHub Issues: Для сообщений об ошибках и запросов новых функций.

Сообщение об ошибках и журналы

При открытии задачи на GitHub или обращении за поддержкой, пожалуйста, указывайте информацию о вашем активном ИИ-провайдере, модели и версии NVDA. Если у вас возникают проблемы с подключением или неожиданные сбои, включите отдельный файл журнала в Настройках > Дополнительно, воспроизведите проблему и приложите файл vision_assistant.log, чтобы помочь нам быстрее решить проблему.

13. Сторонники проекта

Искренняя благодарность членам нашего сообщества, которые поддерживают непрерывную разработку и сопровождение этого проекта своими щедрыми финансовыми взносами:

Если вы хотите поддержать проект финансово и увидеть своё имя здесь, вы можете найти опцию «Пожертвовать» в меню «Сервис» NVDA (подменю Vision Assistant) или во время процесса настройки после установки.


Изменения для 2026.09.01

Изменения для 2026.08.06

Изменения для 2026.07.15

Изменения для 7.0.0

Изменения для 6.5.0

Изменения для 6.1.2

Изменения для 6.1.1

Изменения для 6.1.0

Изменения для 6.0

Изменения для 5.6

Изменения для 5.5.2

Изменения для 5.5 (Обновление автоматизации)

Изменения для 5.0

Изменения для 4.6

Изменения для 4.5

Изменения для 4.0.3

Изменения для 4.0.1

Изменения для 3.6.0

Изменения для 3.5.0

Изменения для 3.1.0

Изменения для 3.0

Изменения для 2.9

Изменения для 2.8

Изменения для 2.7

Изменения для 2.6

Изменения для 2.5

Изменения для 2.1.1

Изменения для 2.1

Изменения для 2.0

Изменения для 1.5

Изменения для 1.0