Документация по Vision Assistant Pro

Всего загрузок: 61,000+

Vision Assistant Pro — это продвинутый мультимодальный ИИ-ассистент для NVDA. Он использует лучшие в мире ИИ-движки для обеспечения интеллектуального чтения с экрана, перевода, голосового ввода и анализа документов.

Это дополнение было выпущено в честь Международного дня инвалидов.

1. Установка и настройка

Перейдите в Меню NVDA > Параметры > Настройки > Vision Assistant Pro. Диалог настроек организован в 8 доступных вкладок: Подключение, Поведение ИИ, Языки перевода, Чтение документов, Видео, CAPTCHA, Подсказки и Дополнительно.

1.1 Вкладка "Подключение"

1.2 Вкладка "Поведение ИИ"

1.3 Вкладка "Языки перевода"

1.4 Вкладка "Чтение документов"

1.5 Вкладка "Видео"

1.6 Вкладка "CAPTCHA"

1.7 Вкладка "Подсказки"

1.8 Вкладка "Дополнительно" и глобальное журналирование

Перейдите на вкладку Дополнительно, чтобы настроить глобальное журналирование дополнения:
- Включить отдельный файл журнала: Включает запись всех операционных событий, трафика API и ошибок во всех модулях дополнения в отдельный файл (vision_assistant.log).
- Уровень журналирования: Выберите уровень детализации: Отладка (Все детали), Информация (Общая информация), Предупреждение (Только предупреждения) или Ошибка (Только ошибки).
- Хранить журналы: Установите период автоматического хранения для очистки старых записей (от 1 часа до 90 дней).
- Управление журналами: Используйте кнопки Открыть файл журнала, Открыть папку журнала или Очистить файл журнала для просмотра или очистки данных журнала без перезапуска NVDA и без вмешательства в стандартные журналы NVDA.

2. Слой команд и горячие клавиши

Во избежание конфликтов клавиатуры это дополнение использует Слой команд.
1. Нажмите NVDA + Shift + V (Главная клавиша), чтобы активировать слой (вы услышите звуковой сигнал).
2. Отпустите клавиши, затем нажмите одну из следующих клавиш:

Клавиша Функция Описание
Shift + A Оператор ИИ Автономное управление: Дайте ИИ задание на экране. Повторное нажатие немедленно прерывает активные операции.
E UI Explorer Интерактивный клик: Идентифицирует и кликает элементы интерфейса в любом приложении.
T Умный переводчик Переводит текст под курсором навигатора или выделенный текст.
Shift + T Переводчик буфера обмена Переводит содержимое буфера обмена.
R Редактор текста Суммирует, исправляет грамматику, объясняет или выполняет Пользовательские подсказки.
V Зрение объекта Описывает текущий объект навигатора.
O Зрение полного экрана Анализирует весь экран, его макет и содержимое.
Shift + V Анализ видео Анализирует локальные видеофайлы или онлайн-видео с YouTube, Instagram, TikTok или Twitter (X).
Control + V Локальная запись видео Записывает видео экрана без звука и анализирует действия и макет.
D Чтение документов Расширенное чтение PDF и изображений с выбором диапазона страниц.
F Умное действие с файлом Контекстно-зависимое распознавание выбранного изображения, PDF или TIFF-файла.
M Транскрипция и дубляж медиа Транскрибирует или дублирует аудио/видео файлы (MP3, WAV, MP4 и др.) на целевой язык.
C Решение CAPTCHA Захватывает и решает CAPTCHA.
Shift + C Прямой чат Открывает текстовый интерфейс для прямого общения с ИИ.
S Умный диктофон Преобразует речь в текст. Нажмите для начала записи, еще раз для остановки/ввода.
Control+T Голосовой перевод Транскрибирует, переводит и вводит результат на основе языковых настроек.
Control+L Живой ассистент Совместный пилот в реальном времени (только Gemini): Начинает или завершает голосовую беседу и анализ экрана с ИИ-ассистентом.
I Отчет о статусе Сообщает текущий прогресс (например, "Сканирование...", "Ожидание").
L Маркировка объекта Семантическая ИИ-маркировка: Постоянно маркирует текущий элемент/иконку.
Shift + L Управление/сканирование меток Открывает Менеджер меток (если они есть) или сканирует приложение на наличие безымянных элементов.
U Проверка обновлений Вручную проверить GitHub на наличие новой версии дополнения.
Space Повтор последнего результата Показывает последний ответ ИИ в диалоге чата для просмотра или продолжения.
H Справка по командам Отображает список всех доступных горячих клавиш.
Alt + S Настройки Открывает диалог настроек Vision Assistant Pro.
Alt + Q Отчет об исчерпанных ключах Сообщает количество ключей Gemini API, превысивших дневную квоту, и время их сброса.
Alt + M Аудит маршрутизации Сообщает модели ИИ, выбранные в расширенной маршрутизации.
Вверх / Вниз Навигация по быстрым настройкам Перемещает между категориями быстрых настроек (Провайдер, Модель и т.д.) в слое.
Влево / Вправо Изменение быстрой настройки Изменяет значение выбранной быстрой настройки.

3. Оператор ИИ — Автономное управление компьютером

Оператор ИИ превращает Vision Assistant Pro из пассивного считывателя в активного помощника, который может взаимодействовать с вашим компьютером от вашего имени. Вы можете попросить его описать экран, ответить на вопросы о том, что он видит, или даже взять управление на себя — нажимать кнопки, перетаскивать элементы, вводить текст и перемещаться по приложениям с помощью команд на естественном языке.

Самое большое преимущество? Он отлично работает в полностью недоступном программном обеспечении. Если вы застряли в пользовательском приложении, на удаленном рабочем столе или на веб-сайте, где ваш экранный диктор полностью молчит, оператору это не мешает. Поскольку он "видит" экран визуально, он может находить, читать и взаимодействовать с элементами, у которых нет меток доступности.

Как это работает

  1. Нажмите NVDA + Shift + V, затем нажмите Shift + A (или используйте прямую комбинацию), чтобы открыть диалог Оператора ИИ.
  2. Введите на естественном языке, что вы хотите сделать (например, "Нажми кнопку Сохранить", "Что говорит сообщение об ошибке?" или "Переименуй файл в final.pdf").
  3. ИИ проанализирует ваш экран, определит соответствующие элементы и выполнит действие или предоставит ответ. Если задача требует нескольких шагов, оператор будет продолжать работу до завершения.
  4. Нажмите Shift + A в любой момент, чтобы немедленно прервать выполняющуюся операцию.

Поддерживаемые действия

Оператор понимает широкий спектр команд:
- Описать и ответить: "Опиши макет экрана" или "Что говорит сообщение об ошибке?"
- Клик: "Нажми кнопку Сохранить"
- Правый клик: "Кликни правой кнопкой по файлу"
- Двойной клик: "Дважды кликни по документу"
- Перетаскивание: "Перетащи документ в папку Архив"
- Ввод текста: "Введи 'Привет, мир' в поле поиска"
- Прокрутка: "Прокрути вниз три раза"
- Нажатие клавиш: "Нажми Enter", "Нажми Tab", "Нажми Escape"
- Многошаговые задачи: "Открой Проводник, найди отчет и переименуй его в final.pdf"

Важные замечания

4. Анализ видео и аудиодескрипция

Примечание: Функции анализа видео и аудиодескрипции строго работают на Google Gemini. Убедитесь, что ваш активный провайдер в настройках дополнения — Google Gemini.

Vision Assistant Pro представляет мощные возможности обработки видео, разработанные специально для незрячих пользователей. Он может анализировать как онлайн-видео, так и локальные записи экрана, предоставляя подробные визуальные описания и создавая профессиональные сценарии аудиодескрипции (SRT).

4.1 Локальная запись экрана (Control + V)

Если вы встретили немое видео, анимацию или руководство на экране, вы можете записать его напрямую:
1. Нажмите NVDA + Shift + V, чтобы войти в слой команд, затем нажмите Control + V.
2. Дополнение начнет незаметно записывать ваш экран в фоновом режиме.
3. Нажмите Control + V снова, чтобы остановить запись.
4. ИИ проанализирует записанный видеосегмент и предоставит подробное описание сцены, персонажей и действий.

4.2 Анализ видео (Shift + V)

Вы можете анализировать как локальные видеофайлы, так и онлайн-видео. Просто выберите локальный видеофайл в Проводнике Windows или скопируйте ссылку на онлайн-видео в буфер обмена. Вы также можете нажать Shift + V в любом месте (например, внутри медиаплеера), чтобы открыть диалог, где можно выбрать видеофайл или вставить URL вручную.
- Поддерживаемые онлайн-платформы: YouTube, Instagram, TikTok и Twitter (X).
- ИИ автоматически определит локальный файл или URL, обработает видео и предоставит полное визуальное описание и аудиосводку.

4.3 Генерация аудиодескрипции (SRT)

Для более структурированного опыта дополнение может генерировать профессиональные сценарии аудиодескрипции в стандартном формате SubRip (SRT).
- Умное определение пауз: ИИ прослушивает аудиодорожку и специально привязывает свои визуальные описания к естественным паузам и тихим промежуткам, чтобы интеллектуально минимизировать наложение на диалоги.
- Отслеживание персонажей: Движок выполняет предварительный проход для извлечения отдельных персонажей на основе неизменных черт лица. Он создает глобальный словарь для точного отслеживания и маркировки персонажей в разных сценах без путаницы.
- Дословный OCR текста: Любой текст, появляющийся на экране (вывески, телефоны, титры), строго цитируется дословно.
- Как использовать: Чтобы прослушать сгенерированные субтитры, просто поместите файл .srt в ту же папку, что и ваш видеофайл, и дайте ему точно такое же имя. Затем настройте ваш медиаплеер (например, VLC или PotPlayer) для отправки текста субтитров непосредственно в ваш экранный диктор или движок TTS во время воспроизведения.

4.4 Синхронизированное аудиоозвучивание (Экспорт MP3)

Помимо создания текстовых SRT-файлов, дополнение работает как полноценный инструмент производства аудиодескрипции, синтезируя описания в речь и смешивая их с видео. Теперь вы можете выбрать Gemini Live TTS в качестве голосового движка, который использует API Gemini Live для создания высокореалистичной, неограниченной голосовой озвучки. При генерации MP3 для локальных видеофайлов доступны несколько режимов смешивания:
- Стандартная AD (Смешивание голоса): Озвучка накладывается непосредственно поверх аудио видео. Вам будет предложено применить Аудио-дакинг (снижение громкости фона во время описаний), чтобы обеспечить четкость озвучки.
- Расширенная AD (Пауза аудио): Движок приостанавливает исходное аудио видео во время описаний, гарантируя, что вы не пропустите ни слова из оригинального диалога или озвучки ИИ.
- Видео YouTube: Для источников YouTube (которые не загружаются локально) экспорт MP3 будет строго содержать синхронизированную голосовую дорожку ИИ без фонового аудио видео.

5. Транскрипция и дубляж медиа (M)

Аудио-транскрибатор был полностью перестроен для поддержки как аудио, так и видеофайлов (MP3, WAV, MP4, MKV и др.). Нажмите M в слое команд, чтобы выбрать медиафайл и выбрать один из 3 режимов работы:
1. Транскрибировать (на исходном языке): Точно транскрибирует произнесенную речь на ее исходном языке.
2. Транскрибировать и перевести (на целевой язык): Транскрибирует речь и переводит ее на ваш настроенный целевой язык.
3. Озвучить и перевести (на целевой язык) (Только Gemini): Мощная новая функция, которая транскрибирует речь, переводит ее на целевой язык и синтезирует озвученный аудиодубляж с использованием TTS-движка дополнения.

6. Расширенное чтение документов и изображений

Vision Assistant Pro включает высокооптимизированное средство чтения документов, предназначенное для многостраничных PDF-файлов, сложных изображений и даже форматов HEIC с iPhone.

6.1 Пакетная обработка и возобновление

Вам не нужно читать весь большой документ за один раз. Введите диапазон страниц (например, 1-20), и ИИ обработает все страницы в фоновом режиме. Если NVDA зависнет или вы прервете сканирование, дополнение запомнит ваш прогресс и предложит Возобновить именно с того места, где вы остановились!

6.2 Умное действие с файлом

Вам не всегда нужно сначала открывать документ. В Проводнике Windows просто выделите PDF или изображение и нажмите D (Чтение документов) или F (Умное действие с файлом) в слое команд. Дополнение мгновенно обойдет диалог выбора файла и начнет обрабатывать выделенный файл.

6.3 Горячие клавиши просмотра документов

Когда окно чтения документов открыто, вы можете использовать следующие комбинации клавиш:
- Ctrl + PageDown: Перейти на следующую страницу.
- Ctrl + PageUp: Перейти на предыдущую страницу.
- Alt + A: Открыть диалог чата, чтобы задать вопросы о документе.
- Alt + R: Принудительное Повторное сканирование с ИИ с использованием вашего активного провайдера.
- Alt + G: Сгенерировать и сохранить высококачественный аудиофайл (WAV/MP3). (Скрыто, если провайдер не поддерживает TTS).
- Alt + S / Ctrl + S: Сохранить извлеченный текст как файл TXT или HTML.

7. Семантическая ИИ-маркировка и UI Explorer

Застряли в приложении, где везде "неподписанная кнопка"? Движок семантической ИИ-маркировки решает эту проблему навсегда.

7.1 Постоянная маркировка объектов (L)

Сфокусируйте ваш экранный диктор на неподписанной графике или кнопке и нажмите L в слое команд. ИИ посмотрит на кнопку визуально, определит ее функцию и применит постоянную метку.
В отличие от старых инструментов маркировки экранных дикторов, это дополнение использует продвинутую гибридную систему "Подписи объектов" (AutomationId/ControlID). Ваши пользовательские метки переживут изменение размера окна, переключение мониторов и обновления приложений!

7.2 Полное сканирование приложения (Shift + L)

Нажмите Shift + L, чтобы сканировать все активное окно сразу. ИИ найдет все неподписанные элементы и интеллектуально назовет их за один раз. Позже вы можете управлять, переименовывать или массово удалять эти метки из встроенного Менеджера меток.

7.3 UI Explorer (E)

Нужно взаимодействовать с элементом, не перемещаясь к нему вручную? Нажмите E, чтобы активировать UI Explorer. ИИ просканирует экран и сгенерирует доступный список всех кликабельных элементов (игнорируя системный шум, такой как панели задач). Выберите элемент из списка, и дополнение мгновенно кликнет по нему за вас.

8. Живой голосовой ассистент

Живой ассистент превращает Vision Assistant Pro в интерактивного помощника в реальном времени.
(Примечание: Эта функция доступна только для Google Gemini и совместимых с Gemini пользовательских провайдеров).

9. Пользовательские подсказки и переменные

Вы можете управлять подсказками в Настройки > Подсказки > Управление подсказками....

Поддерживаемые переменные

10. Примеры использования в реальной жизни (Какую функцию мне использовать?)

Vision Assistant Pro переполнен продвинутыми инструментами. Вот несколько распространенных сценариев, которые помогут вам выбрать правильный:


Примечание: Для всех функций ИИ требуется активное подключение к Интернету. Многостраничные документы обрабатываются автоматически.

11. Поддержка и сообщество

Будьте в курсе последних новостей, функций и релизов:
- Telegram-канал: t.me/VisionAssistantPro
- GitHub Issues: Для сообщений об ошибках и запросов новых функций.

Сообщение об ошибках и журналы

Когда вы открываете issue на GitHub или обращаетесь за поддержкой, пожалуйста, укажите вашего активного ИИ-провайдера, модель и версию NVDA. Если у вас возникают проблемы с подключением или неожиданные сбои, включите отдельный файл журнала в Настройки > Дополнительно, воспроизведите проблему и прикрепите ваш файл vision_assistant.log, чтобы помочь нам решить проблему быстрее.

12. Сторонники проекта

Искренняя благодарность членам нашего сообщества, которые поддерживают непрерывную разработку и обслуживание этого проекта своими щедрыми финансовыми вкладами:

Если вы хотите поддержать проект финансово и увидеть свое имя здесь, вы можете найти опцию Пожертвовать в меню Сервисы NVDA (подменю Vision Assistant) или во время процесса настройки после установки.


Изменения для 2026.08.06

Изменения для 2026.07.15

Изменения для 7.0.0

Изменения для 6.5.0

Изменения для 6.1.2

Изменения для 6.1.1

Изменения для 6.1.0

Изменения для 6.0

Изменения для 5.6

Изменения для 5.5.2

Изменения для 5.5 (Обновление автоматизации)

Изменения для 5.0

Изменения для 4.6

Изменения для 4.5

Изменения для 4.0.3

Изменения для 4.0.1

Изменения для 3.6.0

Изменения для 3.5.0

Изменения для 3.1.0

Изменения для 3.0

Изменения для 2.9

Изменения для 2.8

Изменения для 2.7

Изменения для 2.6

Изменения для 2.5

Изменения для 2.1.1

Изменения для 2.1

Изменения для 2.0

Изменения для 1.5

Изменения для 1.0