Документация по Vision Assistant Pro
Всего загрузок: 62 863
Vision Assistant Pro — это продвинутый мультимодальный ИИ-ассистент для NVDA. Он использует передовые ИИ-движки для интеллектуального чтения экрана, перевода, голосового диктования и анализа документов.
Это дополнение было выпущено для сообщества в честь Международного дня инвалидов.
1. Настройка и конфигурация
Перейдите в Меню NVDA > Параметры > Настройки > Vision Assistant Pro. Диалог настроек организован в 9 доступных вкладок: Подключение, Живой ассистент, Поведение ИИ, Языки перевода, Чтение документов, Видео, CAPTCHA, Запросы и Дополнительно.
1.1 Вкладка «Подключение»
- Провайдер: Выберите предпочитаемый ИИ-сервис. Поддерживаемые провайдеры включают Google Gemini, OpenAI, Mistral, Groq, MiniMax и Custom (серверы, совместимые с OpenAI, такие как Ollama, LM Studio, Jan.ai или KoboldCPP).
- Ключ API: Введите один или несколько ключей API (разделённых запятыми или переводами строк) для автоматической ротации.
- Получить модели: Нажмите эту кнопку после ввода ключа API, чтобы загрузить последний доступный список моделей от провайдера.
- Модель ИИ: Выберите основную модель для общего чата и анализа.
- Настройки пользовательского провайдера: Настройте локальные или пользовательские конечные точки. Включает Настройку локального ИИ (установка в один клик для Ollama, LM Studio, Jan.ai или KoboldCPP) и Расширенную настройку конечных точек.
- Расширенная маршрутизация моделей (для конкретных задач): При необходимости выберите специализированные модели из выпадающих списков для задач OCR, STT, TTS, AI Operator, Video и Live Assistant.
- Параметры подключения и вывода: Настройте URL прокси, проверку обновлений при запуске, очистку Markdown в чате, копирование ответов ИИ в буфер обмена и Прямой вывод (без окна чата).
1.2 Вкладка «Живой ассистент»
- Живой ассистент: Прямой вывод (без окна): Запустите Живой ассистент без окна диалога; откройте его позже клавишей возврата последнего результата (
Пробел).
- Режим «Нажми и говори»: Включите режим «нажми и говори». Когда он включён, ваш микрофон передаёт аудио только при удержании назначенной клавиши.
- Клавиша режима «Нажми и говори»: Нажмите клавиши, чтобы записать сочетание (например,
F12 или Ctrl+F12) — вы даже можете назначить одиночный модификатор, например Левый Ctrl. Удерживайте клавишу, чтобы говорить, и отпустите, чтобы завершить; короткий звуковой сигнал подтверждает каждое нажатие и отпускание.
Примечание: Эта вкладка появляется только тогда, когда Google Gemini (или совместимый с Gemini пользовательский провайдер) является вашим активным провайдером.
1.3 Вкладка «Поведение ИИ»
- Креативность (Температура): Управляет случайностью и креативностью ИИ (от 0,0 до 2,0). Более низкие значения дают более детерминированные и точные результаты перевода и OCR.
1.4 Вкладка «Языки перевода»
- Исходный язык: Выберите язык ввода по умолчанию.
- Целевой язык: Выберите основной целевой язык перевода.
- Язык ответов ИИ: Выберите язык для общих ответов ИИ.
- Умное переключение: Автоматически меняет местами исходный и целевой языки на основе обнаруженного ввода.
1.5 Вкладка «Чтение документов»
- Движок OCR: Выберите между Chrome (Быстрый) для быстрых результатов или ИИ (Расширенный) для лучшего сохранения макета.
- Размер пакета OCR: Укажите количество страниц на запрос (установите 0 для обработки одним запросом).
- Описывать изображения в тексте: Включите встроенное описание изображений при извлечении текста документа.
- Экспортировать номера страниц: Включите номера страниц и разделители в выводах многостраничных документов.
- Голос TTS: Выберите стиль голоса по умолчанию для генерации аудио.
1.6 Вкладка «Видео»
- Размер фрагмента видео: Длительность сегмента в минутах для генерации аудиодескрипции (установите 0 для обработки всего файла).
- Добавить список персонажей: Опция для добавления словаря персонажей в качестве первой записи субтитров.
- Добавить отказ от ответственности ИИ: Опция для вставки отказа от ответственности ИИ в начале SRT-субтитров видео.
1.7 Вкладка «CAPTCHA»
- Включить решение визуальных CAPTCHA: Включите автоматическое решение визуальных задач (hCaptcha, reCAPTCHA).
- Метод текстовой CAPTCHA: Выберите между захватом Объекта навигатора или Полного экрана.
1.8 Вкладка «Запросы»
- Управление запросами: Открывает специальный диалог для настройки системных запросов по умолчанию или создания, редактирования, изменения порядка и предпросмотра пользовательских запросов с динамическими переменными (например,
[selection], [screen_fg_obj]).
- Сочетания клавиш для пользовательских запросов: Назначьте отдельную клавишу любому пользовательскому запросу прямо в менеджере запросов. Нажмите клавиши, чтобы записать их — одиночные клавиши работают внутри слоя команд (и глобально как
NVDA + Shift + клавиша), а комбинации, такие как Control + Shift + 1, работают глобально самостоятельно.
1.9 Вкладка «Дополнительно» и глобальное ведение журнала
Перейдите на вкладку «Дополнительно», чтобы настроить глобальное ведение журнала дополнения:
- Включить отдельный файл журнала: Включает запись всех операционных событий, трафика API и ошибок во всех модулях дополнения в отдельный файл (vision_assistant.log).
- Уровень журнала: Выберите детализацию между Отладка (Все детали), Информация (Общая информация), Предупреждение (Только предупреждения) и Ошибка (Только ошибки).
- Хранить журналы: Установите автоматический срок хранения для автоматической очистки старых записей журнала (от 1 часа до 90 дней).
- Управление журналом: Используйте Открыть файл журнала, Открыть папку журнала или Очистить файл журнала, чтобы просматривать или очищать данные журнала напрямую без перезапуска NVDA и без вмешательства в стандартные журналы NVDA.
1.10 Резервное копирование и восстановление настроек
Вкладка «Дополнительно» также включает раздел «Резервное копирование и восстановление»:
- Резервное копирование: Сохраняет вашу конфигурацию в один JSON-файл. При нажатии вы выбираете, что включить: Всё (настройки, пользовательские метки, прогресс OCR и историю) или Только настройки.
- Восстановление: Загружает ранее сохранённую резервную копию для восстановления вашей конфигурации и данных в любое время, на любом компьютере или после переустановки NVDA. Вам будет предложено подтвердить действие, поскольку восстановление заменяет все ваши текущие настройки и данные.
2. Слой команд и сочетания клавиш
Чтобы избежать конфликтов клавиатуры, это дополнение использует Слой команд.
1. Нажмите NVDA + Shift + V (главная клавиша), чтобы активировать слой (вы услышите звуковой сигнал).
2. Отпустите клавиши, затем нажмите одну из следующих одиночных клавиш:
| Клавиша |
Функция |
Описание |
| Shift + A |
AI Operator |
Автономная операция: Скажите ИИ выполнить задачу на экране. Повторное нажатие немедленно прерывает активные операции. |
| E |
UI Explorer |
Интерактивный клик: Определяет и нажимает элементы интерфейса в любом приложении. |
| T |
Умный переводчик |
Переводит текст под курсором навигатора или выделенный текст. |
| Shift + T |
Переводчик буфера обмена |
Переводит содержимое буфера обмена. |
| R |
Редактор текста |
Резюмирование, исправление грамматики, объяснение или выполнение пользовательских запросов. |
| V |
Объектное зрение |
Описывает текущий объект навигатора. |
| O |
Зрение полного экрана |
Анализирует весь макет и содержимое экрана. |
| Shift + V |
Анализ видео |
Анализирует локальные видеофайлы или онлайн-видео с YouTube, Instagram, TikTok или Twitter (X). |
| Control + V |
Локальная запись видео |
Записывает немое видео вашего экрана и анализирует действия и макет. |
| D |
Чтение документов |
Расширенное чтение PDF, изображений и текстовых/HTML-файлов с выбором диапазона страниц. |
| F |
Умное действие с файлом |
Контекстно-зависимое распознавание выбранного изображения, PDF или TIFF-файлов. |
| M |
Транскрипция и озвучивание медиа |
Транскрибирует или озвучивает аудио/видеофайлы (MP3, WAV, MP4 и т. д.) на ваш целевой язык. |
| C |
Решение CAPTCHA |
Захватывает и решает CAPTCHA. |
| Shift + C |
Прямой чат |
Открывает прямой текстовый интерфейс чата с ИИ. |
| S |
Умное диктование |
Преобразует речь в текст. Нажмите, чтобы начать запись, снова, чтобы остановить/ввести текст. |
| Control + T |
Голосовой перевод |
Транскрибирует, переводит и вводит результат на основе ваших языковых настроек. |
| Control + L |
Живой ассистент |
Совместный пилот в реальном времени (только Gemini): Начинает или завершает живую голосовую и экранную беседу с ИИ-ассистентом. |
| I |
Отчёт о статусе |
Объявляет текущий прогресс (например, «Сканирование...», «Ожидание»). |
| L |
Метка объекта |
Семантическая разметка ИИ: Навсегда маркирует текущий элемент/иконку в фокусе. |
| Shift + L |
Управление/сканирование меток |
Открывает менеджер меток (если они есть) или сканирует приложение на предмет безымянных элементов. |
| U |
Проверка обновлений |
Вручную проверяет GitHub на наличие последней версии дополнения. |
| Пробел |
Возврат последнего результата |
Показывает последний ответ ИИ в окне чата для просмотра или уточнения. |
| H |
Справка по командам |
Отображает список всех доступных сочетаний клавиш. |
| Control + H |
История |
Открывает диалог истории, в котором перечислены ваши прошлые чаты и документы, с фильтрацией по типу и опциями удаления/очистки. |
| Alt + S |
Настройки |
Открывает диалог настроек Vision Assistant Pro. |
| Alt + Q |
Отчёт об исчерпанных ключах |
Сообщает количество ключей Gemini API, превысивших дневную квоту, и время их сброса. |
| Alt + M |
Аудит маршрутизации |
Сообщает модели ИИ, выбранные в расширенной маршрутизации. |
| Вверх / Вниз |
Навигация по быстрым настройкам |
Перемещается между категориями быстрых настроек (Провайдер, Модель и т. д.) в слое. |
| Влево / Вправо |
Изменение быстрой настройки |
Изменяет значение выбранной быстрой настройки. |
3. Чат и история
Окна чата и диалог истории работают во всех функциях, поэтому вы можете просматривать беседы и продолжать с того места, где остановились.
3.1 Сочетания клавиш в окне чата
Когда открыто окно чата (Прямой чат, чат документа, редактирование и т. д.), вы можете просматривать беседу с помощью:
- Alt + Вниз: Читает следующее сообщение.
- Alt + Вверх: Читает предыдущее сообщение.
- Alt + C: Копирует текущее сообщение.
3.2 История (Control + H)
Нажмите Control + H в слое команд, чтобы открыть диалог «История» с вашими прошлыми чатами и документами, с возможностью фильтрации по типу (Все / Чаты / Документы). Откройте чат, чтобы продолжить разговор — включая прикреплённые файлы, которые автоматически прикрепляются заново — или откройте документ и продолжайте чтение. Нажмите Delete на любом элементе, чтобы удалить его, или Очистить всё, чтобы очистить весь список.
4. AI Operator — Автономное управление компьютером
AI Operator превращает Vision Assistant Pro из пассивного читателя в активного помощника, который может взаимодействовать с вашим компьютером от вашего имени. Вы можете попросить его описать экран, ответить на вопросы о том, что он видит, или даже взять управление на себя — нажимать кнопки, перетаскивать элементы, вводить текст и перемещаться по приложениям с помощью команд на естественном языке.
В чём самое большое преимущество? Он отлично работает в совершенно недоступном программном обеспечении. Если вы застряли в пользовательском приложении, на удалённом рабочем столе или на веб-сайте, где ваш скринридер полностью замолкает, оператору это не мешает. Поскольку он «видит» экран визуально, он может находить, читать и взаимодействовать с элементами, у которых нет никаких меток доступности.
Как это работает
- Нажмите NVDA + Shift + V, затем нажмите Shift + A (или используйте прямое сочетание клавиш), чтобы открыть диалог AI Operator.
- Введите на простом языке, что вы хотите сделать (например, «Нажми кнопку Сохранить», «Что говорит сообщение об ошибке?» или «Переименуй файл в final.pdf»).
- ИИ проанализирует ваш экран, определит соответствующие элементы и выполнит действие или предоставит ответ. Если задача требует нескольких шагов, оператор будет продолжать работу до завершения.
- Нажмите Shift + A снова в любой момент, чтобы немедленно прервать выполняющуюся операцию.
Поддерживаемые действия
Оператор понимает широкий спектр команд:
- Описание и ответ: «Опиши макет экрана» или «Что говорит сообщение об ошибке?»
- Нажатие: «Нажми кнопку Сохранить»
- Правый клик: «Щёлкни правой кнопкой по файлу»
- Двойной клик: «Дважды щёлкни по документу»
- Перетаскивание: «Перетащи документ в папку Архив»
- Ввод текста: «Введи 'Привет, мир!' в поле поиска»
- Прокрутка: «Прокрути вниз три раза»
- Нажатие клавиш: «Нажми Enter», «Нажми Tab», «Нажми Escape»
- Многошаговые задачи: «Открой Проводник, найди отчёт и переименуй его в final.pdf»
Важные примечания
- ⚠️ Предупреждение об использовании API: Поскольку оператору необходимо «видеть» именно то, что происходит на экране, он отправляет снимок экрана высокого разрешения на каждом шаге. Частое использование будет расходовать вашу квоту API значительно быстрее, чем стандартные текстовые функции.
- Приложения с правами администратора: Если NVDA не запущена с правами администратора, оператор может не иметь возможности взаимодействовать с окнами, требующими повышенных привилегий. Это ограничение безопасности Windows, а не ошибка дополнения.
- Рекомендации: Для лучших результатов давайте чёткие и конкретные команды. «Нажми синюю кнопку Отправить в нижней части формы» почти всегда будет работать лучше, чем просто «Нажми кнопку».
5. Анализ видео и аудиодескрипция
Примечание: Функции анализа видео и аудиодескрипции строго поддерживаются провайдером Google Gemini. Убедитесь, что ваш активный провайдер в настройках дополнения установлен на Google Gemini.
Vision Assistant Pro представляет мощные возможности обработки видео, разработанные специально для незрячих пользователей. Он может анализировать как онлайн-видео, так и локальные записи экрана, чтобы предоставлять детальные визуальные описания и генерировать профессиональные сценарии аудиодескрипции (SRT).
5.1 Локальная запись экрана (Control + V)
Если вы столкнулись с немым видео, анимацией или руководством на экране, вы можете захватить его напрямую:
1. Нажмите NVDA + Shift + V, чтобы войти в слой команд, затем нажмите Control + V.
2. Дополнение будет незаметно записывать ваш экран в фоновом режиме.
3. Нажмите Control + V снова, чтобы остановить запись.
4. Затем ИИ проанализирует записанный видеосегмент и предоставит детальное описание сцены, персонажей и действий.
5.2 Анализ видео (Shift + V)
Вы можете анализировать как локальные видеофайлы, так и онлайн-видео. Просто выберите локальный видеофайл в Проводнике Windows или скопируйте ссылку на онлайн-видео в буфер обмена. Вы также можете нажать Shift + V в любом месте (например, внутри медиаплеера), чтобы открыть диалог, где можно выбрать видеофайл или вставить URL вручную.
- Поддерживаемые онлайн-платформы: YouTube, Instagram, TikTok и Twitter (X).
- ИИ автоматически обнаружит локальный файл или URL, обработает видео и предоставит комплексное визуальное описание и аудиосводку.
5.3 Генерация аудиодескрипции (SRT)
Для более структурированного восприятия дополнение может генерировать профессиональные сценарии аудиодескрипции в стандартном формате SubRip (SRT).
- Умная расстановка по паузам: ИИ прослушивает аудиодорожку и специально привязывает свои визуальные описания к естественным паузам и тишине, чтобы интеллектуально минимизировать перекрытие с диалогами.
- Отслеживание персонажей: Движок выполняет предварительный проход для извлечения различных персонажей на основе неизменных черт лица. Он создаёт глобальный словарь для точного отслеживания и маркировки персонажей в разных сценах без путаницы.
- Дословный OCR текста: Любой текст, появляющийся на экране (вывески, телефоны, титры), строго цитируется дословно.
- Как использовать: Чтобы прослушать сгенерированные субтитры, поместите файл .srt в ту же папку, что и видеофайл, и дайте ему точно такое же имя. Затем настройте ваш медиаплеер (например, VLC или PotPlayer) так, чтобы он направлял текст субтитров непосредственно вашему скринридеру или TTS-движку во время воспроизведения.
5.4 Синхронизированное звуковое повествование (экспорт MP3)
Помимо создания текстовых SRT-файлов, дополнение функционирует как полноценный инструмент производства аудиодескрипции, синтезируя описания в речь и смешивая их с видео. Теперь вы можете выбрать Gemini Live TTS в качестве голосового движка, который использует API Gemini Live для генерации высокореалистичного, неограниченного голосового повествования. При генерации MP3 для локальных видеофайлов доступны несколько режимов смешивания:
- Стандартная AD (Смешивание голоса): Повествование накладывается непосредственно на аудио видео. Вам будет предложено применить Audio Ducking (снижение громкости фонового звука во время описаний), чтобы обеспечить чёткость повествования.
- Расширенная AD (Пауза аудио): Движок приостанавливает исходное аудио видео во время описаний, гарантируя, что вы не пропустите ни единого слова оригинального диалога или повествования ИИ.
- Видео с YouTube: Для источников YouTube (которые не загружаются локально) экспорт MP3 будет строго содержать синхронизированную голосовую дорожку ИИ без фонового аудио видео.
6. Транскрипция и озвучивание медиа (M)
Аудиотранскриптор был полностью перестроен для поддержки как аудио-, так и видеофайлов (MP3, WAV, MP4, MKV и т. д.). Нажмите M в слое команд, чтобы выбрать медиафайл и выбрать один из 3 режимов работы:
1. Транскрибировать (на исходном языке): Точно транскрибирует произнесённую речь на исходном языке.
2. Транскрибировать и перевести (на целевой язык): Транскрибирует речь и переводит её на настроенный целевой язык.
3. Озвучить и перевести (на целевой язык) (только Gemini): Мощная новая функция, которая транскрибирует речь, переводит её на целевой язык и синтезирует озвученную аудиодорожку с помощью TTS-движка дополнения.
7. Расширенное чтение документов и изображений
Чтение документов превращает ваши документы в чистый читаемый текст — так что вы можете читать, переводить и слушать всё, от сканированной книги до стопки фотографий. Он обрабатывает многостраничные PDF-файлы, сложные изображения, форматы iPhone HEIC и даже текстовые (.txt) и HTML-файлы (.html, .htm), которые открываются мгновенно без OCR или обработки ИИ. Выберите несколько файлов одновременно, и они будут объединены в один непрерывный документ в порядке страниц. Доступны три движка OCR — Chrome (Быстрый), ИИ (Расширенный) для лучшего сохранения макета и Нет (извлечение текстового слоя) для поисковых PDF — выбирается в Настройках → Чтение документов.
Как это работает
- Нажмите NVDA + Shift + V, затем D, чтобы открыть Чтение документов — или сначала выделите файл в Проводнике, затем нажмите D / F, чтобы полностью пропустить диалог выбора файла.
- Выберите один или несколько PDF-файлов или изображений. Дополнение сканирует их и объявляет общее количество страниц.
- В диалоге «Параметры» выберите диапазон страниц (С/По). Вы также можете отметить Перевести вывод и выбрать целевой язык или включить Описывать изображения в тексте при OCR.
- Извлечение текста начинается в фоновом режиме пакетами. Вы можете закрыть окно в любое время и продолжить позже — ничего не теряется.
- Когда страницы готовы, читайте их в просмотрщике: перемещайтесь между страницами, переходите на любую страницу, задавайте вопросы ИИ, сохраняйте текст или генерируйте аудиоповествование.
7.1 Пакетная обработка и возобновление
Вам не нужно читать огромный документ за один раз. Выберите диапазон страниц (например, 1-20) или оставьте значения по умолчанию для обработки всего документа, и ИИ извлечёт все страницы в фоновом режиме. Если NVDA зависнет или вы прервёте сканирование, дополнение запомнит ваш прогресс и предложит Возобновить именно с того места, где вы остановились — даже после перезапусков. Завершённые документы также кэшируются, поэтому повторное открытие их (из Недавних документов или через D) загружает текст мгновенно без повторного запуска OCR, если только исходные файлы не изменились.
7.2 Умное действие с файлом
Вам не всегда нужно сначала открывать документ. В Проводнике Windows просто выделите PDF-файл, изображение или текстовый/HTML-файл и нажмите D (Чтение документов) — или выделите PDF-файл или изображение и нажмите F (Умное действие с файлом) — внутри слоя команд. Дополнение мгновенно пропускает диалог выбора файла и начинает обработку выделенного файла. Выбор нескольких файлов одновременно обрабатывает их вместе как один документ.
7.3 Элементы управления просмотрщиком документов и сочетания клавиш
Когда окно просмотрщика документов открыто, вы можете использовать следующие функции:
Сочетания клавиш
- Ctrl + PageDown / Ctrl + PageUp: Переход на следующую / предыдущую страницу.
- Стрелка вниз / Стрелка вверх: Когда курсор достигает последней строки страницы, нажмите Стрелка вниз, чтобы перейти на следующую страницу; нажмите Стрелка вверх в верхней части страницы, чтобы вернуться на предыдущую.
- Alt + A: Открыть диалог чата для вопросов о документе.
- Alt + R: Принудительное Повторное сканирование с ИИ с использованием вашего активного провайдера.
- Alt + G: Создать и сохранить аудиофайл высокого качества (WAV/MP3). (Скрыто, если провайдер не поддерживает TTS).
- Alt + S / Ctrl + S: Сохранить извлечённый текст как TXT или HTML-файл.
Кнопки и элементы управления
- Перейти: Выберите любую страницу из селектора страниц.
- Просмотр форматированного: Просмотр всего документа как форматированного текста.
- Повторить неудачные страницы: Повторить только те пакеты, которые не удались из-за временной ошибки сервера (например, высокая нагрузка). Эта кнопка появляется автоматически при необходимости.
- Голос TTS / Движок TTS: Выберите голос, а для Gemini выберите между Стандартный TTS и потоковым Gemini Live.
- Предыдущая / Следующая: Перемещение между страницами (то же, что и сочетания Ctrl+PageUp/Down).
7.4 Недавние документы (D)
Нажатие D в слое команд сначала показывает недавно прочитанные документы. Выберите один, чтобы продолжить со страницы, на которой вы остановились — даже если OCR уже завершён — или нажмите Открыть файл... (Ctrl + O), чтобы выбрать файл как обычно.
8. Семантическая разметка ИИ и UI Explorer
Застряли в приложении с повсеместными «неподписанными кнопками»? Движок семантической разметки ИИ решает эту проблему навсегда.
8.1 Постоянная разметка объектов (L)
Сфокусируйте ваш скринридер на неподписанной графике или кнопке и нажмите L в слое команд. ИИ визуально рассмотрит кнопку, определит её функцию и применит постоянную метку.
В отличие от старых инструментов разметки скринридеров, это дополнение использует продвинутую гибридную систему «подписи объекта» (AutomationId/ControlID). Ваши пользовательские метки будут сохраняться при изменении размера окна, переключении мониторов и обновлениях приложений!
8.2 Полное сканирование приложения (Shift + L)
Нажмите Shift + L, чтобы сканировать всё активное окно сразу. ИИ найдёт все неподписанные элементы и разумно назовёт их за один раз. Позже вы можете управлять, переименовывать или массово удалять эти метки из встроенного менеджера меток.
8.3 UI Explorer (E)
Нужно взаимодействовать с элементом без ручной навигации к нему? Нажмите E, чтобы активировать UI Explorer. ИИ просканирует экран и сгенерирует доступный список всех кликабельных элементов (игнорируя системный шум, такой как панели задач). Выберите элемент из списка, и дополнение мгновенно нажмёт его за вас.
9. Живой голосовой ассистент
Живой ассистент превращает Vision Assistant Pro в совместного пилота в реальном времени.
(Примечание: Эта функция доступна только для Google Gemini и совместимых с Gemini пользовательских провайдеров).
- Активация: Нажмите Control + L в слое команд, чтобы открыть диалог Живого ассистента.
- Взаимодействие в реальном времени: Говорите естественно через микрофон. ИИ будет одновременно слушать ваш голос и смотреть на ваш активный экран. Вы можете задавать вопросы, такие как «На что я смотрю?» или «Прочитай мне третий абзац».
- Режим «Нажми и говори»: Включите «Нажми и говори» на вкладке настроек Живого ассистента (или переключите его прямо в окне Живого ассистента), затем удерживайте назначенную клавишу, чтобы говорить, и отпустите, чтобы завершить. Это держит микрофон выключенным до нажатия клавиши — идеально для шумной обстановки.
- Настройка: Внутри диалога вы можете изменить стиль голоса ИИ (например, Профессиональный, Дружелюбный, Жизнерадостный) и настроить «Глубину мышления», чтобы контролировать, насколько глубоко ИИ рассуждает перед ответом.
10. Пользовательские запросы и переменные
Вы можете управлять запросами в Настройках > Запросы > Управление запросами....
Сочетания клавиш для пользовательских запросов
Назначьте любому пользовательскому запросу собственное сочетание клавиш прямо в менеджере запросов и запускайте его мгновенно с вашим текущим выделением или контекстом:
- Одиночная клавиша (например, 1, p или F3): Работает внутри слоя команд, а также глобально как NVDA + Shift + клавиша.
- Комбинация клавиш (например, Control + Shift + 1, Alt + P или Insert + 1): Работает глобально самостоятельно.
Поддерживаемые переменные
[selection]: Текст, выделенный в данный момент.
[clipboard]: Содержимое буфера обмена.
[clipboard_image]: Изображение, находящееся в буфере обмена.
[screen_obj]: Снимок экрана объекта навигатора.
[screen_fg_obj]: Снимок экрана активного окна переднего плана.
[screen_full]: Снимок всего экрана.
[file_ocr]: Выбор файла изображения/PDF для извлечения текста.
[file_read]: Выбор документа для чтения (TXT, код, PDF).
[file_audio]: Выбор аудиофайла для анализа (MP3, WAV, OGG).
{target_lang}: Текущий целевой язык.
{source_lang}: Текущий исходный язык.
{response_lang}: Текущий язык ответов ИИ.
{swap_target}: Резервный язык для перевода с умным переключением.
{swap_instruction}: Блок инструкций для перевода с умным переключением.
11. Примеры использования в реальной жизни (Какую функцию мне использовать?)
Vision Assistant Pro содержит множество продвинутых инструментов. Вот несколько распространённых сценариев, которые помогут вам выбрать правильный:
-
Сценарий: Вы хотите понять полный макет сложного окна или недоступного приложения.
Решение: Нажмите O (Зрение полного экрана). ИИ проанализирует весь экран и опишет, где именно расположены элементы, тексты и кнопки.
-
Сценарий: Вы нашли изображение на веб-странице или неподписанную графику в документе.
Решение: Переместите объект навигатора на графику и нажмите V (Объектное зрение). ИИ подробно опишет, что содержит это изображение.
-
Сценарий: Вы хотите посмотреть фильм или видеоклип с аудиодескрипцией.
Решение: Нажмите Shift + V на вашем видео и выберите «Создать аудиодескрипцию (SRT-файл)». Когда завершится, нажмите «Создать синхронизированное повествование (MP3)» и выберите «Расширенная AD». Дополнение создаст аудиодорожку, которая интеллектуально приостанавливает диалог фильма для описания визуальных сцен.
-
Сценарий: Вы столкнулись с приложением, полным «неподписанных кнопок».
Решение: Нажмите L, чтобы навсегда подписать конкретную кнопку с помощью ИИ. Или нажмите Shift + L, чтобы сканировать и подписать всё окно сразу. Если вы просто хотите быстро что-то нажать, нажмите E (UI Explorer), чтобы получить список всех кликабельных элементов.
-
Сценарий: Вам нужно обойти недоступную CAPTCHA.
Решение: Нажмите C (Решение CAPTCHA). ИИ автоматически захватит CAPTCHA, решит её и вставит ответ в правильное поле.
-
Сценарий: Вы хотите прочитать длинный 50-страничный PDF-документ.
Решение: Нажмите D (Чтение документов), установите провайдера на Google Gemini и введите диапазон страниц 1-50. Дополнение точно извлечёт текст в фоновом режиме.
-
Сценарий: Вы смотрите немой видеоурок или анимацию на экране.
Решение: Нажмите Control + V, чтобы начать запись экрана. Дайте уроку проиграться, затем нажмите Control + V снова. ИИ объяснит именно то, что было показано.
-
Сценарий: Вы столкнулись с неожиданной ошибкой, сбоем подключения к API или хотите диагностировать проблемы с пользовательскими локальными серверами.
Решение: Перейдите в Настройки > Дополнительно, отметьте «Включить отдельный файл журнала» и установите Уровень журнала на «Отладка». Выполните действие снова, затем нажмите «Открыть файл журнала», чтобы просмотреть технические детали, или приложите vision_assistant.log к запросу в поддержку.
Примечание: Для всех функций ИИ требуется активное подключение к интернету. Многостраничные документы обрабатываются автоматически.
12. Поддержка и сообщество
Будьте в курсе последних новостей, функций и релизов:
- Telegram-канал: t.me/VisionAssistantPro
- GitHub Issues: Для сообщений об ошибках и запросов новых функций.
Сообщение об ошибках и журналы
При открытии задачи на GitHub или обращении за поддержкой, пожалуйста, указывайте информацию о вашем активном ИИ-провайдере, модели и версии NVDA. Если у вас возникают проблемы с подключением или неожиданные сбои, включите отдельный файл журнала в Настройках > Дополнительно, воспроизведите проблему и приложите файл vision_assistant.log, чтобы помочь нам быстрее решить проблему.
13. Сторонники проекта
Искренняя благодарность членам нашего сообщества, которые поддерживают непрерывную разработку и сопровождение этого проекта своими щедрыми финансовыми взносами:
- @Alyabani94
- Ali Alamri
- Ilya
- Анонимный сторонник (
UQDd...CnMY)
- leonardo0216
- Sergei Fleytin
- Suman Gayen
Если вы хотите поддержать проект финансово и увидеть своё имя здесь, вы можете найти опцию «Пожертвовать» в меню «Сервис» NVDA (подменю Vision Assistant) или во время процесса настройки после установки.
Изменения для 2026.09.01
- История (Control + H): Слой команд теперь включает диалог История (
Control + H), в котором перечислены ваши прошлые чаты и документы с фильтрами «Все», «Чаты» и «Документы». Повторно откройте любой чат с полной беседой — прикреплённые файлы автоматически прикрепляются заново — или повторно откройте документ и продолжайте чтение. Нажмите Delete на любом элементе, чтобы удалить его, или очистите всё сразу.
- Недавние документы в просмотрщике: Нажатие D в слое команд теперь сначала показывает недавно прочитанные документы. Выберите один, чтобы продолжить со страницы, на которой вы остановились — даже если OCR уже завершён — или нажмите Открыть файл... (
Ctrl + O), чтобы выбрать файл как обычно.
- Режим «Нажми и говори» для Живого ассистента: Получите полный контроль над живыми беседами! Включите «Нажми и говори» на новой вкладке настроек Живого ассистента и назначьте любую клавишу — или даже одиночный модификатор, например
Левый Ctrl, — чтобы говорить. Удерживайте клавишу, чтобы говорить, и отпустите, когда закончите, с коротким сигналом на каждое нажатие и отпускание. Соответствующий переключатель также появляется прямо в окне Живого ассистента, поэтому вы можете переключаться между режимом «нажми и говори» и режимом открытого микрофона, не покидая беседу.
- Нативное аудио Gemini 2.5 Flash: Живой ассистент теперь поддерживает нативную аудиомодель Gemini 2.5 Flash (
gemini-2.5-flash-native-audio-preview-12-2025) для голосовых бесед с низкой задержкой и естественным звучанием. Вы можете переключиться на неё в Настройках → Расширенная маршрутизация моделей → Модель Живого ассистента (только Gemini) или оставить «Авто», чтобы оставаться на рекомендуемой модели.
- Резервное копирование и восстановление настроек: Добавлена мощная система резервного копирования и восстановления на вкладке «Дополнительно»! Теперь вы можете сохранять все настройки дополнения — включая ключи API, модели, пользовательские запросы и предпочтения — в один JSON-файл и идеально восстанавливать их в любое время, на любом компьютере или после переустановки NVDA.
- Прямое чтение текста и HTML: Чтение документов теперь может напрямую открывать текстовые (
.txt) и HTML-файлы (.html, .htm)! Он автоматически определяет кодировку файла, удаляет скрипты и лишнее форматирование и интеллектуально разбивает содержимое на читаемые страницы — даже повторно импортирует свои собственные экспортированные файлы с сохранением структуры страниц — так что вы можете читать их мгновенно без OCR или обработки ИИ!
- Gemini Live TTS для Чтения документов: Кнопка «Создать аудио» теперь поддерживает Gemini Live — высококачественный потоковый движок преобразования текста в речь с естественным темпом! Когда Gemini является вашим активным провайдером, вы можете выбирать между стандартным TTS и Gemini Live прямо в просмотрщике, и ваш выбор запоминается для следующего раза!
- Сочетания клавиш для пользовательских запросов: Теперь вы можете назначить сочетание клавиш любому из ваших пользовательских запросов прямо в менеджере запросов! Дайте каждому запросу собственную клавишу или комбинацию клавиш, чтобы запускать его мгновенно, автоматически захватывая ваше текущее выделение или контекст без лишних действий!
- Навигация по сообщениям чата: Просматривайте любую беседу без помощи рук! Внутри любого окна чата (Прямой чат, чат документа, редактирование и другие) нажмите
Alt + Вниз, чтобы услышать следующее сообщение, и Alt + Вверх, чтобы услышать предыдущее — с чёткими префиксами «Вы» / «ИИ» и объявлениями границ «Первое сообщение» / «Последнее сообщение» по мере продвижения.
- Копирование сообщения чата (Alt + C): При просмотре беседы с помощью
Alt + Вверх/Вниз нажмите Alt + C, чтобы скопировать текущее сообщение в буфер обмена — с учётом настройки очистки Markdown — с голосовым подтверждением.
- Системный запрос прямого чата: Прямой чат (
Shift+C) теперь имеет собственный редактируемый системный запрос — «Инструкция для прямого чата» — который задаёт личность ассистента и язык ответов для каждой беседы. Вы можете настроить его на вкладке «Запросы по умолчанию» менеджера запросов.
- Навигация по страницам с помощью курсора в Чтении документов: Чтение многостраничных документов стало ещё удобнее! В просмотрщике документов, когда курсор достигает последней строки страницы и вы нажимаете
Вниз, просмотрщик автоматически переходит на следующую страницу. Нажатие Вверх в начале страницы плавно возвращает вас на предыдущую — больше не нужно переключать страницы вручную во время чтения!
- Новые переключатели быстрых настроек: Копирование ответов ИИ в буфер обмена, Прямой вывод (без окна чата), Очистка Markdown в чате и Умное переключение теперь можно включать и выключать мгновенно из быстрых настроек слоя команд!
- Вкладка настроек Живого ассистента: Живой ассистент теперь имеет собственную выделенную вкладку настроек! Опция «Живой ассистент: Прямой вывод (без окна)» перемещена сюда с вкладки «Подключение», и вкладка появляется только тогда, когда Google Gemini (или совместимый с Gemini пользовательский провайдер) является вашим активным провайдером.
Изменения для 2026.08.06
- Разметка UI Explorer: Теперь вы можете добавлять метки непосредственно к найденным элементам внутри UI Explorer! Добавлена новая кнопка «Добавить метку», и интерфейс умно остаётся открытым и сохраняет фокус, чтобы вы могли быстро размечать несколько объектов без перерыва.
- Улучшение слоя быстрых настроек: Слой Vision Assistant (
Insert+Shift+V) теперь постоянный и высокоинтерактивный! Используйте стрелки Вверх/Вниз для навигации между быстрыми настройками (Провайдер, Модель, Язык ответов ИИ, TTS-модель) и стрелки Влево/Вправо для мгновенного изменения их значений с умной и краткой голосовой обратной связью. Ваши выборы вступают в силу немедленно (включая автоматическое включение расширенной маршрутизации при необходимости), и слой остаётся активным во время настройки.
- Прямой чат (
Shift+C): Добавлена новая команда в слой! Нажмите Shift+C, чтобы мгновенно открыть окно «Прямой чат». Это обеспечивает чистый текстовый интерфейс для беседы с ИИ без необходимости изображения или документа в качестве отправной точки.
- Безупречное восстановление истории чата: Исправлена серьёзная ошибка, из-за которой нажатие
Пробел для возврата последнего результата приводило к потере последующей истории чата. Теперь дополнение глобально отслеживает ваши беседы. Если вы общаетесь, закрываете диалог и нажимаете Пробел для его возврата, вся ваша история беседы идеально восстанавливается! Работает для Прямого чата, Анализа зрения, Чата документов и Перевода.
- Встроенное описание изображений в OCR: Добавлена опциональная функция описания изображений в тексте при OCR документов. Вы можете включить эту настройку в настройках OCR дополнения, в параметрах Чтения документов перед извлечением и быстро на лету через слой быстрых настроек.
- Голосовой перевод (
Control+T): Добавлена мощная новая функция! Диктуйте речь и мгновенно переводите и вводите её с помощью ИИ на основе настроенных исходного и целевого языков.
- Улучшения загрузчика обновлений: Диалог загрузки обновлений теперь корректно отображает прогресс в процентах, и исправлена ошибка, из-за которой при отмене установки появлялось призрачное сообщение «Загрузка обновления».
- Улучшения загрузчика eSpeak-NG: Добавлено отслеживание прогресса загрузки в процентах для eSpeak-NG.
- Устойчивость пакетного OCR: Исправлена проблема в пакетном OCR PDF, из-за которой процесс останавливался, если активный ключ API достигал квоты; теперь он автоматически переключается на следующий доступный ключ и возобновляет процесс.
- Поддержка визуальных CAPTCHA: Добавлена надёжная поддержка решения визуальных CAPTCHA. Он пытается автоматически решать сложные задачи с изображениями, такие как hCaptcha и reCAPTCHA, значительно улучшая доступность на сложных веб-формах.
- Полная переработка аудиотранскриптора: Модуль аудиотранскриптора полностью перестроен и теперь поддерживает как аудио-, так и видеофайлы. Он включает 3 режима работы: «Транскрибировать (на исходном языке)», «Транскрибировать и перевести (на целевой язык)» и новую мощную опцию «Озвучить и перевести (на целевой язык)» (эксклюзивно для Gemini), которая генерирует переведённую аудиоозвучку исходной речи.
- Опциональные номера страниц в Чтении документов: Добавлена новая настройка для включения номеров страниц и разделителей в выводах многостраничных документов. Вы можете легко управлять этой опцией из основных настроек или переключать на лету через слой быстрых настроек. Эта функция применяется как к экспорту текстовых/HTML-файлов, так и к встроенному окну «Просмотр форматированного», позволяя читать объединённые документы без перерывов.
- Неограниченный Gemini Live TTS для видеодескрипций: Теперь вы можете выбрать «Gemini Live TTS» в качестве голосового движка при создании синхронизированного звукового повествования (MP3) для видео. Это использует API Gemini Live для синтеза высококачественных аудиодескрипций без ограничений по символам или длине.
- Модуляризация кодовой базы: Рефакторинг структуры дополнения из одного файла в многомодульную архитектуру для улучшения поддерживаемости.
- Редизайн интерфейса настроек: Полностью переработан диалог настроек с использованием современного интерфейса на основе вкладок вместо группового макета, что обеспечивает лучшую организацию и упрощает навигацию, сохраняя все существующие опции.
- Глобальное и отдельное файловое ведение журнала: Добавлена опциональная глобальная система ведения журнала на новой вкладке «Дополнительно». Автоматически записывает операционные события, трафик API и ошибки во всех модулях дополнения в отдельный файл (
vision_assistant.log). Поддерживает настраиваемые уровни детализации журнала (Отладка, Информация, Предупреждение, Ошибка), автоматические сроки хранения (от 1 часа до 90 дней) и прямое открытие или очистку журнала из настроек без влияния на производительность или стандартные журналы NVDA.
- Отслеживание прогресса загрузки в Gemini: Добавлено объявление прогресса в процентах в реальном времени при загрузке больших файлов (видео, аудио, документов) в API Google Gemini.
Изменения для 2026.07.15
- Интеллектуальная фильтрация моделей API: Полная переработка системы фильтрации моделей с использованием чистого подхода на основе чёрного списка вместо белых списков. Добавлены более строгие ключевые слова фильтрации (
embedding, bison, gecko, audio, realtime, babbage, moderation, deep, antigravity, computer), чтобы главный выпадающий список моделей чата оставался идеально чистым и готовым к будущему, сохраняя при этом все специализированные модели доступными в разделе расширенной маршрутизации.
- Поиск в расширенной маршрутизации: Все выпадающие списки расширенной маршрутизации моделей (OCR, STT, TTS, Operator, Video, Live) и селектор вариантов eSpeak теперь полностью доступны для поиска. Вы можете быстро вводить текст для фильтрации и поиска нужной модели или варианта.
- Новые сочетания клавиш слоя команд:
- Настройки (
Alt + S): Мгновенно открывает диалог настроек Vision Assistant Pro.
- Отчёт об исчерпанных ключах (
Alt + Q): Сообщает точное количество ключей Gemini API, превысивших дневную квоту, указывает, для какой конкретной модели они исчерпаны, и объявляет точное время сброса.
- Аудит маршрутизации (
Alt + M): Анализирует и объявляет вашу текущую конфигурацию расширенной маршрутизации, перечисляя модели, активно выбранные для специализированных задач (пропуская настройки по умолчанию).
- Полная переработка видеоанализатора: Видеоанализатор полностью преобразован! Ранее он предоставлял только базовое описание онлайн-видео. Теперь это комплексный набор для обработки видео, разработанный для незрячих пользователей:
- Локальная запись экрана (
Control+V): Теперь вы можете записывать немые видео непосредственно с экрана. ИИ проанализирует записанный сегмент и предоставит детальное описание сцены, макета и действий.
- Генерация аудиодескрипции (SRT): Дополнение теперь может генерировать детальные сценарии аудиодескрипции (в стандартном формате SRT) для видео, с умной расстановкой по паузам для интеллектуальной привязки описаний к естественным паузам в аудиодорожке и дословным OCR для любого текста на экране.
- Синхронизированное звуковое повествование (экспорт MP3): Помимо текстовых субтитров, дополнение может синтезировать аудиодескрипцию в речь, автоматически смешивать её с исходной аудиодорожкой видео, применять Audio Ducking (снижение громкости фона во время описаний) и экспортировать финальный синхронизированный результат в MP3-файл!
- Умное действие с видеофайлом: Если вы сфокусируетесь на локальном видеофайле и нажмёте сочетание клавиш видео, дополнение автоматически обнаружит его и обработает файл напрямую.
- Расширенное отслеживание персонажей: ИИ теперь выполняет предварительный проход для извлечения персонажей. Он создаёт глобальный словарь персонажей и точно отслеживает их сегмент за сегментом без путаницы в идентичности.
- Настройка анализа видео: Добавлены новые настройки для управления размерами фрагментов SRT, субтитров персонажей и отказов от ответственности.
- Расширенная маршрутизация моделей: Теперь вы можете явно выбирать специализированные видеомодели (
gemini_video_model, custom_video_model) в настройках расширенной маршрутизации моделей.
- Умное управление квотой API: Улучшена обработка ошибок 429 (Daily Limit) путём отслеживания квот для каждой модели. Если ключ достигает дневного лимита на одной модели, он интеллектуально помещается в карантин только для этой конкретной модели, оставляя ключ доступным для использования с другими моделями.
Изменения для 7.0.0
- Возобновление незавершённых сканирований: Добавлена функция возобновления как для Чтения документов, так и для Умных действий с файлами. Если сканирование было прервано, теперь вы можете продолжить с того места, где оно остановилось, вместо того чтобы начинать заново.
- Новая переменная
[screen_fg_obj]: Добавлена переменная пользовательского запроса для захвата снимка экрана только активного окна переднего плана, а не всего экрана.
- Умные повторные попытки и ротация ключей: Дополнение теперь автоматически повторяет попытки до 5 раз на том же ключе при временных перегрузках сервера (например, «высокий спрос» или некорректные ответы). Если повторные попытки не удаются, оно автоматически переключается на следующий ключ API в вашем списке.
- Обнаружение экранной шторки: Добавлена проверка, предотвращающая создание снимков экрана, когда активна экранная шторка (постоянно включена или временно активирована горячей клавишей). Будет выдано предупреждение и остановка, предотвращая отправку чёрных изображений и трату токенов API.
- Улучшения Чтения документов: Диалог диапазона PDF теперь автоматически предварительно выбирает целевой язык по умолчанию из настроек дополнения. Также улучшена обработка потоков, чтобы фоновые задачи корректно останавливались при закрытии просмотрщика.
- Нативная интеграция Mistral OCR: Добавлена интеграция с нативным API Document OCR Mistral. Многостраничные документы автоматически объединяются, загружаются и обрабатываются пакетами с использованием специализированной конечной точки
/v1/ocr Mistral, в то время как одностраничные изображения обрабатываются напрямую без лишних преобразований PDF.
- Динамические обработчики пользовательских URL: Изменение пользовательского URL API мгновенно очищает кэшированный список моделей и восстанавливает поле ручного ввода модели. Это обеспечивает полную совместимость с пользовательскими конечными точками (такими как Cloudflare AI Gateway), которые не поддерживают стандартную конечную точку перечисления
/v1/models.
- Полная переработка движка ввода AI Operator: Полностью переписан базовый движок симуляции мыши и клавиатуры для AI Operator. Заменён устаревший API
mouse_event на современный Windows SendInput API, что обеспечивает значительно большую совместимость с современными приложениями, окнами UAC и дисплеями с высоким DPI.
- Исправлены операции перетаскивания: Действия перетаскивания в AI Operator теперь полностью стабильны и надёжны. Новый движок использует естественные кривые «сглаживания», точное позиционирование курсора, оптимизированную синхронизацию и умную технику «подталкивания», чтобы гарантировать, что Windows и приложения правильно распознают и выполняют жесты перетаскивания без сбоев.
- Поддержка нескольких мониторов: AI Operator теперь полностью поддерживает конфигурации с несколькими мониторами. Движения мыши и клики работают корректно на всех мониторах с использованием флага
MOUSEEVENTF_VIRTUALDESK, обеспечивая точное позиционирование независимо от того, на каком мониторе находится целевое приложение.
- Улучшенная симуляция клавиатуры: Улучшена вставка нажатий клавиш для полной поддержки «расширенных клавиш» (таких как клавиши со стрелками, Home, End, Page Up/Down, Insert, Delete и F1-F12). Это гарантирует, что команды навигации и сочетания клавиш, отправляемые AI Operator, работают безупречно во всех приложениях.
- Поддержка изображений HEIC/HEIF: Добавлена нативная поддержка форматов фотографий iPhone. Теперь вы можете напрямую выбирать файлы
.heic и .heif для описания ИИ, OCR или Чтения документов без предварительного преобразования.
Изменения для 6.5.0
- Живой ассистент: Добавлена функция голосового и экранного ассистента в реальном времени, доступная исключительно для провайдера Google Gemini (или совместимых с Gemini пользовательских провайдеров). Включает интерактивную настройку голоса и глубины мышления непосредственно внутри диалога с автоматическим переподключением при изменении настроек.
- Провайдер MiniMax AI: Добавлен MiniMax как равноправный провайдер с полной мультимодальной поддержкой (чат, зрение, OCR), пользовательским TTS с использованием более 300+ динамических голосов и автоматическим удалением блоков рассуждений (например,
<think>...</think>) из выводов.
- Перевод в просмотрщике документов: Исправлена ошибка, из-за которой перевод не работал для пользователей NVDA с неанглийским языком, путём отправки стандартного двухбуквенного кода языка в Google Translate вместо локализованного названия языка.
- Повторная попытка пакетного сканирования PDF: Реализована высокооптимизированная, отдельная и бесшумная логика повторных попыток для пакетного сканирования PDF-документов для предотвращения избыточных загрузок и избегания раздражающих всплывающих окон ошибок во время повторных попыток.
- Статус просмотрщика документов: Исправлена ошибка, из-за которой общий статус дополнения (проверяемый через
I) оставался на «Пакетная обработка запущена» во время длительных сканирований документов.
- Устранение сбоя потоков: Исправлен серьёзный сбой утверждения потока
IsMain() failed in wxTimerImpl при открытии документов из фонового потока путём переключения очереди обратных вызовов GUI на wx.CallAfter.
Изменения для 6.1.2
- Предварительная проверка дублирующихся меток: Исправлена проблема в одиночной разметке, когда проверка дубликатов использовала старые координатные ключи, из-за чего NVDA отправляла дублирующиеся запросы ИИ для уже размеченных объектов вместо объявления существующей метки.
- Чат документов для не-Gemini провайдеров: Исправлена строгая проверка ключа API в Чате документов (
on_ask), чтобы пользователи OpenAI, Groq или локальных пользовательских провайдеров (например, Ollama) могли успешно общаться с документами без блокировки.
- Быстрый Chrome OCR и перевод: Восстановлен бесплатный API перевода без ключа для Chrome OCR. Перевод извлечённого текста теперь обходит Gemini AI, экономя квоты API и ускоряя процесс перевода.
- Алфавитно-цифровой фильтр CAPTCHA: Исправлена логика фильтрации в решателе CAPTCHA, чтобы неалфавитно-цифровые символы правильно очищались во всех ситуациях.
- Обновление справки слоя команд: Исправлено сочетание клавиш для объявления статуса в меню справки с
L на I, и добавлены обе команды разметки (L и Shift+L) в список.
Изменения для 6.1.1
- Исправление вывода мышления Gemma 4: Исправлена проблема с моделями Gemma 4, когда весь внутренний процесс мышления отображался как финальный ответ или когда отключение мышления приводило к пустым ответам. Дополнение теперь правильно изолирует и извлекает только финальный чистый текстовый ответ.
- Пакетный OCR из Проводника: Теперь вы можете выбирать несколько фотографий или PDF-файлов непосредственно в Проводнике Windows и извлекать текст или анализировать их пакетно. Дополнение автоматически фильтрует и обрабатывает только поддерживаемые форматы файлов.
Изменения для 6.1.0
- Универсальная интеграция локального ИИ (Настройка локального ИИ): Добавлена новая кнопка «Настройка локального ИИ» в настройках пользовательского провайдера. Теперь пользователи могут автоматически настраивать локальные ИИ-движки, включая Ollama, LM Studio, Jan.ai и KoboldCPP, мгновенно.
- Интеллектуальный обход локального прокси: Перестроена логика подключения с продвинутым механизмом обхода прокси. Дополнение теперь достаточно умно, чтобы полностью обходить системные прокси Windows для локальных петлевых подключений, обеспечивая стабильные подключения к локальному ИИ даже при активном VPN/TUN-режиме.
- Сверхстабильная семантическая разметка ИИ (v2): Заменены абсолютные координатные ключи экрана на продвинутую гибридную систему «подписи объекта». Метки теперь полагаются на программные идентификаторы (UIA AutomationId или Win32 ControlID) и относительные координаты окна, делая ваши пользовательские метки полностью устойчивыми к изменению размера окна, перемещению, переключению мониторов или масштабированию.
- Бесшовная автоматическая миграция меток: Обновление полностью прозрачно. Дополнение автоматически мигрирует ваши старые метки на основе координат в новый стабильный формат цифровой подписи в фоновом режиме при первом фокусе без потери данных.
Изменения для 6.0
- Представлена семантическая разметка ИИ: Пользователи теперь могут навсегда маркировать неподписанные кнопки и иконки с помощью ИИ. Нажмите L, чтобы подписать текущий объект навигатора (поддерживает как фокус Tab, так и объектную навигацию) или Shift+L, чтобы сканировать и подписать всё приложение сразу.
- Интеллектуальное управление метками: Добавлен новый, полностью доступный диалог менеджера меток (через Shift+L, если метки существуют) для просмотра, переименования или массового удаления пользовательских меток.
- Прямой анализ файлов (обход диалога выбора файла): Дополнение теперь достаточно умно, чтобы определять, находитесь ли вы в фокусе на PDF-файле или изображении в Проводнике Windows. Нажатие F (Умное действие с файлом) или D (Чтение документов) на выделенном файле немедленно обработает его, полностью пропуская стандартный диалог «Открыть».
Изменения для 5.6
- Добавлен движок OCR «Нет (извлечение текстового слоя)»: Пользователи теперь могут извлекать текст напрямую из поисковых PDF-файлов без использования кредитов ИИ, что значительно повышает скорость и конфиденциальность для текстовых документов.
- Улучшена точность UI Explorer: Улучшен запрос UI Explorer для лучшего определения типов элементов (например, элементы списка) и точного отчёта о состояниях, таких как «(Отмечено)», «(Выбрано)» или «(Развёрнуто)», при игнорировании системных компонентов Windows, таких как панель задач и часы.
- Напоминание при установке: Добавлено уведомление после установки, чтобы направить пользователей в меню настроек для настройки ключей API и предпочтений.
Изменения для 5.5.2
- Исправлена проблема ввода AI Operator: Устранена ошибка, из-за которой на некоторых системах вместо вставки текста вводилась буква «v». Это исправление устраняет конфликты синхронизации, возникающие при высокой загрузке системы.
- Повышенная стабильность: Добавлена надёжная обработка ошибок для операций с буфером обмена, чтобы предотвратить сбои дополнения, когда системный буфер обмена временно заблокирован другими приложениями.
- Оптимизация синхронизации: Скорректированы внутренние задержки для событий клавиатуры, чтобы обеспечить более высокую надёжность на разных скоростях системы и лучшую совместимость со сторонними менеджерами буфера обмена.
Изменения для 5.5 (Обновление автоматизации)
- AI Operator (Автономное управление - Shift+A): Это главная особенность версии 5.5. Vision Assistant Pro перешёл от пассивного помощника к вашему личному AI Operator. Он не просто описывает экран — он берёт на себя управление.
- Как это работает: Теперь вы можете давать голосовые инструкции для управления компьютером. Например, в полностью недоступном приложении, где ваш скринридер молчит, вы можете нажать Shift+A и ввести: «Нажми на кнопку Настройки» или «Найди поле поиска, введи 'Новости' и нажми Enter». ИИ визуально идентифицирует элементы, перемещает мышь и выполняет задачу за вас.
- Примечание о производительности: Эта функция оптимизирована для Gemini 3.0 Flash (Preview), обеспечивая невероятно быстрые и интеллектуальные ответы, которые могут обрабатывать даже самые сложные макеты интерфейса.
- ⚠️ Предупреждение об использовании API: Поскольку AI Operator должен «видеть» именно то, что происходит для точности, он отправляет снимок экрана высокого разрешения на каждом шагу. Помните, что частое использование будет расходовать вашу квоту API значительно быстрее, чем стандартные текстовые задачи.
- Визуальный UI Explorer (E): Устали от навигации по «неподписанным кнопкам»? Нажмите E, чтобы активировать UI Explorer. ИИ просканирует всё окно и сгенерирует список всех кликабельных элементов, которые он видит — включая иконки, графику и меню. Просто выберите элемент из списка, и AI Operator нажмёт его за вас. Это как иметь «доступный слой» поверх любого приложения.
- Контекстно-зависимое умное действие с файлом (F): Клавиша «F» была полностью переработана. Она больше не предполагает, что вы хотите только OCR. Когда вы выбираете одно изображение, она теперь интеллектуально запрашивает ваше намерение: вы можете выбрать Детальное визуальное описание для понимания сцены или Структурированное извлечение текста (OCR) для чтения. Меню динамически адаптируется в зависимости от типа файла и вашего активного ИИ-движка.
- Оптимизация ядра: Мы выполнили глубокую очистку внутренней логики дополнения, удалив неиспользуемые устаревшие функции и избыточный код. Это обеспечивает более лёгкий, быстрый и надёжный опыт для всех пользователей.
Изменения для 5.0
- Многопровайдерская архитектура: Добавлена полная поддержка OpenAI, Groq и Mistral наряду с Google Gemini. Теперь пользователи могут выбирать предпочитаемый ИИ-бэкенд.
- Расширенная маршрутизация моделей: Пользователи нативных провайдеров (Gemini, OpenAI и т. д.) теперь могут выбирать конкретные модели из выпадающего списка для разных задач (OCR, STT, TTS).
- Расширенная настройка конечных точек: Пользователи пользовательских провайдеров могут вручную вводить конкретные URL и названия моделей для детального контроля над локальными или сторонними серверами.
- Умная видимость функций: Меню настроек и интерфейс Чтения документов теперь автоматически скрывают неподдерживаемые функции (например, TTS) на основе выбранного провайдера.
- Динамическое получение моделей: Дополнение теперь получает список доступных моделей напрямую из API провайдера, обеспечивая совместимость с новыми моделями сразу после их выпуска.
- Гибридный OCR и перевод: Оптимизирована логика использования Google Translate для скорости при использовании Chrome OCR и перевода на основе ИИ при использовании движков Gemini/Groq/OpenAI.
- Универсальное «Повторное сканирование с ИИ»: Функция повторного сканирования в Чтении документов больше не ограничена Gemini. Теперь она использует любого активного ИИ-провайдера для повторной обработки страниц.
Изменения для 4.6
- Интерактивный возврат результата: Добавлена клавиша Пробел в слой команд, позволяющая пользователям мгновенно повторно открывать последний ответ ИИ в окне чата для уточняющих вопросов, даже когда активен режим «Прямой вывод».
- Телеграм-сообщество: Добавлена ссылка на «Официальный Telegram-канал» в меню «Сервис» NVDA, обеспечивающая быстрый способ быть в курсе последних новостей, функций и релизов.
- Повышенная стабильность ответов: Оптимизирована основная логика для функций перевода, OCR и зрения для обеспечения более надёжной производительности и более плавного взаимодействия при использовании прямого речевого вывода.
- Улучшенные подсказки интерфейса: Обновлены описания настроек и документация для лучшего объяснения новой системы возврата и того, как она работает вместе с настройками прямого вывода.
Изменения для 4.5
- Расширенный менеджер запросов: Введён специальный диалог управления в настройках для настройки системных запросов по умолчанию и управления пользовательскими запросами с полной поддержкой добавления, редактирования, изменения порядка и предпросмотра.
- Полная поддержка прокси: Решены проблемы с сетевым подключением путём строгого применения настроенных пользователем прокси-серверов ко всем API-запросам, включая перевод, OCR и генерацию речи.
- Автоматическая миграция данных: Внедрена умная система миграции для автоматического обновления устаревших конфигураций запросов до надёжного формата v2 JSON при первом запуске без потери данных.
- Обновлённая совместимость (2025.1): Установлена минимальная требуемая версия NVDA 2025.1 из-за зависимостей библиотек в расширенных функциях, таких как Чтение документов, для обеспечения стабильной работы.
- Оптимизированный интерфейс настроек: Упрощён интерфейс настроек путём реорганизации управления запросами в отдельный диалог, что обеспечивает более чистый и доступный пользовательский опыт.
- Руководство по переменным запросов: Добавлено встроенное руководство в диалогах запросов, чтобы помочь пользователям легко идентифицировать и использовать динамические переменные, такие как [selection], [clipboard] и [screen_obj].
Изменения для 4.0.3
- Повышенная устойчивость сети: Добавлен механизм автоматических повторных попыток для лучшей обработки нестабильных интернет-соединений и временных ошибок сервера, обеспечивая более надёжные ответы ИИ.
- Диалог визуального перевода: Введено специальное окно для результатов перевода. Пользователи теперь могут легко перемещаться и читать длинные переводы построчно, аналогично результатам OCR.
- Агрегированное форматированное представление: Функция «Просмотр форматированного» в Чтении документов теперь отображает все обработанные страницы в одном организованном окне с чёткими заголовками страниц.
- Оптимизированный рабочий процесс OCR: Автоматически пропускает выбор диапазона страниц для одностраничных документов, делая процесс распознавания быстрее и удобнее.
- Повышенная стабильность API: Переключение на более надёжный метод аутентификации на основе заголовков, устраняющий ошибки «Все ключи API не сработали», вызванные конфликтами ротации ключей.
- Исправление ошибок: Устранены несколько потенциальных сбоев, включая проблему при завершении работы дополнения и ошибку фокуса в диалоге чата.
Изменения для 4.0.1
- Расширенное Чтение документов: Мощный новый просмотрщик для PDF и изображений с выбором диапазона страниц, фоновой обработкой и удобной навигацией
Ctrl+PageUp/Down.
- Новое подменю «Сервис»: Добавлено выделенное подменю «Vision Assistant» в меню «Сервис» NVDA для быстрого доступа к основным функциям, настройкам и документации.
- Гибкая настройка: Теперь вы можете выбирать предпочитаемый движок OCR и голос TTS непосредственно на панели настроек.
- Поддержка нескольких ключей API: Добавлена поддержка нескольких ключей Gemini API. Вы можете вводить один ключ на строку или разделять их запятыми в настройках.
- Альтернативный движок OCR: Внедрён новый движок OCR для обеспечения надёжного распознавания текста даже при достижении лимита квоты Gemini API.
- Умная ротация ключей API: Автоматически переключается и запоминает самый быстрый работающий ключ API для обхода ограничений квоты.
- Документ в MP3/WAV: Добавлена возможность генерировать и сохранять аудиофайлы высокого качества в форматах MP3 (128 кбит/с) и WAV непосредственно в просмотрщике.
- Поддержка историй Instagram: Добавлена возможность описывать и анализировать истории Instagram по их URL.
- Поддержка TikTok: Внедрена поддержка видео TikTok, позволяющая полное визуальное описание и аудиотранскрипцию клипов.
- Переработанный диалог обновлений: Представлен новый доступный интерфейс с прокручиваемым текстовым полем для чёткого чтения изменений версии перед установкой.
- Унифицированный статус и UX: Стандартизированы диалоги выбора файлов в дополнении и улучшена команда «L» для отчёта о прогрессе в реальном времени.
Изменения для 3.6.0
- Система справки: Добавлена команда справки (
H) внутри слоя команд для предоставления легкодоступного списка всех сочетаний клавиш и их функций.
- Анализ онлайн-видео: Расширена поддержка видео Twitter (X). Также улучшены обнаружение URL и стабильность для более надёжной работы.
- Вклад в проект: Добавлен опциональный диалог пожертвований для пользователей, желающих поддержать будущие обновления и постоянное развитие проекта.
Изменения для 3.5.0
- Слой команд: Внедрена система слоя команд (по умолчанию:
NVDA+Shift+V) для группировки сочетаний клавиш под одной главной клавишей. Например, вместо нажатия NVDA+Control+Shift+T для перевода, теперь вы нажимаете NVDA+Shift+V, а затем T.
- Анализ онлайн-видео: Добавлена новая функция для анализа видео YouTube и Instagram напрямую по URL.
Изменения для 3.1.0
- Режим прямого вывода: Добавлена опция для пропуска диалога чата и прослушивания ответов ИИ непосредственно через речь для более быстрого и бесперебойного взаимодействия.
- Интеграция с буфером обмена: Добавлена новая настройка для автоматического копирования ответов ИИ в буфер обмена.
Изменения для 3.0
- Новые языки: Добавлены переводы на персидский и вьетнамский языки.
- Расширенные модели ИИ: Переорганизован список выбора моделей с чёткими префиксами (
[Бесплатно], [Pro], [Авто]), чтобы помочь пользователям различать бесплатные и платные модели с ограничениями. Добавлена поддержка Gemini 3.0 Pro и Gemini 2.0 Flash Lite.
- Стабильность диктования: Значительно улучшена стабильность Умного диктования. Добавлена проверка безопасности для игнорирования аудиоклипов короче 1 секунды, предотвращая галлюцинации ИИ и ошибки пустого ввода.
- Обработка файлов: Исправлена проблема, из-за которой загрузка файлов с неанглийскими именами завершалась ошибкой.
- Оптимизация запросов: Улучшена логика перевода и структурированы результаты зрения.
Изменения для 2.9
- Добавлены французский и турецкий переводы.
- Форматированное представление: Добавлена кнопка «Просмотр форматированного» в диалогах чата для просмотра беседы с правильным форматированием (заголовки, жирный шрифт, код) в стандартном окне обзора.
- Настройка Markdown: Добавлена новая опция «Очищать Markdown в чате» в Настройках. Снятие этого флажка позволяет пользователям видеть синтаксис Markdown (например,
**, #) в окне чата.
- Управление диалогами: Исправлена проблема, из-за которой окна «Редактировать текст» или чата открывались несколько раз или не фокусировались правильно.
- Улучшения UX: Стандартизированы заголовки диалогов выбора файлов на «Открыть» и удалены избыточные речевые объявления (например, «Открытие меню...») для более плавного взаимодействия.
Изменения для 2.8
- Добавлен итальянский перевод.
- Отчёт о статусе: Добавлена новая команда (NVDA+Control+Shift+I) для объявления текущего статуса дополнения (например, «Загрузка...», «Анализ...»).
- Экспорт HTML: Кнопка «Сохранить содержимое» в диалогах результатов теперь сохраняет вывод как отформатированный HTML-файл, сохраняя стили, такие как заголовки и жирный текст.
- Интерфейс настроек: Улучшен макет панели настроек с доступной группировкой.
- Новые модели: Добавлена поддержка gemini-flash-latest и gemini-flash-lite-latest.
- Языки: Добавлен непальский в поддерживаемые языки.
- Логика меню редактирования: Исправлена критическая ошибка, из-за которой команды «Редактировать текст» не работали, если язык интерфейса NVDA не был английским.
- Диктование: Улучшено обнаружение тишины для предотвращения неверного вывода текста при отсутствии речи.
- Настройки обновлений: «Проверять обновления при запуске» теперь отключено по умолчанию для соответствия политикам Магазина дополнений.
- Очистка кода.
Изменения для 2.7
- Структура проекта перенесена на официальный шаблон NV Access Add-on Template для лучшего соответствия стандартам.
- Реализована автоматическая логика повторных попыток для ошибок HTTP 429 (Rate Limit) для обеспечения надёжности при высоком трафике.
- Оптимизированы запросы перевода для более высокой точности и улучшенной логики «Умного переключения».
- Обновлён русский перевод.
Изменения для 2.6
- Добавлена поддержка русского перевода (Спасибо nvda-ru).
- Обновлены сообщения об ошибках для предоставления более информативной обратной связи о подключении.
- Целевой язык по умолчанию изменён на английский.
Изменения для 2.5
- Добавлена команда OCR нативного файла (NVDA+Control+Shift+F).
- Добавлена кнопка «Сохранить чат» в диалоги результатов.
- Внедрена полная поддержка локализации (i18n).
- Аудиообратная связь перенесена на нативный модуль тонов NVDA.
- Переключение на Gemini File API для лучшей обработки PDF и аудиофайлов.
- Исправлен сбой при переводе текста, содержащего фигурные скобки.
Изменения для 2.1.1
- Исправлена проблема, из-за которой переменная [file_ocr] работала некорректно в пользовательских запросах.
Изменения для 2.1
- Стандартизированы все сочетания клавиш для использования NVDA+Control+Shift для устранения конфликтов с раскладкой «Ноутбук» NVDA и системными горячими клавишами.
Изменения для 2.0
- Внедрена встроенная система автообновления.
- Добавлен умный кэш перевода для мгновенного получения ранее переведённого текста.
- Добавлена память беседы для контекстного улучшения результатов в диалогах чата.
- Добавлена выделенная команда перевода буфера обмена (NVDA+Control+Shift+Y).
- Оптимизированы запросы ИИ для строгого соблюдения целевого языка вывода.
- Исправлен сбой, вызванный специальными символами во входном тексте.
Изменения для 1.5
- Добавлена поддержка более чем 20 новых языков.
- Внедрён интерактивный диалог редактирования для уточняющих вопросов.
- Добавлена нативная функция умного диктования.
- Добавлена категория «Vision Assistant» в диалог жестов ввода NVDA.
- Исправлены ошибки COMError в определённых приложениях, таких как Firefox и Word.
- Добавлен механизм автоматических повторных попыток для ошибок сервера.
Изменения для 1.0