Документация по Vision Assistant Pro
Всего загрузок: 61,000+
Vision Assistant Pro — это продвинутый мультимодальный ИИ-ассистент для NVDA. Он использует лучшие в мире ИИ-движки для обеспечения интеллектуального чтения с экрана, перевода, голосового ввода и анализа документов.
Это дополнение было выпущено в честь Международного дня инвалидов.
1. Установка и настройка
Перейдите в Меню NVDA > Параметры > Настройки > Vision Assistant Pro. Диалог настроек организован в 8 доступных вкладок: Подключение, Поведение ИИ, Языки перевода, Чтение документов, Видео, CAPTCHA, Подсказки и Дополнительно.
1.1 Вкладка "Подключение"
- Провайдер: Выберите предпочитаемый ИИ-сервис. Поддерживаются Google Gemini, OpenAI, Mistral, Groq, MiniMax и Пользовательский (серверы, совместимые с OpenAI, такие как Ollama, LM Studio, Jan.ai или KoboldCPP).
- Ключ API: Введите один или несколько ключей API (разделяя их запятыми или новыми строками) для автоматического переключения между ними.
- Получить модели: Нажмите эту кнопку после ввода ключа API, чтобы загрузить актуальный список доступных моделей от провайдера.
- Модель ИИ: Выберите основную модель для общих чатов и анализа.
- Настройки пользовательского провайдера: Настройте локальные или пользовательские конечные точки. Включает Настройку локального ИИ (быстрая настройка для Ollama, LM Studio, Jan.ai или KoboldCPP) и Расширенную настройку конечной точки.
- Расширенная маршрутизация моделей (для конкретных задач): При желании выберите специализированные модели из выпадающих списков для задач OCR, STT, TTS, Оператора ИИ, Видео и Живого ассистента.
- Параметры подключения и вывода: Настройте прокси-сервер, проверку обновлений при запуске, очистку Markdown в чате, копирование ответов ИИ в буфер обмена, прямой вывод (без окна чата) и прямой вывод живого ассистента.
1.2 Вкладка "Поведение ИИ"
- Креативность (Температура): Управляет случайностью и креативностью ИИ (от 0.0 до 2.0). Более низкие значения обеспечивают более детерминированные и точные результаты перевода и OCR.
1.3 Вкладка "Языки перевода"
- Исходный язык: Выберите язык ввода по умолчанию.
- Целевой язык: Выберите основной язык для перевода.
- Язык ответов ИИ: Выберите язык для общих ответов ИИ.
- Умная замена: Автоматически меняет местами исходный и целевой языки на основе обнаруженного ввода.
1.4 Вкладка "Чтение документов"
- Движок OCR: Выберите между Chrome (Быстрый) для быстрых результатов или ИИ (Расширенный) для лучшего сохранения структуры.
- Размер пакета OCR: Укажите количество страниц на один запрос (установите 0 для обработки одним запросом).
- Встраивать описания изображений: Включите встроенные описания изображений при извлечении текста из документа.
- Экспортировать номера страниц: Включите отображение номеров страниц и разделителей в многостраничных документах.
- Голос TTS: Выберите стиль голоса по умолчанию для генерации аудио.
1.5 Вкладка "Видео"
- Размер фрагмента видео: Длительность сегмента в минутах для генерации аудиодескрипции (установите 0 для обработки всего файла).
- Добавить список персонажей: Опция для добавления словаря персонажей в качестве первой записи субтитров.
- Добавить отказ от ответственности ИИ: Опция для вставки дисклеймера в начало SRT-субтитров видео.
1.6 Вкладка "CAPTCHA"
- Включить решение визуальной CAPTCHA: Включите автоматическое решение визуальных задач (hCaptcha, reCAPTCHA).
- Метод решения текстовой CAPTCHA: Выберите между захватом Навигатора объектов или Полного экрана.
1.7 Вкладка "Подсказки"
- Управление подсказками: Открывает специальный диалог для настройки системных подсказок по умолчанию или создания, редактирования, изменения порядка и предварительного просмотра пользовательских подсказок с динамическими переменными (например,
[selection], [screen_fg_obj]).
1.8 Вкладка "Дополнительно" и глобальное журналирование
Перейдите на вкладку Дополнительно, чтобы настроить глобальное журналирование дополнения:
- Включить отдельный файл журнала: Включает запись всех операционных событий, трафика API и ошибок во всех модулях дополнения в отдельный файл (vision_assistant.log).
- Уровень журналирования: Выберите уровень детализации: Отладка (Все детали), Информация (Общая информация), Предупреждение (Только предупреждения) или Ошибка (Только ошибки).
- Хранить журналы: Установите период автоматического хранения для очистки старых записей (от 1 часа до 90 дней).
- Управление журналами: Используйте кнопки Открыть файл журнала, Открыть папку журнала или Очистить файл журнала для просмотра или очистки данных журнала без перезапуска NVDA и без вмешательства в стандартные журналы NVDA.
2. Слой команд и горячие клавиши
Во избежание конфликтов клавиатуры это дополнение использует Слой команд.
1. Нажмите NVDA + Shift + V (Главная клавиша), чтобы активировать слой (вы услышите звуковой сигнал).
2. Отпустите клавиши, затем нажмите одну из следующих клавиш:
| Клавиша |
Функция |
Описание |
| Shift + A |
Оператор ИИ |
Автономное управление: Дайте ИИ задание на экране. Повторное нажатие немедленно прерывает активные операции. |
| E |
UI Explorer |
Интерактивный клик: Идентифицирует и кликает элементы интерфейса в любом приложении. |
| T |
Умный переводчик |
Переводит текст под курсором навигатора или выделенный текст. |
| Shift + T |
Переводчик буфера обмена |
Переводит содержимое буфера обмена. |
| R |
Редактор текста |
Суммирует, исправляет грамматику, объясняет или выполняет Пользовательские подсказки. |
| V |
Зрение объекта |
Описывает текущий объект навигатора. |
| O |
Зрение полного экрана |
Анализирует весь экран, его макет и содержимое. |
| Shift + V |
Анализ видео |
Анализирует локальные видеофайлы или онлайн-видео с YouTube, Instagram, TikTok или Twitter (X). |
| Control + V |
Локальная запись видео |
Записывает видео экрана без звука и анализирует действия и макет. |
| D |
Чтение документов |
Расширенное чтение PDF и изображений с выбором диапазона страниц. |
| F |
Умное действие с файлом |
Контекстно-зависимое распознавание выбранного изображения, PDF или TIFF-файла. |
| M |
Транскрипция и дубляж медиа |
Транскрибирует или дублирует аудио/видео файлы (MP3, WAV, MP4 и др.) на целевой язык. |
| C |
Решение CAPTCHA |
Захватывает и решает CAPTCHA. |
| Shift + C |
Прямой чат |
Открывает текстовый интерфейс для прямого общения с ИИ. |
| S |
Умный диктофон |
Преобразует речь в текст. Нажмите для начала записи, еще раз для остановки/ввода. |
| Control+T |
Голосовой перевод |
Транскрибирует, переводит и вводит результат на основе языковых настроек. |
| Control+L |
Живой ассистент |
Совместный пилот в реальном времени (только Gemini): Начинает или завершает голосовую беседу и анализ экрана с ИИ-ассистентом. |
| I |
Отчет о статусе |
Сообщает текущий прогресс (например, "Сканирование...", "Ожидание"). |
| L |
Маркировка объекта |
Семантическая ИИ-маркировка: Постоянно маркирует текущий элемент/иконку. |
| Shift + L |
Управление/сканирование меток |
Открывает Менеджер меток (если они есть) или сканирует приложение на наличие безымянных элементов. |
| U |
Проверка обновлений |
Вручную проверить GitHub на наличие новой версии дополнения. |
| Space |
Повтор последнего результата |
Показывает последний ответ ИИ в диалоге чата для просмотра или продолжения. |
| H |
Справка по командам |
Отображает список всех доступных горячих клавиш. |
| Alt + S |
Настройки |
Открывает диалог настроек Vision Assistant Pro. |
| Alt + Q |
Отчет об исчерпанных ключах |
Сообщает количество ключей Gemini API, превысивших дневную квоту, и время их сброса. |
| Alt + M |
Аудит маршрутизации |
Сообщает модели ИИ, выбранные в расширенной маршрутизации. |
| Вверх / Вниз |
Навигация по быстрым настройкам |
Перемещает между категориями быстрых настроек (Провайдер, Модель и т.д.) в слое. |
| Влево / Вправо |
Изменение быстрой настройки |
Изменяет значение выбранной быстрой настройки. |
3. Оператор ИИ — Автономное управление компьютером
Оператор ИИ превращает Vision Assistant Pro из пассивного считывателя в активного помощника, который может взаимодействовать с вашим компьютером от вашего имени. Вы можете попросить его описать экран, ответить на вопросы о том, что он видит, или даже взять управление на себя — нажимать кнопки, перетаскивать элементы, вводить текст и перемещаться по приложениям с помощью команд на естественном языке.
Самое большое преимущество? Он отлично работает в полностью недоступном программном обеспечении. Если вы застряли в пользовательском приложении, на удаленном рабочем столе или на веб-сайте, где ваш экранный диктор полностью молчит, оператору это не мешает. Поскольку он "видит" экран визуально, он может находить, читать и взаимодействовать с элементами, у которых нет меток доступности.
Как это работает
- Нажмите NVDA + Shift + V, затем нажмите Shift + A (или используйте прямую комбинацию), чтобы открыть диалог Оператора ИИ.
- Введите на естественном языке, что вы хотите сделать (например, "Нажми кнопку Сохранить", "Что говорит сообщение об ошибке?" или "Переименуй файл в final.pdf").
- ИИ проанализирует ваш экран, определит соответствующие элементы и выполнит действие или предоставит ответ. Если задача требует нескольких шагов, оператор будет продолжать работу до завершения.
- Нажмите Shift + A в любой момент, чтобы немедленно прервать выполняющуюся операцию.
Поддерживаемые действия
Оператор понимает широкий спектр команд:
- Описать и ответить: "Опиши макет экрана" или "Что говорит сообщение об ошибке?"
- Клик: "Нажми кнопку Сохранить"
- Правый клик: "Кликни правой кнопкой по файлу"
- Двойной клик: "Дважды кликни по документу"
- Перетаскивание: "Перетащи документ в папку Архив"
- Ввод текста: "Введи 'Привет, мир' в поле поиска"
- Прокрутка: "Прокрути вниз три раза"
- Нажатие клавиш: "Нажми Enter", "Нажми Tab", "Нажми Escape"
- Многошаговые задачи: "Открой Проводник, найди отчет и переименуй его в final.pdf"
Важные замечания
- ⚠️ Предупреждение об использовании API: Поскольку оператор должен "видеть", что именно происходит на экране, он отправляет скриншот высокого разрешения с каждым шагом. Частое использование будет потреблять вашу квоту API намного быстрее, чем стандартные текстовые функции.
- Приложения с правами администратора: Если NVDA запущена без прав администратора, оператор может не иметь возможности взаимодействовать с окнами, требующими повышенных привилегий. Это ограничение безопасности Windows, а не ошибка дополнения.
- Рекомендации: Для достижения наилучших результатов давайте четкие и конкретные команды. "Нажми синюю кнопку Отправить внизу формы" почти всегда будет работать лучше, чем просто "Нажми кнопку".
4. Анализ видео и аудиодескрипция
Примечание: Функции анализа видео и аудиодескрипции строго работают на Google Gemini. Убедитесь, что ваш активный провайдер в настройках дополнения — Google Gemini.
Vision Assistant Pro представляет мощные возможности обработки видео, разработанные специально для незрячих пользователей. Он может анализировать как онлайн-видео, так и локальные записи экрана, предоставляя подробные визуальные описания и создавая профессиональные сценарии аудиодескрипции (SRT).
4.1 Локальная запись экрана (Control + V)
Если вы встретили немое видео, анимацию или руководство на экране, вы можете записать его напрямую:
1. Нажмите NVDA + Shift + V, чтобы войти в слой команд, затем нажмите Control + V.
2. Дополнение начнет незаметно записывать ваш экран в фоновом режиме.
3. Нажмите Control + V снова, чтобы остановить запись.
4. ИИ проанализирует записанный видеосегмент и предоставит подробное описание сцены, персонажей и действий.
4.2 Анализ видео (Shift + V)
Вы можете анализировать как локальные видеофайлы, так и онлайн-видео. Просто выберите локальный видеофайл в Проводнике Windows или скопируйте ссылку на онлайн-видео в буфер обмена. Вы также можете нажать Shift + V в любом месте (например, внутри медиаплеера), чтобы открыть диалог, где можно выбрать видеофайл или вставить URL вручную.
- Поддерживаемые онлайн-платформы: YouTube, Instagram, TikTok и Twitter (X).
- ИИ автоматически определит локальный файл или URL, обработает видео и предоставит полное визуальное описание и аудиосводку.
4.3 Генерация аудиодескрипции (SRT)
Для более структурированного опыта дополнение может генерировать профессиональные сценарии аудиодескрипции в стандартном формате SubRip (SRT).
- Умное определение пауз: ИИ прослушивает аудиодорожку и специально привязывает свои визуальные описания к естественным паузам и тихим промежуткам, чтобы интеллектуально минимизировать наложение на диалоги.
- Отслеживание персонажей: Движок выполняет предварительный проход для извлечения отдельных персонажей на основе неизменных черт лица. Он создает глобальный словарь для точного отслеживания и маркировки персонажей в разных сценах без путаницы.
- Дословный OCR текста: Любой текст, появляющийся на экране (вывески, телефоны, титры), строго цитируется дословно.
- Как использовать: Чтобы прослушать сгенерированные субтитры, просто поместите файл .srt в ту же папку, что и ваш видеофайл, и дайте ему точно такое же имя. Затем настройте ваш медиаплеер (например, VLC или PotPlayer) для отправки текста субтитров непосредственно в ваш экранный диктор или движок TTS во время воспроизведения.
4.4 Синхронизированное аудиоозвучивание (Экспорт MP3)
Помимо создания текстовых SRT-файлов, дополнение работает как полноценный инструмент производства аудиодескрипции, синтезируя описания в речь и смешивая их с видео. Теперь вы можете выбрать Gemini Live TTS в качестве голосового движка, который использует API Gemini Live для создания высокореалистичной, неограниченной голосовой озвучки. При генерации MP3 для локальных видеофайлов доступны несколько режимов смешивания:
- Стандартная AD (Смешивание голоса): Озвучка накладывается непосредственно поверх аудио видео. Вам будет предложено применить Аудио-дакинг (снижение громкости фона во время описаний), чтобы обеспечить четкость озвучки.
- Расширенная AD (Пауза аудио): Движок приостанавливает исходное аудио видео во время описаний, гарантируя, что вы не пропустите ни слова из оригинального диалога или озвучки ИИ.
- Видео YouTube: Для источников YouTube (которые не загружаются локально) экспорт MP3 будет строго содержать синхронизированную голосовую дорожку ИИ без фонового аудио видео.
5. Транскрипция и дубляж медиа (M)
Аудио-транскрибатор был полностью перестроен для поддержки как аудио, так и видеофайлов (MP3, WAV, MP4, MKV и др.). Нажмите M в слое команд, чтобы выбрать медиафайл и выбрать один из 3 режимов работы:
1. Транскрибировать (на исходном языке): Точно транскрибирует произнесенную речь на ее исходном языке.
2. Транскрибировать и перевести (на целевой язык): Транскрибирует речь и переводит ее на ваш настроенный целевой язык.
3. Озвучить и перевести (на целевой язык) (Только Gemini): Мощная новая функция, которая транскрибирует речь, переводит ее на целевой язык и синтезирует озвученный аудиодубляж с использованием TTS-движка дополнения.
6. Расширенное чтение документов и изображений
Vision Assistant Pro включает высокооптимизированное средство чтения документов, предназначенное для многостраничных PDF-файлов, сложных изображений и даже форматов HEIC с iPhone.
6.1 Пакетная обработка и возобновление
Вам не нужно читать весь большой документ за один раз. Введите диапазон страниц (например, 1-20), и ИИ обработает все страницы в фоновом режиме. Если NVDA зависнет или вы прервете сканирование, дополнение запомнит ваш прогресс и предложит Возобновить именно с того места, где вы остановились!
6.2 Умное действие с файлом
Вам не всегда нужно сначала открывать документ. В Проводнике Windows просто выделите PDF или изображение и нажмите D (Чтение документов) или F (Умное действие с файлом) в слое команд. Дополнение мгновенно обойдет диалог выбора файла и начнет обрабатывать выделенный файл.
6.3 Горячие клавиши просмотра документов
Когда окно чтения документов открыто, вы можете использовать следующие комбинации клавиш:
- Ctrl + PageDown: Перейти на следующую страницу.
- Ctrl + PageUp: Перейти на предыдущую страницу.
- Alt + A: Открыть диалог чата, чтобы задать вопросы о документе.
- Alt + R: Принудительное Повторное сканирование с ИИ с использованием вашего активного провайдера.
- Alt + G: Сгенерировать и сохранить высококачественный аудиофайл (WAV/MP3). (Скрыто, если провайдер не поддерживает TTS).
- Alt + S / Ctrl + S: Сохранить извлеченный текст как файл TXT или HTML.
7. Семантическая ИИ-маркировка и UI Explorer
Застряли в приложении, где везде "неподписанная кнопка"? Движок семантической ИИ-маркировки решает эту проблему навсегда.
7.1 Постоянная маркировка объектов (L)
Сфокусируйте ваш экранный диктор на неподписанной графике или кнопке и нажмите L в слое команд. ИИ посмотрит на кнопку визуально, определит ее функцию и применит постоянную метку.
В отличие от старых инструментов маркировки экранных дикторов, это дополнение использует продвинутую гибридную систему "Подписи объектов" (AutomationId/ControlID). Ваши пользовательские метки переживут изменение размера окна, переключение мониторов и обновления приложений!
7.2 Полное сканирование приложения (Shift + L)
Нажмите Shift + L, чтобы сканировать все активное окно сразу. ИИ найдет все неподписанные элементы и интеллектуально назовет их за один раз. Позже вы можете управлять, переименовывать или массово удалять эти метки из встроенного Менеджера меток.
7.3 UI Explorer (E)
Нужно взаимодействовать с элементом, не перемещаясь к нему вручную? Нажмите E, чтобы активировать UI Explorer. ИИ просканирует экран и сгенерирует доступный список всех кликабельных элементов (игнорируя системный шум, такой как панели задач). Выберите элемент из списка, и дополнение мгновенно кликнет по нему за вас.
8. Живой голосовой ассистент
Живой ассистент превращает Vision Assistant Pro в интерактивного помощника в реальном времени.
(Примечание: Эта функция доступна только для Google Gemini и совместимых с Gemini пользовательских провайдеров).
- Активация: Нажмите Control + L в слое команд, чтобы открыть диалог Живого ассистента.
- Взаимодействие в реальном времени: Говорите естественно через микрофон. ИИ будет одновременно слушать ваш голос и смотреть на ваш активный экран. Вы можете задавать вопросы, такие как "Что я сейчас вижу?" или "Прочитай мне третий абзац."
- Настройка: В диалоге вы можете изменить голосовой стиль ИИ (например, Профессиональный, Дружелюбный, Бодрый) и настроить "Глубину мышления", чтобы контролировать, насколько глубоко ИИ будет анализировать перед ответом.
9. Пользовательские подсказки и переменные
Вы можете управлять подсказками в Настройки > Подсказки > Управление подсказками....
Поддерживаемые переменные
[selection]: Текущий выделенный текст.
[clipboard]: Содержимое буфера обмена.
[clipboard_image]: Изображение, находящееся в буфере обмена.
[screen_obj]: Скриншот объекта навигатора.
[screen_fg_obj]: Скриншот активного окна переднего плана.
[screen_full]: Скриншот всего экрана.
[file_ocr]: Выбрать файл изображения/PDF для извлечения текста.
[file_read]: Выбрать документ для чтения (TXT, Код, PDF).
[file_audio]: Выбрать аудиофайл для анализа (MP3, WAV, OGG).
{target_lang}: Текущий целевой язык.
{source_lang}: Текущий исходный язык.
{response_lang}: Текущий язык ответов ИИ.
{swap_target}: Резервный язык для умной замены при переводе.
{swap_instruction}: Блок инструкций для умной замены при переводе.
10. Примеры использования в реальной жизни (Какую функцию мне использовать?)
Vision Assistant Pro переполнен продвинутыми инструментами. Вот несколько распространенных сценариев, которые помогут вам выбрать правильный:
-
Сценарий: Вы хотите понять полный макет сложного окна или недоступного приложения.
Решение: Нажмите O (Зрение полного экрана). ИИ проанализирует весь экран и опишет, где именно расположены элементы, тексты и кнопки.
-
Сценарий: Вы нашли изображение на веб-странице или неподписанную графику в документе.
Решение: Переместите объект навигатора на графику и нажмите V (Зрение объекта). ИИ опишет именно то, что содержит это изображение.
-
Сценарий: Вы хотите посмотреть фильм или видеоклип с аудиодескрипцией.
Решение: Нажмите Shift + V на вашем видео и выберите "Создать аудиодескрипцию (SRT-файл)". Когда он завершится, нажмите "Создать синхронизированную озвучку (MP3)" и выберите "Расширенная AD". Дополнение создаст аудиодорожку, которая интеллектуально приостанавливает диалог фильма для описания визуальных сцен.
-
Сценарий: Вы столкнулись с приложением, полным "неподписанных кнопок".
Решение: Нажмите L, чтобы постоянно маркировать конкретную кнопку с помощью ИИ. Или нажмите Shift + L, чтобы отсканировать и маркировать все окно сразу. Если вы просто хотите быстро кликнуть что-то, нажмите E (UI Explorer), чтобы получить список всех кликабельных элементов.
-
Сценарий: Вам нужно обойти недоступную CAPTCHA.
Решение: Нажмите C (Решение CAPTCHA). ИИ автоматически захватит CAPTCHA, решит ее и вставит ответ в нужное поле.
-
Сценарий: Вы хотите прочитать длинный PDF-документ на 50 страниц.
Решение: Нажмите D (Чтение документов), установите провайдера на Google Gemini и введите диапазон страниц 1-50. Дополнение точно извлечет текст в фоновом режиме.
-
Сценарий: Вы смотрите немой видеоурок или анимацию на экране.
Решение: Нажмите Control + V, чтобы начать запись экрана. Дайте уроку проиграться, затем нажмите Control + V снова. ИИ объяснит, что именно было продемонстрировано.
-
Сценарий: Вы столкнулись с неожиданной ошибкой, сбоем подключения к API или хотите диагностировать проблемы с пользовательскими локальными серверами.
Решение: Перейдите в Настройки > Дополнительно, установите флажок "Включить отдельный файл журнала" и установите Уровень журналирования в "Отладка". Повторите действие, затем нажмите "Открыть файл журнала", чтобы просмотреть технические детали, или прикрепите vision_assistant.log к заявке в поддержку.
Примечание: Для всех функций ИИ требуется активное подключение к Интернету. Многостраничные документы обрабатываются автоматически.
11. Поддержка и сообщество
Будьте в курсе последних новостей, функций и релизов:
- Telegram-канал: t.me/VisionAssistantPro
- GitHub Issues: Для сообщений об ошибках и запросов новых функций.
Сообщение об ошибках и журналы
Когда вы открываете issue на GitHub или обращаетесь за поддержкой, пожалуйста, укажите вашего активного ИИ-провайдера, модель и версию NVDA. Если у вас возникают проблемы с подключением или неожиданные сбои, включите отдельный файл журнала в Настройки > Дополнительно, воспроизведите проблему и прикрепите ваш файл vision_assistant.log, чтобы помочь нам решить проблему быстрее.
12. Сторонники проекта
Искренняя благодарность членам нашего сообщества, которые поддерживают непрерывную разработку и обслуживание этого проекта своими щедрыми финансовыми вкладами:
- @Alyabani94
- Ali Alamri
- Ilya
- Анонимный сторонник (
UQDd...CnMY)
- leonardo0216
- Sergei Fleytin
- Suman Gayen
Если вы хотите поддержать проект финансово и увидеть свое имя здесь, вы можете найти опцию Пожертвовать в меню Сервисы NVDA (подменю Vision Assistant) или во время процесса настройки после установки.
Изменения для 2026.08.06
- Маркировка в UI Explorer: Теперь вы можете добавлять метки непосредственно к найденным элементам внутри UI Explorer! Добавлена новая кнопка "Добавить метку", и интерфейс уменно остается открытым и сохраняет фокус, чтобы вы могли быстро маркировать несколько объектов без прерываний.
- Улучшение слоя быстрых настроек: Слой Vision Assistant (
Insert+Shift+V) теперь постоянный и высокоинтерактивный! Вы можете использовать клавиши Вверх/Вниз для навигации между быстрыми настройками (Провайдер, Модель, Язык ответов ИИ, Модель TTS) и клавиши Влево/Вправо для мгновенного изменения их значений с умной и краткой голосовой обратной связью. Ваши выборы вступают в силу немедленно (включая автоматическое включение расширенной маршрутизации при необходимости), и слой остается активным, пока вы настраиваете параметры.
- Прямой чат (
Shift+C): Добавлена новая команда в слой! Нажмите Shift+C, чтобы мгновенно открыть окно "Прямого чата". Это обеспечивает чистый текстовый интерфейс для общения с ИИ без необходимости в изображении или документе в качестве отправной точки.
- Безупречное восстановление истории чатов: Исправлен серьезный баг, из-за которого нажатие
Space для повторного вызова последнего результата приводило к потере последующей истории чата. Теперь дополнение глобально отслеживает вашу беседу. Если вы общались в чате, закрыли диалог и нажали Space для повторного вызова, ваша полная история переписки идеально восстанавливается! Работает для Прямого чата, Анализа зрения, Чата о документе и Перевода.
- Встраиваемые описания изображений в OCR: Добавлена опциональная функция для встраивания описаний изображений во время OCR документа. Вы можете включить эту настройку в настройках OCR дополнения, в параметрах Чтения документов перед извлечением и быстро, на лету, через слой быстрых настроек.
- Голосовой перевод (
Control+T): Добавлена мощная новая функция! Диктуйте речь и мгновенно переводите и вводите ее с помощью ИИ на основе ваших настроек исходного и целевого языков.
- Улучшения загрузчика обновлений: Диалог загрузки обновлений теперь правильно отображает прогресс загрузки в процентах, и исправлен баг, при котором сообщение "Загрузка обновления..." появлялось при отмене установки.
- Улучшения загрузчика eSpeak-NG: Добавлено отслеживание прогресса загрузки eSpeak-NG в процентах.
- Устойчивость пакетного OCR: Исправлена проблема в пакетном OCR PDF, когда процесс останавливался, если активный ключ API достигал квоты; теперь он автоматически переключается на следующий доступный ключ и возобновляет процесс.
- Поддержка визуальной Captcha: Добавлена надежная поддержка решения визуальной captcha. Он пытается автоматически решать сложные задачи с изображениями, такие как hCaptcha и reCAPTCHA, значительно улучшая доступность на сложных веб-формах.
- Полная переработка Аудио-транскрибатора: Модуль Аудио-транскрибатора полностью перестроен и теперь поддерживает как аудио, так и видеофайлы. Он предлагает 3 режима работы: "Транскрибировать (на исходном языке)", "Транскрибировать и перевести (на целевой язык)" и новую мощную опцию "Озвучить и перевести (на целевой язык)" (эксклюзив для Gemini), которая генерирует аудиодубляж перевода исходной речи.
- Опциональные номера страниц в Чтении документов: Добавлена новая настройка для включения номеров страниц и разделителей в выводах многостраничных документов. Вы можете легко управлять этой опцией из основных настроек или переключать ее на лету через слой быстрых настроек. Эта функция применяется как к экспорту текстовых/HTML-файлов, так и к окну "Просмотр форматированного", позволяя читать объединенные документы без проблем.
- Неограниченный Gemini Live TTS для видеодескрипций: Теперь вы можете выбрать "Gemini Live TTS" в качестве голосового движка при генерации синхронизированной аудиоозвучки (MP3) для видео. Это использует API Gemini Live для синтеза высококачественных аудиодескрипций без каких-либо ограничений по символам или длине.
- Модуляризация кодовой базы: Рефакторинг структуры дополнения из одного файла в многомодульную архитектуру для улучшения сопровождаемости.
- Редизайн пользовательского интерфейса настроек: Полностью переработан диалог настроек с использованием современного интерфейса на основе вкладок вместо группового макета, что обеспечивает лучшую организацию и упрощает навигацию, сохраняя все существующие опции.
- Глобальное и выделенное файловое журналирование: Добавлена опциональная система глобального файлового журналирования на новой вкладке "Дополнительно". Автоматически записывает операционные события, трафик API и ошибки во всех модулях дополнения в выделенный файл (
vision_assistant.log). Поддерживает настраиваемые уровни детализации (Отладка, Информация, Предупреждение, Ошибка), автоматические периоды хранения (от 1 часа до 90 дней) и прямое открытие или очистку журнала из настроек без влияния на производительность или стандартные журналы NVDA.
- Отслеживание прогресса загрузки в Gemini: Добавлены объявления прогресса загрузки в реальном времени в процентах при загрузке больших файлов (видео, аудио, документов) в API Google Gemini.
Изменения для 2026.07.15
- Интеллектуальная фильтрация моделей API: Полный пересмотр системы фильтрации моделей с использованием чистого подхода черного списка вместо белых списков. Добавлены более строгие ключевые слова фильтрации (
embedding, bison, gecko, audio, realtime, babbage, moderation, deep, antigravity, computer), чтобы гарантировать, что основной выпадающий список моделей чата остается идеально чистым и перспективным, сохраняя при этом доступ ко всем специализированным моделям в разделе Расширенной маршрутизации.
- Поиск в расширенной маршрутизации: Все выпадающие списки Расширенной маршрутизации моделей (OCR, STT, TTS, Оператор, Видео, Живой) и селектор вариантов eSpeak теперь полностью доступны для поиска. Вы можете быстро вводить текст для фильтрации и поиска нужной модели или варианта.
- Новые горячие клавиши слоя команд:
- Настройки (
Alt + S): Мгновенно открывает диалог настроек Vision Assistant Pro.
- Отчет об исчерпанных ключах (
Alt + Q): Сообщает точное количество ключей Gemini API, превысивших дневную квоту, определяет, для какой именно модели они исчерпаны, и объявляет точное время их сброса.
- Аудит маршрутизации (
Alt + M): Анализирует и объявляет вашу текущую конфигурацию Расширенной маршрутизации, зачитывая, какие модели активно выбраны для специализированных задач (пропуская настройки по умолчанию).
- Полный пересмотр Видеоанализатора: Видеоанализатор полностью преобразован! Раньше он предоставлял только базовое описание онлайн-видео. Теперь это комплексный набор инструментов обработки видео, разработанный для незрячих пользователей:
- Локальная запись экрана (
Control+V): Теперь вы можете записывать немые видео непосредственно с экрана. ИИ проанализирует записанный сегмент и предоставит подробное описание сцены, макета и действий.
- Генерация аудиодескрипции (SRT): Дополнение теперь может генерировать детальные сценарии аудиодескрипции (в стандартном формате SRT) для видео, с умным определением пауз для интеллектуальной привязки описаний к естественным паузам в аудиодорожке и дословным OCR для любого текста на экране.
- Синхронизированная аудиоозвучка (Экспорт MP3): Помимо текстовых субтитров, дополнение может синтезировать аудиодескрипцию в речь, автоматически смешивать ее с оригинальной аудиодорожкой видео, применять аудио-дакинг (снижение громкости фона во время описаний) и экспортировать финальный синхронизированный результат в MP3-файл!
- Умное действие с видеофайлом: Если вы сфокусируетесь на локальном видеофайле и нажмете горячую клавишу видео, дополнение автоматически обнаружит его и обработает файл напрямую.
- Расширенное отслеживание персонажей: ИИ теперь выполняет предварительный проход для извлечения персонажей. Он создает глобальный словарь персонажей и точно отслеживает их сегмент за сегментом, не путая личности.
- Конфигурация анализа видео: Добавлены новые настройки для управления размерами фрагментов SRT, субтитрами персонажей и дисклеймерами.
- Расширенная маршрутизация моделей: Теперь вы можете явно выбирать специализированные видеомодели (
gemini_video_model, custom_video_model) в настройках Расширенной маршрутизации моделей.
- Умное управление квотой API: Улучшена обработка ошибок 429 (Дневной лимит) путем отслеживания квот для каждой модели. Если ключ достигает дневного лимита на одной модели, он интеллектуально блокируется только для этой конкретной модели, оставляя ключ доступным для использования с другими моделями.
Изменения для 7.0.0
- Возобновление незавершенных сканирований: Добавлена функция возобновления как для Чтения документов, так и для Умных действий с файлом. Если сканирование было прервано, теперь вы можете продолжить с того места, где остановились, вместо того чтобы начинать заново.
- Новая переменная
[screen_fg_obj]: Добавлена переменная для пользовательских подсказок, позволяющая захватывать скриншот только активного окна переднего плана, а не всего экрана.
- Умные повторные попытки и переключение ключей: Дополнение теперь бесшумно повторяет попытки до 5 раз на том же ключе при временных перегрузках сервера (например, "высокий спрос" или некорректные ответы). Если повторные попытки не удаются, оно автоматически переключается на следующий ключ API в вашем списке.
- Обнаружение шторки экрана: Добавлена проверка для предотвращения создания скриншотов, когда активна Шторка экрана (независимо от того, включена ли она постоянно или временно активирована горячей клавишей). Вы получите предупреждение, и процесс остановится, предотвращая отправку черных изображений и трату токенов API.
- Изменения в Чтении документов: Диалог выбора диапазона PDF теперь автоматически предварительно выбирает целевой язык по умолчанию из настроек дополнения. Также улучшена обработка потоков, чтобы фоновые задачи корректно завершались при закрытии окна чтения.
- Нативная интеграция Mistral OCR: Интегрирован нативный API Mistral Document OCR. Многостраничные документы автоматически объединяются, загружаются и обрабатываются пакетами с использованием специализированной конечной точки
/v1/ocr Mistral, в то время как одностраничные изображения обрабатываются напрямую без ненужного преобразования в PDF [1].
- Динамические обработчики пользовательских URL: Изменение пользовательского URL API теперь мгновенно очищает кешированный список моделей и восстанавливает текстовое поле для ручного ввода модели. Это обеспечивает полную совместимость с пользовательскими конечными точками (такими как Cloudflare AI Gateway), которые не поддерживают стандартную конечную точку
/v1/models.
- Полная переработка движка ввода Оператора ИИ: Полностью переписанная базовая система эмуляции мыши и клавиатуры для Оператора ИИ. Заменено устаревшее API
mouse_event на современное API Windows SendInput, что обеспечивает значительно более высокую совместимость с современными приложениями, окнами, защищенными UAC, и дисплеями с высоким DPI.
- Исправлены операции перетаскивания: Действия перетаскивания в Операторе ИИ теперь полностью стабильны и надежны. Новый движок использует естественные кривые "сглаживания", точное позиционирование курсора, оптимизированную синхронизацию и умную технику "подталкивания", чтобы гарантировать, что Windows и приложения корректно распознают и выполняют жесты перетаскивания без сбоев на полпути.
- Поддержка нескольких мониторов: Оператор ИИ теперь полностью поддерживает конфигурации с несколькими мониторами. Движения мыши и клики корректно работают на всех мониторах с использованием флага
MOUSEEVENTF_VIRTUALDESK, обеспечивая точное позиционирование независимо от того, на каком мониторе находится целевое приложение.
- Улучшенная эмуляция клавиатуры: Улучшена инъекция нажатий клавиш для полной поддержки "Расширенных клавиш" (таких как клавиши со стрелками, Home, End, Page Up/Down, Insert, Delete и F1-F12). Это гарантирует, что команды навигации и быстрые клавиши, отправляемые Оператором ИИ, работают безупречно во всех приложениях.
- Поддержка изображений HEIC/HEIF: Добавлена нативная поддержка форматов фотографий iPhone. Теперь вы можете напрямую выбирать файлы
.heic и .heif для описания ИИ, OCR или Чтения документов без предварительного преобразования.
Изменения для 6.5.0
- Живой ассистент: Добавлена функция голосового и экранного помощника в реальном времени, доступная исключительно для провайдера Google Gemini (или совместимых с Gemini пользовательских провайдеров). Включает интерактивную настройку голоса и глубины мышления непосредственно в диалоге с автоматическим переподключением при изменении настроек.
- ИИ-провайдер MiniMax: Интегрирован MiniMax в качестве равноправного провайдера с полной мультимодальной поддержкой (чат, зрение, OCR), пользовательским TTS с использованием более 300+ динамических голосов и автоматическим удалением блоков рассуждений (например,
<think>...</think>) из выводов.
- Перевод в просмотрщике документов: Исправлена скрытая ошибка перевода для пользователей NVDA, использующих не-английский язык, путем отправки стандартного 2-буквенного кода языка в Google Translate вместо локализованного названия языка.
- Повторная попытка пакетного сканирования PDF: Реализована высокооптимизированная, отдельная и бесшумная логика повторных попыток для пакетного сканирования PDF-документов, чтобы предотвратить избыточные загрузки и избежать появления раздражающих всплывающих окон ошибок во время повторных попыток.
- Статус просмотрщика документов: Исправлен баг, из-за которого общий статус плагина (проверяемый через
I) оставался на "Запущен пакетная обработка" во время длительных сканирований документов.
- Исправлен сбой в потоках: Исправлен серьезный сбой потока
IsMain() failed in wxTimerImpl при открытии документов из фонового потока путем перевода очереди обратных вызовов GUI на wx.CallAfter.
Изменения для 6.1.2
- Предварительная проверка дубликатов меток: Исправлена проблема в одинарной маркировке, когда проверка дубликатов использовала старые координатные ключи, из-за чего NVDA отправляла повторные запросы ИИ для уже маркированных объектов вместо объявления существующей метки.
- Чат о документах для не-Gemini провайдеров: Исправлена строгая проверка ключа API в Чате о документах (
on_ask), чтобы пользователи OpenAI, Groq или локальных пользовательских провайдеров (таких как Ollama) могли успешно общаться с документами без блокировки.
- Быстрый перевод Chrome OCR: Восстановлен бесплатный, безключевой API перевода для Chrome OCR. Перевод извлеченного текста теперь обходит Gemini AI, экономя квоты API и ускоряя процесс перевода.
- Алфавитно-цифровой фильтр CAPTCHA: Исправлена логика фильтрации в решателе CAPTCHA, чтобы неалфавитно-цифровые символы корректно очищались во всех ситуациях.
- Обновление справки слоя команд: Исправлена комбинация клавиш для объявления статуса в меню справки с
L на I, и добавлены обе команды маркировки (L и Shift+L) в список.
Изменения для 6.1.1
- Исправление вывода мышления Gemma 4: Исправлена проблема с моделями Gemma 4, когда весь внутренний процесс мышления отображался как финальный ответ или когда отключение мышления приводило к пустым ответам. Дополнение теперь корректно изолирует и извлекает только финальный чистый текстовый ответ.
- Пакетный OCR из Проводника: Теперь вы можете выбрать несколько фотографий или PDF-файлов непосредственно в Проводнике Windows и извлечь текст или проанализировать их в пакетном режиме. Дополнение автоматически отфильтрует и обработает только поддерживаемые форматы файлов.
Изменения для 6.1.0
- Универсальная интеграция локального ИИ (Настройка локального ИИ): Добавлена новая кнопка "Настройка локального ИИ" в настройках пользовательского провайдера. Пользователи теперь могут автоматически настраивать локальные ИИ-движки, включая Ollama, LM Studio, Jan.ai и KoboldCPP, мгновенно.
- Интеллектуальный обход локального прокси: Перестроена логика подключения с продвинутым механизмом обхода прокси. Дополнение теперь достаточно умно, чтобы полностью обходить системные прокси Windows для локальных соединений обратной связи, обеспечивая стабильное подключение к локальному ИИ даже при активном VPN/TUN-режиме.
- Сверхстабильная ИИ-маркировка (v2): Замена абсолютных координатных ключей экрана на продвинутую гибридную систему "Подписи объектов". Метки теперь полагаются на программные идентификаторы (UIA AutomationId или Win32 ControlID) и относительные координаты окна, делая ваши пользовательские метки полностью устойчивыми к изменению размера окна, перемещению, переключению мониторов или масштабированию.
- Бесшовная автоматическая миграция меток: Обновление происходит полностью прозрачно. Дополнение автоматически перенесет ваши старые метки, основанные на координатах, в новый стабильный формат подписи в фоновом режиме при первом фокусе, без потери данных.
Изменения для 6.0
- Представление семантической ИИ-маркировки: Пользователи теперь могут постоянно маркировать безымянные кнопки и иконки с помощью ИИ. Нажмите L, чтобы маркировать текущий объект навигатора (поддерживается как фокус вкладок, так и объектная навигация), или Shift+L, чтобы отсканировать и маркировать все приложение сразу.
- Интеллектуальное управление метками: Добавлен новый, полностью доступный диалог Менеджера меток (через Shift+L, если метки существуют) для просмотра, переименования или массового удаления пользовательских меток.
- Прямой анализ файлов (обход диалога выбора файла): Дополнение теперь достаточно умно, чтобы обнаружить, сфокусированы ли вы на PDF-файле или изображении в Проводнике Windows. Нажатие F (Умное действие с файлом) или D (Чтение документов) на выделенном файле приведет к его немедленной обработке, полностью обходя стандартный диалог "Открыть".
Изменения для 5.6
- Добавлен движок OCR "Нет (Извлечь текстовый слой)": Пользователи теперь могут извлекать текст из поисковых PDF-файлов без использования кредитов ИИ, что значительно улучшает скорость и конфиденциальность для текстовых документов.
- Улучшенная точность UI Explorer: Улучшена подсказка UI Explorer для лучшего определения типов элементов (например, Элементы списка) и точного сообщения состояний, таких как "(Отмечен)", "(Выбран)" или "(Развернут)", с игнорированием системных компонентов Windows, таких как Панель задач и Часы.
- Напоминание при установке: Добавлено уведомление после установки, направляющее пользователей в меню настроек для настройки ключей API и предпочтений.
Изменения для 5.5.2
- Исправлена проблема ввода Оператора ИИ: Исправлен баг, из-за которого вместо вставки текста вводилась буква 'v' на некоторых системах. Исправление устраняет проблемы синхронизации, возникающие при высокой загрузке системы.
- Повышенная стабильность: Добавлена надежная обработка ошибок для операций с буфером обмена, чтобы предотвратить сбои дополнения, когда системный буфер обмена временно заблокирован другими приложениями.
- Оптимизация синхронизации: Скорректированы внутренние задержки для событий клавиатуры для обеспечения более высокой надежности на системах с разной скоростью и лучшей совместимости со сторонними менеджерами буфера обмена.
Изменения для 5.5 (Обновление автоматизации)
- Оператор ИИ (Автономное управление - Shift+A): Это жемчужина v5.5. Vision Assistant Pro перешел от пассивного ассистента к вашему личному Оператору ИИ. Он не просто описывает экран — он берет управление на себя.
- Как это работает: Теперь вы можете давать голосовые инструкции для управления вашим ПК. Например, в полностью недоступном приложении, где ваш экранный диктор молчит, вы можете нажать Shift+A и ввести: "Нажми на кнопку Настройки" или "Найди поле поиска, введи 'Последние новости' и нажми Enter." ИИ визуально идентифицирует элементы, перемещает мышь и выполняет задачу за вас.
- Примечание о производительности: Эта функция оптимизирована для Gemini 3.0 Flash (Preview), обеспечивая невероятно быстрые и интеллектуальные ответы, способные обрабатывать даже самые сложные макеты интерфейса.
- ⚠️ Предупреждение об использовании API: Поскольку Оператору ИИ необходимо "видеть", что именно происходит для точности, он отправляет скриншот высокого разрешения с каждым шагом. Учтите, что частое использование будет потреблять вашу квоту API намного быстрее, чем стандартные текстовые задачи.
- Визуальный UI Explorer (E): Устали от навигации по "неподписанным кнопкам"? Нажмите E, чтобы активировать UI Explorer. ИИ просканирует все окно и сгенерирует список каждого кликабельного элемента, который он видит, включая иконки, графику и меню. Просто выберите элемент из списка, и Оператор ИИ кликнет по нему за вас. Это как "слой доступности" поверх любого приложения.
- Контекстно-зависимое Умное действие с файлом (F): Клавиша "F" была полностью переработана. Она больше не предполагает, что вы хотите только OCR. Когда вы выбираете одно изображение, она теперь интеллектуально спрашивает ваше намерение: вы можете выбрать Детальное визуальное описание, чтобы понять сцену, или Структурированное извлечение текста (OCR) для чтения. Меню динамически адаптируется в зависимости от типа файла и вашего активного ИИ-движка.
- Оптимизация ядра: Мы выполнили глубокую очистку внутренней логики дополнения, удалив неиспользуемые устаревшие функции и избыточный код. Это приводит к более легкому, быстрому и надежному опыту для всех пользователей.
Изменения для 5.0
- Многопровайдерская архитектура: Добавлена полная поддержка OpenAI, Groq и Mistral наряду с Google Gemini. Пользователи теперь могут выбирать предпочитаемый ИИ-бэкенд.
- Расширенная маршрутизация моделей: Пользователи родных провайдеров (Gemini, OpenAI и др.) теперь могут выбирать конкретные модели из выпадающего списка для различных задач (OCR, STT, TTS).
- Расширенная настройка конечной точки: Пользователи пользовательских провайдеров могут вручную вводить конкретные URL и названия моделей для детального контроля над локальными или сторонними серверами.
- Умное отображение функций: Меню настроек и интерфейс Чтения документов теперь автоматически скрывают неподдерживаемые функции (например, TTS) в зависимости от выбранного провайдера.
- Динамическое получение моделей: Дополнение теперь получает список доступных моделей непосредственно из API провайдера, обеспечивая совместимость с новыми моделями сразу после их выпуска.
- Гибридный OCR и перевод: Оптимизирована логика использования Google Translate для скорости при использовании Chrome OCR и ИИ-перевода при использовании движков Gemini/Groq/OpenAI.
- Универсальное "Повторное сканирование с ИИ": Функция повторного сканирования в Чтении документов больше не ограничена Gemini. Теперь она использует любого активного ИИ-провайдера для повторной обработки страниц.
Изменения для 4.6
- Интерактивный повтор результата: Добавлена клавиша Space в слой команд, позволяющая пользователям мгновенно открывать последний ответ ИИ в окне чата для дополнительных вопросов, даже когда активен режим "Прямой вывод".
- Телеграм-сообщество: Добавлена ссылка "Официальный Telegram-канал" в меню Сервисы NVDA, предоставляющая быстрый способ быть в курсе последних новостей, функций и релизов.
- Повышенная стабильность ответов: Оптимизирована основная логика для функций Перевода, OCR и Зрения для обеспечения более надежной производительности и более плавного опыта при использовании прямого речевого вывода.
- Улучшенное руководство по интерфейсу: Обновлены описания настроек и документация для лучшего объяснения новой системы повтора и того, как она работает вместе с настройками прямого вывода.
Изменения для 4.5
- Расширенный менеджер подсказок: Представлен специальный диалог управления в настройках для настройки системных подсказок по умолчанию и управления пользовательскими подсказками с полной поддержкой добавления, редактирования, изменения порядка и предварительного просмотра.
- Всесторонняя поддержка прокси: Решены проблемы с сетевым подключением путем обеспечения строгого применения настроек прокси пользователя ко всем API-запросам, включая перевод, OCR и генерацию речи.
- Автоматическая миграция данных: Интегрирована интеллектуальная система миграции для автоматического обновления устаревших конфигураций подсказок до надежного формата JSON v2 при первом запуске без потери данных.
- Обновленная совместимость (2025.1): Установлена минимальная требуемая версия NVDA 2025.1 из-за зависимостей библиотек в расширенных функциях, таких как Чтение документов, для обеспечения стабильной работы.
- Оптимизированный интерфейс настроек: Упрощен интерфейс настроек путем перемещения управления подсказками в отдельный диалог, что обеспечивает более чистый и доступный пользовательский опыт.
- Руководство по переменным подсказок: Добавлено встроенное руководство в диалогах подсказок, чтобы помочь пользователям легко идентифицировать и использовать динамические переменные, такие как [selection], [clipboard] и [screen_obj].
Изменения для 4.0.3
- Повышенная устойчивость сети: Добавлен механизм автоматического повторения попыток для лучшей обработки нестабильных интернет-соединений и временных ошибок сервера, обеспечивая более надежные ответы ИИ.
- Диалог визуального перевода: Представлено специальное окно для результатов перевода. Пользователи теперь могут легко перемещаться и читать длинные переводы построчно, аналогично результатам OCR.
- Агрегированное форматированное представление: Функция "Просмотр форматированного" в Чтении документов теперь отображает все обработанные страницы в одном организованном окне с четкими заголовками страниц.
- Оптимизированный рабочий процесс OCR: Автоматически пропускает выбор диапазона страниц для одностраничных документов, делая процесс распознавания быстрее и удобнее.
- Улучшенная стабильность API: Переход на более надежный метод аутентификации на основе заголовков, что устраняет потенциальные ошибки "All API Keys failed", вызванные конфликтами переключения ключей.
- Исправления ошибок: Устранены несколько потенциальных сбоев, включая проблему при завершении работы дополнения и ошибку фокуса в диалоге чата.
Изменения для 4.0.1
- Расширенное чтение документов: Мощный новый просмотрщик для PDF и изображений с выбором диапазона страниц, фоновой обработкой и удобной навигацией
Ctrl+PageUp/Down.
- Новое подменю Инструменты: Добавлено специальное подменю "Vision Assistant" в меню Сервисы NVDA для быстрого доступа к основным функциям, настройкам и документации.
- Гибкая настройка: Теперь вы можете выбрать предпочитаемый движок OCR и голос TTS непосредственно на панели настроек.
- Поддержка нескольких ключей API: Добавлена поддержка нескольких ключей Gemini API. Вы можете вводить по одному ключу на строку или разделять их запятыми в настройках.
- Альтернативный движок OCR: Представлен новый движок OCR для обеспечения надежного распознавания текста даже при достижении лимита квоты Gemini API.
- Умное переключение ключей API: Автоматически переключается на и запоминает самый быстрый работающий ключ API для обхода ограничений квоты.
- Документ в MP3/WAV: Интегрирована возможность генерировать и сохранять высококачественные аудиофайлы в форматах MP3 (128 кбит/с) и WAV непосредственно в просмотрщике.
- Поддержка историй Instagram: Добавлена возможность описывать и анализировать истории Instagram по их URL.
- Поддержка TikTok: Представлена поддержка видео TikTok, позволяющая проводить полное визуальное описание и транскрипцию аудио клипов.
- Переработанный диалог обновлений: Новый доступный интерфейс с прокручиваемым текстовым полем для четкого чтения изменений версии перед установкой.
- Унифицированный статус и UX: Стандартизированы диалоги выбора файлов в дополнении и улучшена команда 'L' для отчета о прогрессе в реальном времени.
Изменения для 3.6.0
- Справочная система: Добавлена команда справки (
H) в Слое команд для быстрого доступа к списку всех сочетаний клавиш и их функций.
- Анализ онлайн-видео: Расширена поддержка, включая видео Twitter (X). Также улучшено обнаружение URL и стабильность для более надежной работы.
- Вклад в проект: Добавлен опциональный диалог пожертвований для пользователей, желающих поддержать будущее обновление и постоянный рост проекта.
Изменения для 3.5.0
- Слой команд: Представлена система Слоя команд (по умолчанию:
NVDA+Shift+V) для группировки сочетаний клавиш под одной мастер-клавишей. Например, вместо нажатия NVDA+Control+Shift+T для перевода, теперь вы нажимаете NVDA+Shift+V, а затем T.
- Анализ онлайн-видео: Добавлена новая функция для анализа видео с YouTube и Instagram путем предоставления URL.
Изменения для 3.1.0
- Режим прямого вывода: Добавлена опция для пропуска диалога чата и прослушивания ответов ИИ напрямую через речь для более быстрого и удобного взаимодействия.
- Интеграция с буфером обмена: Добавлена новая настройка для автоматического копирования ответов ИИ в буфер обмена.
Изменения для 3.0
- Новые языки: Добавлены переводы на Персидский и Вьетнамский.
- Расширенные ИИ-модели: Реорганизован список выбора моделей с четкими префиксами (
[Free], [Pro], [Auto]), чтобы помочь пользователям различать бесплатные и платные (с ограничениями) модели. Добавлена поддержка Gemini 3.0 Pro и Gemini 2.0 Flash Lite.
- Стабильность диктовки: Значительно улучшена стабильность Умного диктофона. Добавлена проверка безопасности для игнорирования аудиоклипов короче 1 секунды, предотвращая галлюцинации ИИ и ошибки пустого ввода.
- Обработка файлов: Исправлена проблема, из-за которой загрузка файлов с не-английскими именами приводила к сбою.
- Оптимизация подсказок: Улучшена логика перевода и структурированы результаты Зрения.
Изменения для 2.9
- Добавлены переводы на Французский и Турецкий языки.
- Форматированное представление: Добавлена кнопка "Просмотр форматированного" в диалогах чата для просмотра беседы с правильным стилем (Заголовки, Жирный шрифт, Код) в стандартном окне для навигации.
- Настройка Markdown: Добавлена новая опция "Очищать Markdown в чате" в Настройках. Снятие флажка позволяет пользователям видеть сырой синтаксис Markdown (например,
**, #) в окне чата.
- Управление диалогами: Исправлена проблема, когда окна "Редактирования текста" или чата открывались несколько раз или не фокусировались правильно.
- Улучшения UX: Стандартизированы заголовки диалогов выбора файлов на "Открыть" и удалены избыточные речевые объявления (например, "Открытие меню...") для более плавного взаимодействия.
Изменения для 2.8
- Добавлен итальянский перевод.
- Отчет о статусе: Добавлена новая команда (NVDA+Control+Shift+I) для объявления текущего статуса дополнения (например, "Загрузка...", "Анализ...").
- Экспорт HTML: Кнопка "Сохранить содержимое" в диалогах результатов теперь сохраняет вывод в виде отформатированного HTML-файла, сохраняя такие стили, как заголовки и жирный текст.
- Интерфейс настроек: Улучшен макет панели настроек с доступной группировкой.
- Новые модели: Добавлена поддержка gemini-flash-latest и gemini-flash-lite-latest.
- Языки: Добавлен непальский в список поддерживаемых языков.
- Логика меню редактирования: Исправлен критический баг, из-за которого команды "Редактирования текста" не работали, если язык интерфейса NVDA не был английским.
- Диктовка: Улучшено обнаружение тишины для предотвращения неверного вывода текста, когда нет речевого ввода.
- Настройки обновлений: "Проверять обновления при запуске" теперь отключено по умолчанию в соответствии с политикой Магазина дополнений.
- Очистка кода.
Изменения для 2.7
- Миграция структуры проекта на официальный шаблон дополнений NV Access для лучшего соответствия стандартам.
- Реализована автоматическая логика повторных попыток для ошибок HTTP 429 (Превышение лимита запросов) для обеспечения надежности при высокой нагрузке.
- Оптимизированы подсказки перевода для более высокой точности и улучшенной логики "Умной замены".
- Обновлен русский перевод.
Изменения для 2.6
- Добавлена поддержка русского перевода (Спасибо nvda-ru).
- Обновлены сообщения об ошибках для предоставления более информативной обратной связи о подключении.
- Изменен целевой язык по умолчанию на английский.
Изменения для 2.5
- Добавлена команда нативного OCR файла (NVDA+Control+Shift+F).
- Добавлена кнопка "Сохранить чат" в диалоги результатов.
- Реализована полная поддержка локализации (i18n).
- Перенос аудиообратной связи на нативный модуль тонов NVDA.
- Переход на Gemini File API для лучшей обработки PDF и аудиофайлов.
- Исправлен сбой при переводе текста, содержащего фигурные скобки.
Изменения для 2.1.1
- Исправлена проблема, из-за которой переменная
[file_ocr] не работала в Пользовательских подсказках.
Изменения для 2.1
- Стандартизированы все сочетания клавиш для использования NVDA+Control+Shift для устранения конфликтов с раскладкой Laptops NVDA и системными горячими клавишами.
Изменения для 2.0
- Реализована встроенная система автоматического обновления.
- Добавлен Умный кеш перевода для мгновенного получения ранее переведенного текста.
- Добавлена Память беседы для контекстного уточнения результатов в диалогах чата.
- Добавлена специальная команда перевода буфера обмена (NVDA+Control+Shift+Y).
- Оптимизированы подсказки ИИ для строгого соблюдения целевого языка вывода.
- Исправлен сбой, вызванный специальными символами во входном тексте.
Изменения для 1.5
- Добавлена поддержка более чем 20 новых языков.
- Реализован интерактивный диалог уточнения для дополнительных вопросов.
- Добавлена нативная функция Умного диктофона.
- Добавлена категория "Vision Assistant" в диалог Жесты ввода NVDA.
- Исправлены сбои COMError в определенных приложениях, таких как Firefox и Word.
- Добавлен автоматический механизм повторных попыток для ошибок сервера.
Изменения для 1.0