Smart Visionary — это дополнение для NVDA, предназначенное для диктовки с помощью ИИ, перезаписи текста из буфера обмена, суммаризации, перевода, описания экрана и изображений, распознавания символов (OCR), работы с PDF, расшифровки медиа, синтеза речи, экспорта результатов, резервного копирования настроек и чата с ИИ.
В этой версии не назначены стандартные комбинации клавиш. Откройте меню NVDA → Сервис → Smart Visionary как подменю, чтобы запускать функции дополнения напрямую. Пользователи по-прежнему могут назначать собственные комбинации в диалоге жестов ввода NVDA в категории Smart Visionary.
Ресурсоёмкие задачи ИИ, OCR, PDF, медиа и синтеза речи выполняются в фоновом режиме, и одновременно разрешена только одна такая задача, чтобы сохранить отзывчивость NVDA. Временные записи диктовки удаляются после успешной или неудачной расшифровки. Дополнение также освобождает ресурсы записи при завершении или перезапуске NVDA.
В подсказках (промптах) теперь используются строгие правила вывода, предписывающие системам ИИ возвращать только конечный результат без обёрток Markdown, вступлений и заключений. Стили написания управляются отдельно от настроек языка и диалекта, поэтому пользователь может сочетать любой поддерживаемый стиль с любым поддерживаемым диалектом. Пользовательские стили написания можно создавать и изменять в окне настроек.
Для синтеза речи предусмотрен отдельный диалог настройки движка, голоса, языка, стиля, диалекта, эмоций, темпа синхронизации губ, режима сохранения и выходной папки. Сохранённые аудиофайлы Gemini по умолчанию сохраняются в папку «Загрузки\SmartVisionary\Audio».
Извлечение текста из PDF сначала пытается использовать доступный чистый Python-экстрактор PDF, а затем переключается на OCR от Gemini для сканированных PDF. Экспортированный текст из PDF сохраняется в формате UTF-8 TXT для избежания нечитаемых символов. Инструменты для работы с документами включают преобразование PDF в TXT, PDF в Word, PDF в аудио, PDF в изображения, объединение PDF, разделение PDF, шифрование PDF, расшифровку PDF, преобразование TXT в PDF, Word в TXT, Word в изображения, Word в аудио, распознавание текста на изображениях, пакетное распознавание текста на изображениях, объединение изображений в PDF при наличии библиотеки Pillow и преобразование изображений в чёрно-белый формат.
Команда перевода длинных текстов позволяет пользователю вставить текст, использовать настроенные исходный и целевой языки и выполнить перевод с коррекцией ИИ с сохранением смысла и структуры. Менеджер персонажей/образов (persona) с ИИ позволяет пользователям создавать собственных виртуальных персонажей с их собственными подсказками.
Облачные провайдеры требуют действительные API-ключи. Локальные модели Ollama предлагаются как вариант без ключа и требуют, чтобы Ollama работала локально с установленной выбранной моделью.
Дополнение нацелено на NVDA 2019.1 и новее, с возможными откатами к старым API настроек и меню NVDA, где это возможно.