SmartVisionary (Интеллектуальное видение)

Smart Visionary — это дополнение для NVDA, предназначенное для диктовки с помощью ИИ, перезаписи текста из буфера обмена, суммаризации, перевода, описания экрана и изображений, распознавания символов (OCR), работы с PDF, расшифровки медиа, синтеза речи, экспорта результатов, резервного копирования настроек и чата с ИИ.

Управление через меню

В этой версии не назначены стандартные комбинации клавиш. Откройте меню NVDA → Сервис → Smart Visionary как подменю, чтобы запускать функции дополнения напрямую. Пользователи по-прежнему могут назначать собственные комбинации в диалоге жестов ввода NVDA в категории Smart Visionary.

Стабильность и очистка

Ресурсоёмкие задачи ИИ, OCR, PDF, медиа и синтеза речи выполняются в фоновом режиме, и одновременно разрешена только одна такая задача, чтобы сохранить отзывчивость NVDA. Временные записи диктовки удаляются после успешной или неудачной расшифровки. Дополнение также освобождает ресурсы записи при завершении или перезапуске NVDA.

Подсказки, стили и диалекты

В подсказках (промптах) теперь используются строгие правила вывода, предписывающие системам ИИ возвращать только конечный результат без обёрток Markdown, вступлений и заключений. Стили написания управляются отдельно от настроек языка и диалекта, поэтому пользователь может сочетать любой поддерживаемый стиль с любым поддерживаемым диалектом. Пользовательские стили написания можно создавать и изменять в окне настроек.

Синтез речи

Для синтеза речи предусмотрен отдельный диалог настройки движка, голоса, языка, стиля, диалекта, эмоций, темпа синхронизации губ, режима сохранения и выходной папки. Сохранённые аудиофайлы Gemini по умолчанию сохраняются в папку «Загрузки\SmartVisionary\Audio».

Инструменты для работы с PDF и сканерами

Извлечение текста из PDF сначала пытается использовать доступный чистый Python-экстрактор PDF, а затем переключается на OCR от Gemini для сканированных PDF. Экспортированный текст из PDF сохраняется в формате UTF-8 TXT для избежания нечитаемых символов. Инструменты для работы с документами включают преобразование PDF в TXT, PDF в Word, PDF в аудио, PDF в изображения, объединение PDF, разделение PDF, шифрование PDF, расшифровку PDF, преобразование TXT в PDF, Word в TXT, Word в изображения, Word в аудио, распознавание текста на изображениях, пакетное распознавание текста на изображениях, объединение изображений в PDF при наличии библиотеки Pillow и преобразование изображений в чёрно-белый формат.

Перевод и персонажи с ИИ

Команда перевода длинных текстов позволяет пользователю вставить текст, использовать настроенные исходный и целевой языки и выполнить перевод с коррекцией ИИ с сохранением смысла и структуры. Менеджер персонажей/образов (persona) с ИИ позволяет пользователям создавать собственных виртуальных персонажей с их собственными подсказками.

Режим без ключа

Облачные провайдеры требуют действительные API-ключи. Локальные модели Ollama предлагаются как вариант без ключа и требуют, чтобы Ollama работала локально с установленной выбранной моделью.

Совместимость

Дополнение нацелено на NVDA 2019.1 и новее, с возможными откатами к старым API настроек и меню NVDA, где это возможно.