Vis Aware

Vis Aware — це додаток для NVDA, призначений для розпізнавання тексту (OCR), опису зображень, автоматичного розпізнавання та керування комп’ютером за допомогою ШІ.

Для роботи Vis Aware потрібна версія NVDA 2026.1 або пізніша. Більшість хмарних сервісів потребують підключення до Інтернету та облікових даних для доступу. Ollama може використовувати як локальний, так і хмарний сервіс.

Режими та джерела розпізнавання

Vis Aware пропонує три режими:

OCR та опис зображень можуть використовувати такі джерела розпізнавання:

У режимі «ШІ помічника» використовується безпосередньо екран, а не вибране джерело розпізнавання.

Доступні сервіси

Сервіси OCR:

Сервіси опису зображень:

Сервіси ШІ помічника:

Доступність сервісу залежить від його обслуговування та конфігурації.

Рекомендоване офлайн-налаштування: Gemma 4 через Ollama

Для автономної конфігурації з власним сервером ми рекомендуємо запустити локально модель Gemma 4 з підтримкою обробки зображень за допомогою Ollama. Після завантаження моделі та налаштування URL API на локальний сервіс Vis Aware надсилає зображення на цей локальний сервіс. Якщо ви використовуєте віддалену адресу Ollama, що розміщена на чужому сервері, дані надсилаються на цей віддалений сервіс.

Використовуйте Ollama Vision для опису зображень, (OCR) та розпізнавання діаграм або математичних формул. Коли результати тексту показуються у повідомленні, яке можна переглядати, підтримувані формули та таблиці доступні для навігації за допомогою екранного зчитувача.

Сервіс Google Gemma наразі пропонує Gemma 4 26B A4B IT (рекомендовано, швидше) та Gemma 4 31B IT (вища якість, повільніше). Назви моделей Ollama залежать від моделей, встановлених в Ollama; використовуйте функцію Отримати моделі, щоб вибрати одну з них.

Команди

Наступні команди мають початкові комбінації клавіш:

Команда Комбінація
Запустити Vis Aware з поточними налаштуваннями NVDA+Alt+Space
Задати додаткове питання щодо опису попереднього зображення NVDA+Alt+Q
Перемикання режиму Vis Aware NVDA+Alt+1
Перемикання сервісу для поточного режиму NVDA+Alt+2
Перемикання джерел розпізнавання NVDA+Alt+3

Наступні команди не мають призначеної комбінації клавіш:

Після призначення комбінації для функції Описати зображення з буфера обміну натисніть її один раз, щоб відкрити документ із результатами розпізнавання, або двічі, щоб отримати результат у вигляді простого тексту.

Призначити або змінити комбінації клавіш можна у діалозі Меню NVDA > Параметри > Жести вводу..., у розділі Vis Aware.

У режимах OCR та опису зображень ця основна команда використовує вибраний сервіс та джерело. Натисніть її один раз, щоб відкрити документ із результатами розпізнавання NVDA, або двічі, щоб отримати результат у вигляді простого тексту. У режимі ШІ помічника ця команда відкриває запит на виконання завдання; повторне натискання цієї команди під час роботи помічника зупиняє його.

Команда циклічного перемикання джерел недоступна в режимі ШІ помічника. Вона дотримується фіксованого порядку, зазначеного вище, та включає лише джерела, позначені на панелі загальних налаштувань.

Результати розпізнавання

Результати OCR із координатами можна активувати безпосередньо з документа розпізнавання: якщо координати доступні, натисніть Enter або Пробіл, щоб активувати (зазвичай це клік мишею) текст під курсором.

Початково результати у вигляді простого тексту оголошуються безпосередньо або ж показуються у повідомленні з можливістю перегляду, якщо ввімкнено відповідну функцію. У таких повідомленнях показується підтримувана розмітка Markdown та математичні формули. Результати також можна скопіювати в буфер обміну, а документи з результатами розпізнавання можуть зчитуватися автоматично.

Зберігається лише попередній результат розпізнавання поточного сеансу NVDA. Команда додаткового питання відкриває діалог у форматі бесіди для підтримуваних сервісів опису зображень та транслює голосові відповіді, якщо це підтримується. У цьому діалозі комбінація control+enter надсилає питання, а escape — скасовує запит або закриває діалог. Скористайтеся функцією «Відкрити відформатовану відповідь», щоб переглянути її у вигляді відформатованого повідомлення з можливістю навігації.

Додаткові питання підтримують Google Gemini, Google Gemma, Kimi, VIVO BlueLLM Vision та Ollama Vision. Для основних результатів розпізнавання голосовий вивід підтримується в описі зображень Google Gemini, Kimi, VIVO BlueLLM Vision, Ollama Vision та Ollama OCR, якщо активовано цю функцію і не використовуються повідомлення з можливістю навігації.

Автоматичне розпізнавання

Автоматичне розпізнавання початково вимкнено. На панелі «Автоматичне розпізнавання» виберіть «OCR» або «Опис зображення», а потім виберіть поточний сервіс або конкретний увімкнений сервіс. Якщо поле підказки залишити порожнім для опису зображення, Vis Aware використає стислу підказку за замовчуванням (20–30 символів без Markdown). Ви також можете встановити власну підказку і модель, а також отримати список доступних назв моделей.

Автоматичне розпізнавання працює у фоновому режимі, коли фокус системи, курсор режиму огляду або об’єкт навігатора переміщується на підтримуване зображення, графічний елемент або елемент керування, схожий на зображення. Результат оголошується автоматично та зберігається як попередній результат; додаткові питання доступні, якщо це підтримується сервісом.

Для веб графіки Vis Aware зазвичай використовує URL зображення, надану об’єктом, якщо придатного URL немає, застосовує знімок екрана об’єкта. Параметр «Для об’єктів веб зображень Надавати перевагу знімкам екрана» спочатку використовує видиме зображення, а якщо знімок екрана неможливо зробити, застосовує URL.

Режим ШІ помічника

ШІ помічник запитує завдання, починає з поточного активного вікна і може працювати у різних вікнах. Він може клацати мишкою, вводити текст, натискати клавіші, прокручувати, перетягувати, здійснювати навігацію, очікувати та запитувати у вас інформацію за потреби. Дії не підтверджуються окремо, тому стежте за сеансом і зупиняйте його за потреби.

ШІ помічник не працює, коли увімкнено екранну завісу.

Налаштування

Відкрийте меню NVDA > Параметри > Відкрити налаштування Vis Aware.

Діалог налаштувань містить такі панелі:

Вимкнені сервіси пропускаються під час звичайного використання та циклічного перемикання. Щонайменше один сервіс має залишатися увімкненим у кожному режимі.

Для PaddleOCR / PaddleOCR-VL налаштування OCR підтримують API завдань, розміщений на AI Studio, розгорнутий сервіс AI Studio або локально розміщений сервіс PaddleOCR.

Для сервісу Ollama введіть повний URL API або назву хоста та порт, наприклад localhost:11434. Кореневий каталог API початково — http://localhost:11434/api. Скористайтеся функцією Отримати моделі, щоб завантажити назви моделей, а потім виберіть модель. Якщо модель не вибрано, використовується перша модель, повернута Ollama. Ключ API надсилається як токен Authorization: Bearer. Сервіс Ollama вимагає моделі з підтримкою обробки зображень, наприклад Gemma 4; Ollama OCR надає координати екрану лише тоді, коли модель повертає дійсні структуровані дані OCR.

Сервіси Kimi початково використовують офіційну сумісну з OpenAI базову URL-адресу Kimi Code https://api.kimi.com/coding/v1. Введіть ключ API, виданий для цієї кінцевої точки. Щоб натомість використовувати публічний API Kimi, установіть базову URL-адресу https://api.moonshot.ai/v1 та використовуйте ключ публічного API. Початкова модель — Kimi K3; доступні моделі та параметри міркування залежать від кінцевої точки й сімейства моделей.

Дані

Функція розпізнавання надсилає вибране зображення та, за необхідності, запит до сервісу, налаштованого для вибраної моделі. Кожен крок ШІ помічника надсилає знімок екрана, що охоплює всю площу екрану на всіх дисплеях, до вибраного сервісу; знімок екрана може містити інші вікна. Ознайомтеся з політикою щодо даних сервісу та уникайте надсилання конфіденційного вмісту.

Для ручного розпізнавання з джерела, відмінного від буфера обміну, необхідно вимкнути функцію екранної завіси. Пароль NVDACN захищений за допомогою Windows DPAPI. Інші збережені ключі API та токени зберігаються в налаштуваннях NVDA.

Ліцензія

Цей проєкт ліцензовано за Загальною публічною ліцензією GNU версії 2. Див. COPYING.txt для отримання детальної інформації.