Документація Vision Assistant Pro
Vision Assistant Pro
Vision Assistant Pro — це вдосконалений мультимодальний ШІ-помічник для NVDA. Він використовує механізми штучного інтелекту світового класу, щоб забезпечити інтелектуальне читання з екрана, переклад, голосовий диктант і аналіз документів.
Цей додаток був випущений для спільноти на честь Міжнародного дня людей з інвалідністю.
1. Встановлення та налаштування
Перейдіть до Меню NVDA > Параметри > Налаштування > Vision Assistant Pro.
1.1 Вкладка «Параметри підключення»
- Постачальник: Виберіть бажаний сервіс штучного інтелекту. Підтримувані постачальники: Google Gemini, OpenAI, Mistral, Groq, MiniMax, Користувацькі (OpenAI-сумісні сервери, такі як Ollama/LM Studio), Jan.ai, або KoboldCPP.
- Важлива примітка: Ми наполегливо рекомендуємо використовувати Google Gemini для найкращої продуктивності та точності (особливо для аналізу зображень/файлів).
- Ключ API: Обов'язково. Ви можете ввести кілька ключів (через кому або з нового рядка) для автоматичної зміни.
- Завантажити моделі: Після введення ключа API натисніть цю кнопку, щоб завантажити останній список доступних моделей від постачальника.
- Модель ШІ: Виберіть основну модель, яка використовується для загального чату та аналізу.
- Налаштування користувацького постачальника: Налаштуйте локальні або користувацькі кінцеві точки. Включає Налаштування локального ШІ (налаштування одним натисканням для Ollama, LM Studio, Jan.ai або KoboldCPP) та Розширене налаштування кінцевої точки.
- Розширена модель маршрутизації (для конкретних завдань): За потреби виберіть спеціальні моделі з випадаючих списків для завдань OCR, STT, TTS, оператора ШІ, відео та Live помічника.
- Параметри підключення та виводу: Налаштуйте URL проксі-сервера, перевірки оновлень під час запуску, очищення Markdown у чаті, копіювання відповідей ШІ в буфер обміну, прямий вивід (без вікна чату) та прямий вивід Live помічника.
1.2 Вкладка «Поведінка ШІ»
- Креативність (Температура): Регулює ступінь випадковості та креативності ШІ (від 0,0 до 2,0). Нижчі значення забезпечують більш детерміновані та точні результати перекладу/OCR.
1.3 Вкладка «Мови перекладу»
- Початкова мова: Виберіть мову введення.
- Мова для перекладу: Виберіть мову перекладу.
- Мова відповідей ШІ: Виберіть мову для загальних відповідей ШІ.
- «Автоматична зміна мови»: Автоматично змінює місцями мови оригіналу та перекладу на основі виявленого введеного тексту.
1.4 Вкладка «Читач документів»
- Механізм OCR: Виберіть між Chrome (Швидкий) для швидких результатів або ШІ (Розширений) для кращого збереження форматування.
- Розмір пакета OCR: Вкажіть кількість сторінок на запит (встановіть значення 0 для обробки одного запиту).
- Опис зображень у тексті: увімкніть або вимкніть опис зображень у тексті під час видобування тексту з документа.
- Експорт номерів сторінок: увімкніть або вимкніть показ номерів сторінок та роздільників у багатосторінкових документах.
- Голос TTS: виберіть початковий стиль голосу для генерації аудіо.
1.5 Вкладка «Відео»
- Розмір фрагмента відео: Тривалість сегмента в хвилинах для генерації аудіоопису (встановіть значення 0, щоб обробити весь файл).
- Додати список персонажів: Функція додавання словника персонажів як першого запису субтитрів.
- Додати застереження щодо ШІ: Функція вставки застереження щодо ШІ на початку субтитрів SRT до відео.
1.6 Вкладка «КАПЧА»
- Увімкнути автоматичне розпізнавання візуальних CAPTCHA: Увімкнути або вимкнути автоматичне розпізнавання візуальних CAPTCHA (hCaptcha, reCAPTCHA).
- Метод розпізнавання текстових CAPTCHA: Оберіть між захопленням об’єкта навігатора або всього екрана.
1.7 Вкладка «Підказки»
- Керування підказками: відкриває спеціальний діалог для налаштування системних підказок або створення, редагування, зміни порядку та попереднього перегляду власних підказок із динамічними змінними (наприклад,
[selection], [screen_fg_obj]).
1.8 Вкладка «Додаткові налаштування» та глобальне ведення журналу
Перейдіть на вкладку «Додаткові налаштування», щоб налаштувати глобальне ведення журналу для додатка:
- Увімкнути окремий файл журналу: вмикає або вимикає запис усіх операційних подій, трафіку API та помилок у всіх модулях додатка в окремий файл (vision_assistant.log).
- Рівень журналу: виберіть рівень деталізації: Налагодження (усі деталі), Інформація (загальна інформація), Попередження (лише попередження) та Помилка (лише помилки).
- Зберігати журнали протягом: Встановіть автоматичні періоди зберігання, щоб автоматично очищати старі записи журналу (від 1 години до 90 днів).
- Елементи керування журналами: Використовуйте Відкрити файл журналу, Відкрити папку журналу або Очистити файл журналу, щоб переглянути або очистити дані журналу безпосередньо, не перезапускаючи NVDA та не впливаючи на стандартні журнали NVDA.
2. Командний шар і комбінації клавіш
Щоб запобігти конфліктам клавіатури, цей додаток використовує командний шар.
1. Натисніть NVDA + Shift + V (головна клавіша), щоб активувати командний рівень (ви почуєте звуковий сигнал).
2. Відпустіть клавіші, а потім натисніть одну з наступних клавіш:
| Клавіша |
Функція |
Опис |
| Shift + A |
Оператор ШІ |
Автономна робота: доручіть ШІ виконати завдання на вашому екрані. Повторне натискання цієї комбінації миттєво припиняє поточні операції. |
| E |
UI Провідник |
Інтерактивне натискання: Виявляє та натискає елементи інтерфейсу в будь-якій програмі. |
| T |
Розумний перекладач |
Перекладає текст під курсором навігатора або виділений текст. |
| Shift + T |
Перекладач буфера обміну |
Перекладає вміст у буфері обміну. |
| R |
Уточнення тексту |
Підсумувати, виправити граматику, пояснити або запустити Користувацькі підказки. |
| V |
Об'єктне бачення |
Описує поточний об'єкт навігатора. |
| O |
Весь екран |
Аналізує весь макет екрана та його вміст. |
| Shift + V |
Онлайн аналіз відео |
Аналізуйте відео YouTube, Instagram або Twitter (X) за допомогою URL-адреси. |
| Control + V |
Запис локального відео |
Записує відео з екрану без звуку та аналізує дії й розташування елементів. |
| D |
Читач документів |
Розширений читач для перегляду PDF-файлів та зображень із можливістю вибору діапазону сторінок. |
| F |
Розумна обробка файлів |
Розпізнавання з урахуванням контексту на основі вибраних файлів у форматі зображення, PDF або TIFF. |
| A |
Аудіотранскрипція |
Транскрибувати файли MP3/WAV/OGG. |
| C |
Розв'язувач CAPTCHA |
Автоматично захоплює та вирішує CAPTCHA. |
| Shift + C |
Прямий чат |
Відкриває діалог прямого текстового чату з ШІ. |
| S |
Розумне диктування |
Перетворює мовлення в текст. Натисніть, щоб почати запис, ще раз, щоб зупинити/ввести текст. |
| L |
Підпис об'єкта |
Семантичний підпис ШІ: Назавжди підписує поточний сфокусований елемент/іконку. |
| Control+L |
Live помічник |
Робота у режимі реального часу (лише для Gemini): Запускає або завершує розмову з голосовим та екранним супроводом за допомогою ШІ. |
| Control+T |
Голосовий переклад |
Розпізнає, перекладає та вводить текст відповідно до ваших мовних налаштувань. |
| Shift + L |
Керування/Сканування підписів |
Відкриває Менеджер підписів (якщо підписи існують) або сканує програму на наявність елементів без назви. |
| I |
Повідомити про стан |
Повідомляє про поточний стан (наприклад, «Завантаження...», «Бездіяльність»). |
| Пробіл |
Показати останній результат |
Показує останню відповідь ШІ у діалозі чату для перегляду або подальших дій. |
| U |
Перевірка оновлень |
Перевіряє наявність останньої версії на GitHub. |
| H |
Довідка по командах |
Показує повний список всіх доступних комбінацій клавіш та їх описів у командному рівні. |
| Alt + S |
Налаштування |
Відкриває діалог налаштувань Vision Assistant Pro. |
| Alt + Q |
Звіт про вичерпані квоти ключів |
Повідомляє про кількість ключів API Gemini, які перевищили свою добову квоту, та час їх скидання. |
| Alt + M |
Аудит маршрутизації |
Створює звіт про моделі ШІ, які наразі обрано в режимі розширеної маршрутизації. |
2.1 комбінації клавіш у читачі документів
- Ctrl + Сторінка вниз: Перейти до наступної сторінки (оголошує номер сторінки).
- Ctrl + Сторінка вниз: Перейти до попередньої сторінки (оголошує номер сторінки).
- Alt + A: Відкрити чат для запитань щодо документа.
- Alt + R: Примусово пересканувати поточну або всі сторінки через двигун Gemini.
- Alt + G: Згенерувати та зберегти якісний аудіофайл (WAV) із вмісту.
- Alt + S / Ctrl + S: Зберегти витягнутий текст як TXT або HTML файл.
3. Оператор ШІ – автономне комп’ютерне керування
Оператор ШІ перетворює Vision Assistant Pro з пасивного зчитувача на активного помічника, який може взаємодіяти з комп'ютером замість вас. Ви можете просити його описати екран, відповісти на запитання про те, що він бачить або навіть надати йому керування: він натискатиме кнопки, перетягуватиме об’єкти, вводитиме текст і працюватиме в програмах за допомогою звичайних голосових чи текстових команд.
Найбільша перевага? Додаток бездоганно працює навіть у програмному забезпеченні, яке взагалі не підтримує функції доступності. Якщо ви опинилися в ситуації, коли екранний зчитувач повністю замовкає — наприклад, у програмі, на віддаленому робочому столі або на веб-сайті, — оператору це не заважає. Оскільки додаток «бачить» екран візуально, він може знаходити, зчитувати та взаємодіяти з елементами, які не мають жодних міток доступності.
Як це працює
- Натисніть NVDA + Shift + V, потім Shift + A (або використайте пряму комбінацію клавіш), щоб відкрити діалог оператора ШІ.
- Введіть своє завдання звичайною мовою (наприклад, «Натисни кнопку Зберегти», «Що написано в повідомленні про помилку?» або «Перейменуй файл у final.pdf»).
- ШІ проаналізує ваш екран, знайде потрібні елементи, виконає дію або надасть відповідь. Якщо завдання складне, оператор виконуватиме його поетапно до завершення.
- Натисніть Shift + A у будь-який момент, щоб миттєво перервати поточну операцію.
Підтримувані дії
Оператор розуміє широкий спектр команд:
- Опис та відповідь: «Опиши розташування елементів на екрані» або «Що написано в повідомленні про помилку?»
- Клацнути: «Клацни кнопку “Зберегти”»
- Клацнути правою кнопкою: «Клацни правою кнопкою миші на файлі»
- Двічі клацнути: «Двічі клацни на документі»
- Перетягнути: «Перетягни документ у папку “Архів”»
- Ввести: «Введи «Погода сьогодні» у поле пошуку»
- Прокрутити: «Прокрути вниз три рази»
- Натиснути клавішу: «Натисни Enter», «Натисни Tab», «Натисни Escape»
- Багатоетапні завдання: «Відкрий Провідник, знайди звіт і перейменуй його на final.pdf»
Важливі примітки
- ⚠️ Попередження щодо використання API: Оскільки оператору потрібно «бачити» саме те, що відбувається на екрані, він надсилає знімок екрана з високою роздільною здатністю на кожному кроці. Часте використання цієї функції вичерпає вашу квоту API набагато швидше, ніж стандартні текстові функції.
- Застосування з правами адміністратора: Якщо NVDA не працює з правами адміністратора, користувач може не мати можливості взаємодіяти з вікнами, що вимагають підвищених прав доступу. Це обмеження системи безпеки Windows, а не помилка у роботі додатка.
- Рекомендації: Для досягнення найкращих результатів давайте чіткі та конкретні вказівки. Фраза «Натисни синю кнопку «Відправити» внизу форми» майже завжди дасть кращий результат, ніж просто «Натисни кнопку».
4. Аналіз відео та аудіоопис
Примітка: Функції аналізу відео та аудіоопису надаються виключно постачальником Google Gemini. Переконайтеся, що в налаштуваннях додатка вибрано Google Gemini як активного постачальника.
Vision Assistant Pro пропонує потужні можливості обробки відео, розроблені спеціально для незрячих користувачів. Він може аналізувати як онлайн-відео, так і локальні записи з екрана, щоб надавати високодетальні візуальні описи та створювати професійні сценарії аудіоопису (SRT).
4.1 Локальний запис екрана (Control + V)
Якщо на екрані з’явилося відео без звуку, анімація або навчальний посібник, ви можете записати його безпосередньо:
1. Натисніть NVDA + Shift + V, щоб перейти до командного шару, а потім натисніть Control + V.
2. Додаток почне непомітно записувати екран у фоновому режимі.
3. Натисніть Control + V ще раз, щоб зупинити запис.
4. Після цього ШІ проаналізує записаний фрагмент відео та надасть дуже детальний опис сцени, персонажів та дій.
4.2 Аналіз відео (Shift + V)
Ви можете аналізувати як локальні відеофайли, так і онлайн-відео. Просто виберіть локальний відеофайл у Провіднику Windows або скопіюйте посилання на онлайн-відео в буфер обміну. Ви також можете натиснути Shift + V у будь-якому місці (наприклад, у медіаплеєрі), щоб відкрити діалог, де можна вибрати відеофайл або вручну ввести URL.
- Підтримувані онлайн-платформи: YouTube, Instagram, TikTok та Twitter (X).
- ШІ автоматично виявить локальний файл або URL-адресу, обробить відео та надасть вичерпний візуальний опис та аудіоопис.
4.3 Генерація аудіоопису (SRT)
Для більш структурованої взаємодії додаток може генерувати професійні сценарії аудіоопису у стандартному форматі SubRip (SRT).
- Розумний таймінг пауз: ШІ аналізує аудіодоріжку та прив’язує візуальні описи безпосередньо до природних пауз та інтервалів тиші, що дозволяє інтелектуально мінімізувати перекриття діалогів.
- Відстеження персонажів: Сервіс здійснює попередній аналіз для виявлення унікальних персонажів на основі незмінних рис обличчя. Він створює глобальний словник для точного відстеження та підпису персонажів у різних сценах без виникнення плутанини.
- Дослівне розпізнавання тексту: Будь-який текст, що з’являється на екрані (вивіски, екрани телефонів, титри), цитується строго дослівно.
- Інструкція з використання: Щоб прослухати згенеровані субтитри, просто помістіть файл .srt в ту саму папку, що й відеофайл, і дайте йому точно таку саму назву. Потім налаштуйте свій медіаплеєр (наприклад, VLC або PotPlayer) для перенаправлення тексту субтитрів безпосередньо на ваш екранний зчитувач або рушій синтезу мовлення (TTS) під час відтворення.
4.4 Синхронізований аудіоопис (експорт в MP3)
Окрім простого створення текстових файлів SRT, додаток функціонує як повноцінний інструмент для створення аудіоопису, синтезуючи описи у мовлення та мікшуючи їх із відео. Під час генерації MP3-файлу для локальних відеофайлів доступно кілька режимів мікшування:
- Стандартний аудіоопис (мікшування голосу): Аудіоопис накладається безпосередньо поверх оригінального звуку відео. Вам буде запропоновано застосувати приглушення звуку (зниження фонової гучності під час відтворення опису) для забезпечення чіткості мовлення.
- Розширений аудіоопис (пауза аудіо): Додаток призупиняє оригінальний звук відео під час відтворення описів, гарантуючи, що ви не пропустите жодного слова з оригінального діалогу або озвучення від ШІ.
- Відео з YouTube: Для джерел із YouTube (які не завантажуються локально) експортований MP3-файл міститиме виключно синхронізовану голосову доріжку ШІ без фонового звуку відео.
5. Транскрипція та дубляж медіа (M)
Аудіотранскриптор було повністю перероблено для підтримки як аудіо, так і відеофайлів (MP3, WAV, MP4, MKV тощо). Натисніть M у командному шарі, щоб вибрати медіафайл і вибрати один із 3 різних режимів роботи:
1. Транскрибувати (мова оригіналу): точно транскрибує мовлення мовою оригіналу.
2. Транскрипція та переклад (мова для перекладу): транскрибує мовлення та перекладає його на вибрану вами мову для перекладу.
3. Дублювання та переклад (мова для перекладу) (лише для Gemini): потужна нова функція, яка транскрибує мовлення, перекладає його на вибрану вами мову для перекладу та озвучує аудіодубляж за допомогою TTS додатка.
6. Просунутий читач документів та зображень
Vision Assistant Pro містить високооптимізований засіб для читання документів, призначений для багатосторінкових PDF-файлів, складних зображень і навіть файлів у форматі HEIC з iPhone.
6.1 Пакетна обробка та поновлення
Вам не потрібно читати великий документ за один раз. Введіть діапазон сторінок (наприклад, 1-20), і ШІ обробить усі сторінки у фоновому режимі. Якщо NVDA зависне або ви перервете сканування, додаток запам’ятає ваш перебіг виконання і запропонує відновити саме з того місця, де ви зупинилися!
6.2 Розумна дія з файлом
Не завжди потрібно спочатку відкривати документ. У Провіднику Windows просто виберіть PDF-файл або зображення та натисніть D (Читач документів) або F (Розумна дія з файлом) у командному шарі. Додаток миттєво пропустить діалог файлу та почне обробку вибраного файлу.
6.3 Комбінації клавіш для перегляду документів
Коли діалог «читача документів» відкритий, ви можете використовувати такі комбінації клавіш:
- Ctrl + сторінка вниз: перейти на наступну сторінку.
- Ctrl + Сторінка вгору: перейти на попередню сторінку.
- Alt + A: відкрити діалог чату, щоб задати питання щодо документа.
- Alt + R: Примусово запустити повторне сканування за допомогою ШІ з використанням активного постачальника.
- Alt + G: Створити та зберегти високоякісний аудіофайл (WAV/MP3). (Приховано, якщо постачальник не підтримує TTS).
- Alt + S / Ctrl + S: Зберегти видобутий текст як файл у форматі TXT або HTML.
7. Семантичний підпис за допомогою ШІ та дослідник інтерфейсу користувача
Застрягли в програмі, де всюди «кнопки без підписів»? Механізм семантичного підпису на основі ШІ вирішує цю проблему раз і назавжди.
7.1 Постійне підписування об’єктів (L)
Сфокусуйте графічний елемент або кнопку без підпису та натисніть L у командному шарі. ШІ візуально проаналізує кнопку, визначить її функцію та застосує постійний підпис.
На відміну від старих інструментів підпису для екранних зчитувачів, цей додаток використовує вдосконалену гібридну систему «Object Signature» (AutomationId/ControlID). Ваші власні підписи збережуться навіть після зміни розміру вікна, перемикання моніторів та оновлень програми!
7.2 Повне сканування програми (Shift + L)
Натисніть Shift + L, щоб одночасно просканувати все активне вікно. ШІ знайде всі елементи без підписів і розумно присвоїть їм назви за один раз. Пізніше ви зможете керувати цими підписами, перейменовувати їх або видаляти пакетно за допомогою вбудованого менеджера підписів.
7.3 Провідник інтерфейсу користувача (E)
Потрібно взаємодіяти з елементом, не переходячи до нього вручну? Натисніть E, щоб активувати Провідник інтерфейсу користувача. ШІ просканує екран і згенерує доступний список усіх клікабельних елементів (ігноруючи системний шум, такий як панелі завдань). Виберіть елемент зі списку, і додаток миттєво клацне по ньому.
8. Голосовий помічник у реальному часі
Live Помічник перетворює Vision Assistant Pro на інтерактивного помічника, що працює в режимі реального часу.
(Примітка: ця функція доступна виключно для Google Gemini та сумісних із Gemini користувацьких провайдерів).
- Активація: Натисніть Control + L у командному шарі, щоб відкрити діалог Live помічника.
- Взаємодія в режимі реального часу: Говоріть природно через мікрофон. ШІ одночасно слухатиме ваш голос і стежитиме за активним екраном. Ви можете задавати питання на кшталт «На що я дивлюся?» або «Прочитай мені третій абзац».
- Налаштування: У діалозі ви можете змінити стиль голосу ШІ (наприклад, «Професійний», «Дружній», «Жвавий») та налаштувати його «Глибину міркування», щоб контролювати, наскільки глибоко він міркує перед тим, як відповісти.
9. Користувацькі підказки та змінні
Відкрийте Налаштування > Підказки > Керування підказками..., щоб налаштувати системні і користувацькі підказки.
- Вкладка Початкові підказки: редагуйте вбудовані підказки. Можна скинути одну підказку або всі початкові.
- Вкладка Користувацькі підказки: додавайте, редагуйте, видаляйте та змінюйте порядок власних підказок.
- Кнопка Посібник змінних: відкриває довідку зі всіма підтримуваними змінними й типами введення.
Доступні змінні
[selection]: Поточний вибраний текст.
[clipboard]: Вміст буфера обміну.
[screen_obj]: Знімок екрана об'єкта навігатора.
[screen_full]: Знімок всього екрана.
[file_ocr]: Вибрати файл зображення/PDF для видобування тексту.
[file_read]: Вибрати текстовий документ TXT, Код, PDF.
[file_audio]: Вибрати аудіофайл MP3, WAV, OGG.
{target_lang}: Поточна мова для перекладу.
{source_lang}: Поточна мова оригіналу.
{response_lang}: Поточна мова відповіді ШІ.
{swap_target}: Резервна мова для перекладу з використанням функції - розумна заміна «smart swap».
{swap_instruction}: Блок інструкцій для перекладу з використанням функції «smart swap».
Приклади користувацьких запитів
- Швидке розпізнавання:
Моє розпізнавання:[file_ocr]
- Перекласти зображення:
Перекласти зображення:Видобути текст з цього зображення та перекласти на перську мову. [file_ocr]
- Аналізувати аудіо:
Підсумувати аудіо:Прослухати цей запис та підсумувати основні моменти. [file_audio]
- Налагоджувач коду:
Налагодження:Знайдіть помилки в цьому коді та поясніть їх: [вибір]
Примітка. Для всіх функцій ШІ потрібне активне підключення до Інтернету. Багатосторінкові TIFF обробляються автоматично.
10. Реальні випадки використання (Яку функцію мені слід використовувати?)
Vision Assistant Pro оснащений безліччю сучасних інструментів. Ось кілька типових сценаріїв, які допоможуть вам вибрати потрібний:
-
Сценарій: Ви хочете зрозуміти повне розташування елементів у складному вікні або недоступній програмі.
Рішення: Натисніть O (оптичне розпізнавання та опис для всього екрана). ШІ проаналізує весь екран і точно опише, де розташовані елементи, тексти та кнопки.
-
Сценарій: Ви знайшли зображення на веб-сторінці або графічний об’єкт без підпису в документі.
Рішення: Сфокусуйте графічний об’єкт і натисніть V (Опис поточного об'єкта (об'єкта навігатора). ШІ детально опише, що саме зображено на цьому зображенні.
-
Сценарій: Ви хочете переглянути фільм або відеоролик із аудіоописами.
Рішення: Натисніть Shift + V під час перегляду відео та виберіть «Створити аудіоопис (файл SRT)». Після завершення натисніть «Створити синхронізований опис (MP3)» і виберіть «Розширений аудіоопис». Додаток створить аудіодоріжку, яка інтелектуально призупинятиме діалоги у фільмі, щоб описати візуальні сцени.
-
Ситуація: Ви зіткнулися з програмою, де багато «непідписаних кнопок».
Рішення: Натисніть L, щоб назавжди підписати конкретну кнопку за допомогою ШІ. Або натисніть Shift + L, щоб одночасно просканувати й підписати все вікно. Якщо ви просто хочете швидко натиснути на щось, натисніть E (UI Explorer), щоб отримати список усіх елементів, на які можна натиснути.
-
Ситуація: Вам потрібно обійти недоступну КАПЧУ.
Рішення: Натисніть C (Розв'язувач капчі). ШІ автоматично зчитає CAPTCHA, розгадає її та введе відповідь у відповідне поле.
-
Сценарій: Ви хочете прочитати довгий PDF-документ на 50 сторінок.
Рішення: Натисніть D (Читач документів), виберіть Google Gemini як постачальника послуг та введіть діапазон сторінок 1-50. Додаток точно видобуде текст у фоновому режимі.
-
Сценарій: Ви переглядаєте на екрані відеоурок або анімацію без звуку.
Рішення: Натисніть Control + V, щоб розпочати запис екрана. Дочекайтеся завершення відеоуроку, а потім знову натисніть Control + V. ШІ детально пояснить, що саме було продемонстровано на відео.
Примітка: Для роботи всіх функцій штучного інтелекту необхідне активне підключення до Інтернету. Багатосторінкові документи обробляються автоматично.
11. Підтримка та спільнота
Будьте в курсі останніх новин, функцій і випусків:
- Канал Telegram: t.me/VisionAssistantPro
- GitHub Issues для звітів про помилки та запитів на нові функції.
Якщо ви бажаєте фінансово підтримати проект, ви можете скористатися опцією «Пожертвувати» у меню NVDA «Інструменти» (підменю «Vision Assistant») або під час налаштування після встановлення.
Зміни від 06.08.2026
- Підписи в UI Explorer: Тепер ви можете додавати підписи безпосередньо до знайдених елементів у UI Explorer! Додано нову кнопку «Додати підпис», а інтерфейс розумно залишається відкритим і зберігає фокус, щоб ви могли швидко підписувати кілька об’єктів без переривання.
- Удосконалення командного шару: Шар Vision Assistant (
Insert+Shift+V) тепер є постійним і надзвичайно інтерактивним! Ви можете використовувати стрілки Вгору/Вниз для навігації між швидкими налаштуваннями (Постачальник, Модель, Мова відповіді ШІ, Модель TTS), а стрілки Вліво/Вправо — для миттєвої зміни їхніх значень із розумним і лаконічним голосовим супроводом. Ваші налаштування набувають чинності негайно (включно з автоматичним увімкненням розширеної маршрутизації за потреби), а шар залишається активним під час налаштування.
- Прямий чат (
Shift+C): До шару додано нову команду! Натисніть Shift+C, щоб миттєво відкрити діалог «Прямий чат». Це надає чіткий текстовий інтерфейс для спілкування з ШІ, без необхідності використовувати зображення чи документ як відправну точку.
- Бездоганне відновлення історії чату: Виправлено серйозну помилку, через яку натискання клавіші
Пробіл для виклику останнього результату призводило до втрати подальшої історії чату. Тепер додаток глобально відстежує вашу розмову. Якщо ви спілкуєтеся в чаті, закриваєте діалог, а потім натискаєте Пробіл, щоб відновити його, вся історія обміну повідомленнями ідеально відновлюється! Працює для Прямого чату, Аналізу зображень, Чату з документами та Перекладу.
- Вбудовані описи зображень під час OCR: Додано функцію опису зображень під час OCR документів. Ви можете вмикати та вимикати цю функцію в налаштуваннях OCR додатка, у параметрах «Читача документів» перед видобуванням тексту, а також швидко на льоту через панель «Швидких налаштувань».
- Голосовий переклад (
Control+T): Додано нову потужну функцію! Диктуйте текст, і він миттєво перекладатиметься та вводитиметься за допомогою ШІ на основі налаштованих вами початкової мови та мови для перекладу.
- Покращення завантажувача оновлень: Діалог завантаження оновлень тепер коректно показує перебіг завантаження у відсотках, а також виправлено помилку, через яку після скасування встановлення з’являлося фантомне повідомлення «Завантаження оновлення».
- Покращення завантажувача eSpeak-NG: Додано відстеження завантаження eSpeak-NG у відсотках.
- Надійність пакетного OCR: Виправлено проблему в пакетному OCR для PDF-файлів, через яку процес зупинявся, якщо активний ключ API досягав своєї квоти на; тепер система автоматично перемикається на наступний доступний ключ і відновлює процес.
- Підтримка візуальних капч: Додано надійну підтримку розпізнавання візуальних капч. Програма намагається автоматично розпізнавати складні зображення, такі як hCaptcha та reCAPTCHA, що значно покращує доступність складних веб-форм.
- Повна модернізація модуля Аудіо транскриптора: Модуль Аудіо транскриптор було повністю перероблено, і тепер він підтримує як аудіо-, так і відеофайли. Він має 3 окремі режими роботи: «Транскрибувати (мова оригіналу)», «Транскрибувати та перекласти (мова для перекладу)» та нову потужну функцію «Дублювати та перекласти (мова для перекладу)» (ексклюзивно для Gemini), яка генерує перекладене аудіодублювання мови оригіналу.
- Номери сторінок у читачі документів: Додано нове налаштування для ввімкнення чи вимкнення номерів сторінок та роздільників у багатосторінкових документах. Цю функцію можна легко налаштувати в основних налаштуваннях або вмикати/вимикати на льоту через панель швидких налаштуваннь. Ця функція застосовується як до експорту текстових/HTML-файлів, так і до вбудованого діалогу «Перегляд у форматованому вигляді», що дозволяє безперешкодно читати об’єднані документи.
- Необмежений Gemini Live TTS для відеоописів: Тепер ви можете вибрати «Gemini Live TTS» як голосовий двигун під час генерації синхронізованого аудіоопису (MP3) для відео. Ця функція використовує API Gemini Live для озвучення високоякісних аудіоописів без будь-яких обмежень щодо кількості символів або довжини.
- Модуляризація кодової бази: Структуру додатка перероблено з одного файлу на багатофайлову модульну архітектуру для покращення зручності обслуговування.
- Переробка інтерфейсу налаштувань: діалог «Налаштування» повністю перероблено: замість групового макету тепер використовується сучасний інтерфейс на основі вкладок, що забезпечує кращу організацію та простішу навігацію, зберігаючи при цьому всі існуючі параметри.
- Глобальне та спеціалізоване ведення журналу: Додано опціональну систему глобального ведення журналу у новій вкладці налаштувань «Додатково». Автоматично фіксує операційні події, трафік API та помилки у всіх модулях додатка у спеціалізованому файлі (
vision_assistant.log). Підтримує настроювані рівні деталізації журналу (Налагодження, Інформація, Попередження, Помилка), автоматичні періоди зберігання (від 1 години до 90 днів), а також можливість безпосереднього відкриття або очищення журналу з налаштувань без жодного впливу на продуктивність або втручання в журнал NVDA.
- Відстеження перебігу завантаження в Gemini: Додано повідомлення про відсоток виконання в режимі реального часу під час завантаження великих файлів (відео, аудіо, документи) до API Google Gemini.
Зміни від 15.07.2026
- Інтелектуальна фільтрація моделей API: Повна переробка системи фільтрації моделей з переходом на використання виключно чорного списку замість білих списків. Додано більш потужні ключові слова для фільтрування (
embedding, bison, gecko, audio, realtime, babbage, moderation, deep, antigravity, computer), щоб забезпечити ідеальну чистоту та перспективність основного випадаючого меню моделей чату, зберігаючи при цьому доступ до всіх спеціалізованих моделей у розділі «Розширена маршрутизація».
- Пошук у розділі «Розширена маршрутизація»: Усі випадаючі меню «Розширена маршрутизація моделей» (OCR, STT, TTS, Operator, Video, Live) та селектор варіантів eSpeak тепер повністю підтримують пошук. Ви можете швидко ввести текст, щоб відфільтрувати та знайти потрібну модель або варіант.
- Нові комбінації клавіш командного шару:
- Налаштування (
Alt + S): Миттєво відкриває діалог налаштувань Vision Assistant Pro.
- Звіт про вичерпані квоти ключів (
Alt + Q): Повідомляє точну кількість ключів API Gemini, що перевищили свою добову квоту, вказує, для яких саме моделей квота вичерпана, та повідомляє точний час їхнього скидання.
- Аудит маршрутизації (
Alt + M): Проводить аудит та повідомляє про вашу поточну конфігурацію розширеної маршрутизації, зачитуючи, які моделі активно обрано для спеціалізованих завдань (пропускаючи початкові налаштування).
- Повна модернізація аналізатора відео: Аналізатор відео було повністю оновлено! Раніше він надавав лише базовий опис онлайн-відео. Тепер це комплексний пакет для обробки відео, спеціально розроблений для незрячих користувачів:
- Запис локального екрану (
Control+V): Тепер ви можете записувати відео без звуку безпосередньо з екрана. ШІ проаналізує записаний фрагмент і надасть надзвичайно детальний опис сцени, компонування та дій.
- Генерація аудіоопису (SRT): Тепер додаток може генерувати надзвичайно детальні сценарії аудіоопису (у стандартному форматі SRT) для відео, з розумною синхронізацією пауз, що інтелектуально прив’язує описи до природних пауз у звуковій доріжці, та дослівним розпізнаванням тексту (OCR) для будь-якого тексту на екрані.
- Синхронізований аудіоопис (експорт у MP3): Окрім текстових субтитрів, додаток може синтезувати аудіоопис у мовлення, автоматично змішувати його з оригінальною звуковою доріжкою відео, застосовувати аудіо-дакінг (зниження гучності фону під час описів) та експортувати кінцевий синхронізований результат у вигляді MP3-файлу!
- Розумна дія з відеофайлом: Якщо ви виберите локальний відеофайл і натиснете клавішу швидкого доступу для відео, додаток автоматично його виявить і обробить безпосередньо.
- Розширене відстеження символів: ШІ тепер виконує попередній етап видобування символів. Він створює глобальний словник символів і точно відстежує символи сегмент за сегментом, не плутаючи їх.
- Налаштування аналізу відео: Додано нові параметри для керування розмірами блоків SRT, субтитруванням за символами та застереженнями.
- Розширена маршрутизація моделей: Тепер ви можете явно вибирати спеціалізовані відеомоделі (
gemini_video_model, custom_video_model) у налаштуваннях «Розширена маршрутизація моделей».
- Інтелектуальне управління квотами API: Покращено обробку помилок 429 (добовий ліміт) завдяки відстеженню квот для кожної моделі. Якщо ключ досягає добового ліміту для однієї моделі, його інтелектуально ізолюють лише для цієї конкретної моделі, залишаючи ключ доступним для використання з іншими моделями.
Зміни у версії 7.0.0
- Відновлення незавершених сканувань: Додано функцію відновлення як для «Читача документів», так і для «Розумних дій з файлами». Якщо сканування перервалося, тепер ви можете продовжити з того місця, де воно зупинилося, замість того, щоб починати все спочатку.
- Нова змінна
[screen_fg_obj]: Додано спеціальну змінну для створення знімка екрана лише активного вікна на передньому плані, а не всього екрана.
- Розумні повторні спроби та зміна ключів: Тепер додаток автоматично повторює спробу до 5 разів для одного й того ж ключа у разі тимчасового перевантаження сервера (наприклад, через «високий попит» або некоректні відповіді). Якщо повторні спроби не дають результату, він автоматично переходить до наступного API-ключа у вашому списку.
- Виявлення Екранної завіси: Додано перевірку, що запобігає створенню знімків екрана, коли активна Екранна завіса (незалежно від того, чи вона увімкнена постійно, чи тимчасово активована за допомогою гарячої клавіші). Додаток попередить вас і зупиниться, запобігаючи надсиланню чорних зображень та марнуванню токенів API.
- Удосконалення Читача документів: Діалог вибору діапазону PDF-файлу тепер автоматично попередньо вибирає початкову мову із налаштувань вашого додатка. Також покращено обробку потоків, щоб забезпечити коректне завершення фонових завдань при закритті читача документів.
- Вбудована інтеграція OCR від Mistral: Інтегровано вбудований API OCR для документів від Mistral. Багатосторінкові документи автоматично об’єднуються, завантажуються та обробляються партіями за допомогою спеціалізованої точки кінцевого виклику Mistral
/v1/ocr, тоді як односторінкові зображення обробляються безпосередньо без зайвого перетворення у PDF [1].
- Динамічні обробники користувацьких URL: Зміна URL користувацького API тепер миттєво очищає кешований список моделей і відновлює текстове поле для ручного введення моделі. Це забезпечує повну сумісність із користувацькими кінцевими точками (такими як Cloudflare AI Gateway), які не підтримують стандартну кінцеву точку переліку
/v1/models.
- Повністю оновлений механізм введення даних в Операторі ШІ: Повністю переписано базову систему імітації миші та клавіатури для Оператора ШІ. Застарілий API
mouse_event замінено на сучасний API Windows SendInput, що забезпечує значно вищу сумісність із сучасними програмами, вікнами, захищеними UAC, та дисплеями з високою роздільною здатністю (DPI).
- Виправлені операції перетягування: Операції перетягування в Операторі ШІ тепер повністю стабільні та надійні. Новий механізм використовує природні криві «згладжування», точне позиціонування курсора, оптимізовану синхронізацію та інтелектуальну техніку «поштовху», щоб гарантувати, що Windows та програми правильно розпізнають і виконують жести перетягування без збоїв у процесі.
- Підтримка декількох моніторів: Оператор ШІ тепер повністю підтримує конфігурації з декількома моніторами. Рухи миші та клацання працюють коректно на всіх моніторах завдяки використанню прапорця
MOUSEEVENTF_VIRTUALDESK, що забезпечує точне позиціонування незалежно від того, на якому моніторі знаходиться цільова програма.
- Покращена імітація клавіатури: Покращено введення натискань клавіш для повної підтримки «розширених клавіш» (таких як клавіші зі стрілками, Home, End, Page Up/Down, Insert, Delete та F1–F12). Це гарантує, що команди навігації та комбінації клавіш, надіслані Оператору ШІ, працюють бездоганно у всіх програмах.
- Підтримка зображень у форматах HEIC/HEIF: Додано вбудовану підтримку форматів фотографій iPhone. Тепер ви можете безпосередньо вибирати файли
.heic та .heif для опису ШІ, OCR або читання документів без попереднього перетворення.
Зміни у версії 6.5.0
- Live помічник: Додано функцію голосового та екранного асистента в режимі реального часу, доступну виключно для провайдера Google Gemini (або сумісних із Gemini користувацьких провайдерів). Функція передбачає інтерактивне налаштування голосу та глибини міркування безпосередньо в діалозі, а також автоматичне поновлення з’єднання після зміни налаштувань.
- Провайдер MiniMax AI: Інтегровано MiniMax як рівноправного постачальника з повною мультимодальною підтримкою (чат, бачення, OCR), користувацьким TTS із використанням понад 300 динамічних голосів та автоматичним видаленням блоків міркувань (наприклад,
<think>...</think>) з вихідних даних.
- Переклад у читачі документів: Виправлено прихований збій перекладу для користувачів NVDA, які не використовують англійську мову, шляхом забезпечення надсилання до Google Translate стандартного дволітерного коду мови замість локалізованої назви мови.
- Повторна спроба пакетного сканування PDF: Впроваджено високооптимізовану, окрему та приховану логіку повторної спроби для пакетного сканування PDF-документів, щоб запобігти зайвим завантаженням та уникнути з’явлення спливаючих діалогів з помилками під час повторних спроб.
- Статус читача документів: Виправлено помилку, через яку загальний статус додатка (перевірявся за допомогою
I) залишався застряглим на «Початку пакетного оброблення» під час тривалого сканування документів.
- Вирішено збій потоків: Виправлено серйозний збій перевірки потоку
IsMain() failed in wxTimerImpl під час відкриття документів із фонового потоку шляхом переведення черги зворотних викликів графічного інтерфейсу на wx.CallAfter.
Зміни у версії 6.1.0
- Універсальна локальна інтеграція ШІ («Налаштувати локальний ШІ»): Додано нову кнопку «Налаштувати локальний ШІ» у налаштуваннях користувацьких провайдерів. Тепер користувачі можуть автоматично налаштовувати локальні двигуни штучного інтелекту, включаючи Ollama, LM Studio, Jan.ai та KoboldCPP миттєво.
- Інтелектуальний обхід локального проксі: Логіку підключення повністю перебудовано з використанням удосконаленого механізму обходу проксі. Додаток тепер достатньо «розумний», щоб повністю обходити системні проксі Windows для локальних підключень по loopback, що забезпечує стабільну роботу локального ШІ навіть при активному VPN або режимі TUN.
- Надстабільне підписування ШІ (v2): Замість абсолютних екранних координат використовується удосконалена гібридна система Object Signature. Тепер підписи спираються на програмні ідентифікатори (AutomationId для UIA або ControlID для Win32) та координати відносно вікна, що робить ваші власні підписи повністю стійкими до зміни розміру, переміщення вікна, перемикання моніторів чи масштабування.
- Автоматичне перенесення підписів без перерви в роботі: Оновлення відбувається повністю прозоро. Додаток автоматично перенесе ваші старі підписи, які базувалися на координатах, у новий формат стійких відбитків у фоновому режимі при першому фокусуванні — без жодної втрати даних.
Зміни у версії 6.0
- Введення семантичних підписів ШІ: Тепер користувачі можуть назавжди підписувати кнопки та іконки без назв за допомогою ШІ. Натисніть L, щоб підписати поточний об’єкт навігатора (підтримується навігація за допомогою клавіші ТАБ, і об’єктна навігація), або Shift+L, щоб просканувати та підписати всю програму одразу.
- Інтелектуальне керування підписами: Додано новий, повністю доступний діалог «Керування підписами» (відкривається за Shift+L, якщо підписи вже існують) для перегляду, перейменування чи масового видалення власних підписів.
- Прямий аналіз файлів (Обхід діалогу файлів): Додаток тепер самостійно визначає, чи ви наразі сфокусовані на PDF або графічному файлі у Провіднику Windows. Натискаючи F (Розумна дія над файлом) або D (Читач документів) на вибраному файлі, його буде миттєво оброблено, минаючи стандартний діалог «Відкрити».
Зміни у версії 5.6
- Додано модуль OCR «Немає (Видобути текстовий шар)»: тепер користувачі можуть витягувати текст безпосередньо з PDF-файлів, що підтримують пошук, без використання кредитів ШІ, що значно підвищує швидкість обробки та рівень конфіденційності для текстових документів.
- Удосконалена точність UI Провідника: Покращено підказки UI Провідника для кращої ідентифікації типів елементів (наприклад, елементів списку) та точного відображення станів, таких як «(Позначено)», «(Вибрано)» або «(Розгорнуто)», ігноруючи при цьому системні компоненти Windows, такі як панель завдань та годинник.
- Нагадування про налаштування після встановлення: Додано повідомлення після встановлення, яке направляє користувачів до меню налаштувань для конфігурації API-ключів та параметрів.
Зміни у версії 5.5 (Оновлення автоматизації)
- Оператор ШІ (Автономне керування — Shift+A): Це головна родзинка версії 5.5. Vision Assistant Pro перетворився з пасивного помічника на вашого особистого Оператора ШІ. Він не просто описує екран — він бере керування на себе.
- Як це працює: Тепер ви можете давати усні вказівки для керування вашим ПК. Наприклад, у повністю недоступній програмі, де ваш екранний зчитувач мовчить, ви можете натиснути Shift+A і ввести: «Натисни на кнопку Налаштування» або «Знайди поле пошуку, введи «Останні новини» та натисни Enter». Штучний інтелект візуально ідентифікує елементи, рухає мишкою та виконує завдання за вас.
- Примітка щодо продуктивності: Ця функція оптимізована для Gemini 3.0 Flash (Preview), забезпечуючи неймовірно швидкі та інтелектуальні відповіді, здатні впоратися навіть із найскладнішими макетами інтерфейсу.
- ⚠️ Попередження щодо використання API: Оскільки Оператор ШІ повинен «бачити» саме те, що відбувається, щоб бути точним, він надсилає знімок екрана з високою роздільною здатністю на кожному кроці. Зверніть увагу, що часте використання вичерпає ваш ліміт API набагато швидше, ніж стандартні текстові завдання.
- Візуальний UI Провідник (E): Втомилися навігації серед «непозначених кнопок»? Натисніть E, щоб активувати UI Провідник. Штучний інтелект просканує все вікно та згенерує список усіх елементів, на які можна натиснути, — включаючи іконки, графіку та меню. Просто виберіть елемент зі списку, і Оператор ШІ натисне на нього за вас. Це ніби «доступний шар» поверх будь-якої програми.
- Контекстно-залежна розумна дія з файлом (F): Клавіша «F» була повністю перероблена. Вона більше не припускає, що вам потрібне лише OCR. Коли ви вибираєте одне зображення, вона тепер розумно запитує про ваші наміри: ви можете вибрати Детальний візуальний опис, щоб зрозуміти сцену, або Витяг структурованого тексту (OCR) для читання. Меню динамічно адаптується залежно від типу файлу та активного двигуна штучного інтелекту.
- Оптимізація ядра: Ми провели глибоке очищення внутрішньої логіки додатка, видаливши невикористовувані застарілі функції та зайвий код. Це забезпечує більш компактний, швидкий та надійний досвід для всіх користувачів.