Pomoc Vision Assistant Pro

Pobrań łącznie: 61 000+

Vision Assistant Pro to wielomodalny asystent AI dla NVDA. Korzysta z czołowych silników AI, żeby odczytywać ekran, tłumaczyć, zapisywać mowę i analizować dokumenty.

Dodatek trafił do społeczności z okazji Międzynarodowego Dnia Osób z Niepełnosprawnościami.

1. Konfiguracja

Przejdź do menu NVDA > Preferencje > Ustawienia > Vision Assistant Pro. Okno ustawień jest podzielone na 8 zakładek: Połączenie, Zachowanie AI, Języki tłumaczenia, Czytnik dokumentów, Wideo, CAPTCHA, Polecenia i Zaawansowane.

1.1 Zakładka Połączenie

1.2 Zakładka Zachowanie AI

1.3 Zakładka Języki tłumaczenia

1.4 Zakładka Czytnik dokumentów

1.5 Zakładka Wideo

1.6 Zakładka CAPTCHA

Dodatek radzi sobie z dwoma rodzajami CAPTCHA, a wybiera między nimi sam. Obsługuje je jeden skrót — C w warstwie poleceń — i nie trzeba z góry wiedzieć, na którą się trafiło.

Po naciśnięciu C dodatek sprawdza, z czym ma do czynienia. Jeśli wykryje zagadkę obrazkową, mówi o tym i przechodzi w tryb rozwiązywania — to trwa dłużej niż odczytanie kodu. Jeśli obrazkowa jest wyłączona w ustawieniach, usłyszysz o tym.

Ustawienia:
- Włącz rozwiązywanie CAPTCHA obrazkowej: włącza i wyłącza obsługę zagadek obrazkowych (hCaptcha, reCAPTCHA). Wyłączenie nie rusza CAPTCHA tekstowej — ta działa dalej.
- Metoda dla CAPTCHA tekstowej: przechwytywanie obiektu nawigatora albo całego ekranu. Dotyczy wyłącznie kodów do przepisania.

1.7 Zakładka Polecenia

1.8 Zakładka Zaawansowane i globalny dziennik

W zakładce Zaawansowane konfiguruje się globalny dziennik dodatku:
- Włącz osobny plik dziennika: zapisuje zdarzenia, ruch do API i błędy ze wszystkich modułów dodatku do osobnego pliku (vision_assistant.log).
- Poziom szczegółowości dziennika: Diagnostyka (wszystkie szczegóły), Informacje (ogólne), Ostrzeżenia (tylko ostrzeżenia) albo Błędy (tylko błędy).
- Przechowuj dziennik przez: automatyczne czyszczenie starszych wpisów, od godziny do 90 dni.
- Zarządzanie dziennikiem: Otwórz plik dziennika, Otwórz folder dziennika i Wyczyść plik dziennika pozwalają zajrzeć do danych albo je usunąć bez restartu NVDA i bez mieszania się do standardowego dziennika NVDA.

2. Warstwa poleceń i skróty

Aby uniknąć konfliktów skrótów klawiszowych, dodatek używa warstwy poleceń.
1. Naciśnij NVDA + Shift + V (klawisz główny), żeby włączyć warstwę (usłyszysz sygnał).
2. Puść klawisze, a potem naciśnij jeden z poniższych:

Klawisz Funkcja Opis
Shift + A Operator AI Działanie autonomiczne: zlecasz AI wykonanie zadania na ekranie. Ponowne naciśnięcie natychmiast przerywa trwającą operację.
E Eksplorator interfejsu Kliknięcie interaktywne: rozpoznaje i klika elementy interfejsu w dowolnej aplikacji.
T Tłumacz Tłumaczy tekst z obiektu nawigatora albo zaznaczenie.
Shift + T Tłumacz schowka Tłumaczy zawartość schowka.
R Poprawianie tekstu Streszcza, poprawia gramatykę, wyjaśnia albo uruchamia polecenia niestandardowe.
V Opis obiektu Opisuje bieżący obiekt nawigatora.
O Opis całego ekranu Analizuje układ i zawartość całego ekranu.
Shift + V Analiza wideo Analizuje lokalne pliki wideo oraz filmy z YouTube, Instagrama, TikToka i Twittera (X).
Control + V Nagrywanie ekranu Nagrywa bezgłośne wideo z ekranu i analizuje przebieg oraz układ.
D Czytnik dokumentów Zaawansowany czytnik PDF i obrazów z wyborem zakresu stron.
F Akcja na pliku Rozpoznawanie zależne od kontekstu dla zaznaczonego obrazu, pliku PDF albo TIFF.
M Transkrypcja i dubbing mediów Transkrybuje albo dubbinguje pliki dźwiękowe i wideo (MP3, WAV, MP4 i inne) na język docelowy.
C Rozwiązywanie CAPTCHA Przechwytuje i rozwiązuje CAPTCHA — tekstową i obrazkową, jednym skrótem; rodzaj rozpoznaje sam.
Shift + C Czat Otwiera okno rozmowy tekstowej z AI.
S Dyktowanie Zamienia mowę na tekst. Naciśnij, żeby zacząć nagrywanie, i ponownie, żeby zakończyć i wpisać.
Control + T Tłumaczenie mowy transkrybuje wypowiedź, tłumaczy ją i wpisuje wynik zgodnie z ustawieniami języków.
Control + L Asystent głosowy Rozmowa w czasie rzeczywistym (tylko Gemini): rozpoczyna albo kończy rozmowę głosową i ekranową z asystentem.
I Ogłoś stan Ogłasza bieżący postęp (na przykład „Skanowanie...”, „Bezczynny”).
L Etykietuj obiekt Etykietowanie semantyczne: trwale nazywa bieżący element albo ikonę.
Shift + L Zarządzaj/skanuj etykiety Otwiera menedżera etykiet (jeśli etykiety istnieją) albo skanuje aplikację w poszukiwaniu nienazwanych elementów.
U Sprawdź aktualizację Ręcznie sprawdza na GitHubie najnowszą wersję dodatku.
Spacja Przywołaj ostatni wynik Pokazuje ostatnią odpowiedź AI w oknie rozmowy do przejrzenia albo dopytania.
H Pomoc poleceń Wyświetla listę wszystkich dostępnych skrótów.
Alt + S Ustawienia Otwiera okno ustawień Vision Assistant Pro.
Alt + Q Raport kluczy z wyczerpanym limitem Podaje liczbę kluczy Gemini, które przekroczyły dzienny limit, wraz z czasem odnowienia.
Alt + M Audyt przydziału modeli Podaje modele AI wybrane obecnie w osobnym przydziale dla zadań.
Góra / Dół Nawigacja po szybkich ustawieniach Przechodzi między kategoriami szybkich ustawień (dostawca, model i inne) w warstwie.
Lewo / Prawo Zmiana szybkiego ustawienia Zmienia wartość wybranego szybkiego ustawienia.

3. Operator AI — autonomiczne sterowanie komputerem

Operator AI zamienia Vision Assistant Pro z czytnika w asystenta, który działa na komputerze w Twoim imieniu. Można poprosić go o opis ekranu, o odpowiedź na pytanie o to, co widzi, albo oddać mu sterowanie: klikanie przycisków, przeciąganie elementów, wpisywanie tekstu i poruszanie się po aplikacjach zwykłym językiem.

Największa zaleta? Działa w oprogramowaniu całkowicie niedostępnym. Jeśli firmowa aplikacja, pulpit zdalny albo strona nie dają się obsłużyć, bo czytnik ekranu przy nich milczy, operatorowi to nie przeszkadza. Ponieważ „widzi” ekran wizualnie, potrafi znaleźć, odczytać i obsłużyć elementy pozbawione jakichkolwiek etykiet dostępności.

Jak to działa

  1. Naciśnij NVDA + Shift + V, potem Shift + A (albo użyj skrótu bezpośredniego), żeby otworzyć okno Operatora AI.
  2. Napisz zwykłym językiem, co ma zrobić (na przykład „Kliknij przycisk Zapisz”, „Co mówi komunikat błędu?”, „Zmień nazwę pliku na final.pdf”).
  3. AI przeanalizuje ekran, rozpozna właściwe elementy i wykona zadanie albo poda odpowiedź. Jeśli zadanie wymaga kilku kroków, operator pracuje aż do końca.
  4. Ponowne Shift + A w dowolnym momencie natychmiast przerywa trwającą operację.

Obsługiwane działania

Operator rozumie szeroki zakres poleceń:
- Opis i odpowiedź: „Opisz układ ekranu” albo „Co mówi komunikat błędu?”
- Kliknięcie: „Kliknij przycisk Zapisz”
- Kliknięcie prawym przyciskiem: „Kliknij plik prawym przyciskiem”
- Dwukrotne kliknięcie: „Kliknij dwukrotnie dokument”
- Przeciągnij i upuść: „Przeciągnij dokument do folderu Archiwum”
- Wpisywanie: „Wpisz »Witaj świecie« w polu wyszukiwania”
- Przewijanie: „Przewiń trzy razy w dół”
- Naciśnięcie klawisza: „Naciśnij Enter”, „Naciśnij Tab”, „Naciśnij Escape”
- Zadania wieloetapowe: „Otwórz Eksplorator plików, znajdź raport i zmień jego nazwę na final.pdf”

Ważne uwagi

4. Analiza wideo i audiodeskrypcja

Uwaga: analiza wideo i audiodeskrypcja działają wyłącznie na dostawcy Google Gemini. Upewnij się, że w ustawieniach dodatku aktywnym dostawcą jest Google Gemini.

Vision Assistant Pro przetwarza wideo z myślą o osobach niewidomych. Analizuje zarówno filmy online, jak i lokalne nagrania ekranu, dając szczegółowe opisy wizualne oraz gotowe skrypty audiodeskrypcji w formacie SRT.

4.1 Nagrywanie ekranu (Control + V)

Jeśli trafisz na bezgłośne wideo, animację albo poradnik na ekranie, możesz nagrać go bezpośrednio:
1. Naciśnij NVDA + Shift + V, żeby wejść w warstwę poleceń, potem Control + V.
2. Dodatek zacznie po cichu nagrywać ekran w tle.
3. Ponowne Control + V kończy nagrywanie.
4. AI przeanalizuje nagrany fragment i szczegółowo opisze scenę, postacie i przebieg zdarzeń.

4.2 Analiza wideo (Shift + V)

Analizować można zarówno lokalne pliki, jak i filmy online. Wystarczy zaznaczyć plik wideo w Eksploratorze Windows albo skopiować link do schowka. Można też nacisnąć Shift + V w dowolnym miejscu (na przykład w odtwarzaczu), żeby otworzyć okno, w którym wskazuje się plik albo wkleja adres ręcznie.
- Obsługiwane serwisy: YouTube, Instagram, TikTok i Twitter (X).
- Dodatek sam rozpozna plik lokalny albo adres, przetworzy wideo i poda pełny opis wizualny oraz podsumowanie dźwięku.

4.3 Generowanie audiodeskrypcji (SRT)

Dodatek tworzy skrypty audiodeskrypcji w standardowym formacie SubRip (SRT).
- Dopasowanie do pauz: AI słucha ścieżki dźwiękowej i zaczepia opisy o naturalne pauzy i ciszę, żeby jak najmniej nachodziły na dialog.
- Śledzenie postaci: silnik najpierw wyodrębnia poszczególne postacie po niezmiennych cechach twarzy. Buduje globalny słownik, dzięki czemu rozpoznaje i nazywa te same osoby w różnych scenach bez pomyłek.
- Dosłowny OCR tekstu: każdy tekst pojawiający się na ekranie, taki jak np. napisy końcowe jest cytowany dosłownie.
- Jak z tego skorzystać: żeby odsłuchać wygenerowane napisy, umieść plik .srt w tym samym folderze co wideo i nadaj mu dokładnie tę samą nazwę. Potem ustaw w odtwarzaczu (na przykład VLC albo PotPlayer) przekazywanie tekstu napisów wprost do czytnika ekranu albo silnika TTS podczas odtwarzania.

4.4 Zsynchronizowana narracja dźwiękowa (eksport MP3)

Dodatek nie kończy na plikach SRT — jest pełnym narzędziem produkcyjnym audiodeskrypcji: syntezuje opisy na mowę i miksuje je z wideo. Jako silnik głosu można teraz wybrać Gemini Live TTS, który przez Gemini Live API tworzy bardzo naturalną narrację bez ograniczeń długości. Przy generowaniu MP3 dla plików lokalnych dostępnych jest kilka trybów miksowania:
- Standardowa audiodeskrypcja (miks głosu): narracja nakłada się bezpośrednio na dźwięk wideo. Pojawi się pytanie, czy zastosować przyciszanie tła podczas opisów, żeby narracja była wyraźna.
- Rozszerzona audiodeskrypcja (pauza dźwięku): silnik zatrzymuje oryginalny dźwięk na czas opisu, dzięki czemu nie umknie ani słowo dialogu, ani narracji.
- Filmy z YouTube: dla źródeł z YouTube (które nie są pobierane lokalnie) eksport MP3 zawiera wyłącznie zsynchronizowaną ścieżkę głosu AI, bez dźwięku tła.

5. Transkrypcja i dubbing mediów (M)

Moduł transkrypcji został napisany od nowa i obsługuje zarówno pliki dźwiękowe, jak i wideo (MP3, WAV, MP4, MKV i inne). Naciśnij M w warstwie poleceń, żeby wybrać plik i jeden z trzech trybów pracy:
1. Transkrybuj (język oryginału): dokładnie transkrybuje wypowiedź w języku oryginału.
2. Transkrybuj i przetłumacz (język docelowy): transkrybuje wypowiedź i tłumaczy ją na ustawiony język docelowy.
3. Zdubbinguj i przetłumacz (język docelowy) (tylko Gemini): transkrybuje wypowiedź, tłumaczy ją na język docelowy i tworzy mówioną ścieżkę dźwiękową silnikiem TTS dodatku.

6. Zaawansowany czytnik dokumentów i obrazów

Vision Assistant Pro ma zoptymalizowany czytnik dokumentów przygotowany pod wielostronicowe pliki PDF, złożone obrazy, a nawet format HEIC z iPhone'a.

6.1 Przetwarzanie wsadowe i wznawianie

Nie trzeba czytać wielkiego dokumentu za jednym razem. Podaj zakres stron (na przykład 1-20), a AI przetworzy je w tle. Jeśli NVDA ulegnie awarii albo przerwiesz skanowanie, dodatek zapamięta postęp i zaproponuje wznowienie dokładnie w miejscu przerwania.

6.2 Akcja na pliku

Nie zawsze trzeba najpierw otwierać dokument. W Eksploratorze plików Windows wystarczy zaznaczyć plik PDF albo obraz i w warstwie poleceń nacisnąć D (czytnik dokumentów) albo F (akcja na pliku). Dodatek pominie okno wyboru pliku i od razu zacznie przetwarzanie zaznaczonego dokumentu.

6.3 Skróty czytnika dokumentów

Gdy okno czytnika jest otwarte, działają następujące skróty:
- Ctrl + PageDown: następna strona.
- Ctrl + PageUp: poprzednia strona.
- Alt + A: okno rozmowy z pytaniami o dokument.
- Alt + R: wymuszenie ponownego skanowania przez AI aktywnym dostawcą.
- Alt + G: wygenerowanie i zapisanie pliku dźwiękowego wysokiej jakości (WAV/MP3). (Ukryte, jeśli dostawca nie obsługuje TTS).
- Alt + S / Ctrl + S: zapis wyodrębnionego tekstu jako plik TXT albo HTML.

7. Etykietowanie semantyczne i Eksplorator interfejsu

Aplikacja, w której wszędzie słychać „nieoznaczony przycisk”? Silnik etykietowania semantycznego rozwiązuje to na stałe.

7.1 Trwałe etykietowanie obiektu (L)

Ustaw czytnik na nieoznaczonej grafice albo przycisku i naciśnij L w warstwie poleceń. AI obejrzy przycisk, rozpozna jego funkcję i nada mu trwałą etykietę.
W odróżnieniu od starszych narzędzi do etykietowania, ten dodatek korzysta z hybrydowego systemu „sygnatury obiektu” (AutomationId/ControlID). Własne etykiety przetrwają zmianę rozmiaru okna, przełączenie monitora i aktualizację aplikacji.

7.2 Skanowanie całej aplikacji (Shift + L)

Naciśnij Shift + L, żeby przeskanować całe aktywne okno naraz. AI znajdzie wszystkie nieoznaczone elementy i nazwie je za jednym razem. Etykiety można potem przeglądać, zmieniać i usuwać zbiorczo we wbudowanym menedżerze etykiet.

7.3 Eksplorator interfejsu (E)

Chcesz obsłużyć element bez ręcznego docierania do niego? Naciśnij E, żeby uruchomić Eksplorator interfejsu. AI przeskanuje ekran i utworzy dostępną listę wszystkich klikalnych elementów (pomijając szum systemowy w rodzaju paska zadań). Wybierz pozycję z listy, a dodatek od razu ją kliknie.

8. Asystent głosowy

Asystent głosowy zamienia Vision Assistant Pro w interaktywnego pomocnika działającego w czasie rzeczywistym.
(Uwaga: funkcja dostępna wyłącznie w Google Gemini i w niestandardowych dostawcach zgodnych z Gemini).

9. Polecenia niestandardowe i zmienne

Poleceniami zarządza się w Ustawienia > Polecenia > Zarządzaj poleceniami....

Obsługiwane zmienne

10. Zastosowania w praktyce (której funkcji użyć?)

Vision Assistant Pro ma dużo narzędzi. Poniżej typowe sytuacje, które pomogą wybrać właściwe:


Uwaga: wszystkie funkcje AI wymagają aktywnego połączenia z internetem. Dokumenty wielostronicowe są przetwarzane automatycznie.

11. Wsparcie i społeczność

Bądź na bieżąco z nowościami, funkcjami i wydaniami:
- Kanał na Telegramie: t.me/VisionAssistantPro
- GitHub Issues: zgłoszenia błędów i propozycje funkcji.

Zgłaszanie błędów i dzienniki

Otwierając zgłoszenie na GitHubie albo prosząc o pomoc, podaj aktywnego dostawcę AI, model i wersję NVDA. Jeśli masz problemy z połączeniem albo nieoczekiwane awarie, włącz osobny plik dziennika w Ustawienia > Zaawansowane, powtórz sytuację i dołącz plik vision_assistant.log — to znacznie przyspieszy rozwiązanie problemu.

12. Patroni projektu

Serdecznie dziękujemy osobom ze społeczności, które wspierają rozwój i utrzymanie tego projektu swoim wkładem finansowym:

Jeśli chcesz wesprzeć projekt finansowo i zobaczyć tutaj swoje imię, opcję Wsparcie znajdziesz w menu Narzędzia NVDA (podmenu Vision Assistant) albo podczas konfiguracji po instalacji.


Zmiany w wersji 2026.08.06


Zmiany w wersji 2026.07.15


Zmiany w wersji 7.0.0

Zmiany w wersji 6.5.0


Zmiany w wersji 6.1.2


Zmiany w wersji 6.1.1


Zmiany w wersji 6.1.0


Zmiany w wersji 6.0

Zmiany w wersji 5.6

Zmiany w wersji 5.5.2

Zmiany w wersji 5.5 (Aktualizacja automatyzacji)

Zmiany w wersji 5.0

Zmiany w wersji 4.6

Zmiany w wersji 4.5

Zmiany w wersji 4.0.3

Zmiany w wersji 4.0.1

Zmiany w wersji 3.6.0

Zmiany w wersji 3.5.0

Zmiany w wersji 3.1.0

Zmiany w wersji 3.0

Zmiany w wersji 2.9

Zmiany w wersji 2.8

Zmiany w wersji 2.7

Zmiany w wersji 2.6

Zmiany w wersji 2.5

Zmiany w wersji 2.1.1

Zmiany w wersji 2.1

Zmiany w wersji 2.0

Zmiany w wersji 1.5

Zmiany w wersji 1.0