Documentația Vision Assistant Pro

Total descărcări: 61.000+

Vision Assistant Pro este un asistent AI avansat, multimodal, pentru NVDA. Folosește motoare AI de clasă mondială pentru a oferi citire inteligentă a ecranului, traducere, dictare vocală și analiză de documente.

Acest add-on a fost lansat comunității în onoarea Zilei Internaționale a Persoanelor cu Dizabilități.

1. Instalare și configurare

Mergi la Meniul NVDA > Preferințe > Setări > Vision Assistant Pro. Dialogul de setări este organizat în 8 file accesibile: Conexiune, Comportament AI, Limbi de traducere, Cititor de documente, Video, CAPTCHA, Prompturi și Avansat.

1.1 Fila Conexiune

1.2 Fila Comportament AI

1.3 Fila Limbi de traducere

1.4 Fila Cititor de documente

1.5 Fila Video

1.6 Fila CAPTCHA

1.7 Fila Prompturi

1.8 Fila Avansat și jurnalizarea globală

Navighează la fila Avansat pentru a configura jurnalizarea globală a add-on-ului:
- Activează fișierul jurnal dedicat: Activează jurnalizarea tuturor evenimentelor operaționale, traficului API și erorilor din toate modulele add-on-ului într-un fișier separat (vision_assistant.log).
- Nivel jurnal: Selectează nivelul de detaliu între Debug (toate detaliile), Info (informații generale), Avertisment (doar avertismente) și Eroare (doar erori).
- Păstrează jurnalele timp de: Setează perioade automate de păstrare pentru curățarea intrărilor vechi din jurnal (de la 1 oră până la 90 de zile).
- Controale pentru gestionarea jurnalelor: Folosește Deschide fișierul jurnal, Deschide folderul jurnalelor sau Golește fișierul jurnal pentru a inspecta sau șterge datele jurnalului direct, fără repornirea NVDA și fără interferențe cu jurnalele standard NVDA.

2. Strat de comenzi și scurtături

Pentru a preveni conflictele de taste, acest add-on folosește un strat de comenzi.
1. Apasă NVDA + Shift + V (tasta principală) pentru a activa stratul (vei auzi un bip).
2. Eliberează tastele, apoi apasă una dintre următoarele taste individuale:

Tastă Funcție Descriere
Shift + A AI Operator Operare autonomă: Spune-i AI-ului să efectueze o sarcină pe ecran. Apăsarea din nou oprește instant operațiile active.
E UI Explorer Clic interactiv: Identifică și apasă elemente UI în orice aplicație.
T Traducător inteligent Traduce textul de sub cursorul navigator sau selecția.
Shift + T Traducător clipboard Traduce conținutul aflat în prezent în clipboard.
R Rafinator de text Rezumă, corectează gramatica, explică sau rulează prompturi personalizate.
V Viziune obiect Descrie obiectul navigator curent.
O Viziune ecran complet Analizează întregul layout și conținut al ecranului.
Shift + V Analiză video Analizează fișiere video locale sau videoclipuri online de pe YouTube, Instagram, TikTok sau Twitter (X).
Control + V Înregistrare video locală Înregistrează un videoclip silențios al ecranului și analizează acțiunile și layoutul.
D Cititor de documente Cititor avansat pentru PDF și imagini, cu selecție interval de pagini.
F Acțiune inteligentă pentru fișiere Recunoaștere contextuală din fișiere imagine, PDF sau TIFF selectate.
M Transcriere și dublare media Transcrie sau dublează fișiere audio/video (MP3, WAV, MP4 etc.) în limba ta țintă.
C Rezolvitor CAPTCHA Capturează și rezolvă CAPTCHA-uri.
Shift + C Chat direct Deschide o interfață de chat direct, bazată pe text, cu AI-ul.
S Dictare inteligentă Convertește vorbirea în text. Apasă pentru a începe înregistrarea, apoi din nou pentru oprire/tastare.
Control+T Traducere vocală Transcrie, traduce și tastează rezultatul pe baza setărilor tale de limbă.
Control+L Live Assistant Copilot în timp real (doar Gemini): Pornește sau oprește o conversație vocală și de ecran în direct cu asistentul AI.
I Raportare stare Anunță progresul curent (de exemplu, „Se scanează...”, „Inactiv”).
L Etichetează obiectul Etichetare AI semantică: Etichetează permanent elementul/pictograma focalizată curentă.
Shift + L Gestionează/scanează etichete Deschide Managerul de etichete (dacă există etichete) sau scanează aplicația pentru elemente fără nume.
U Verificare actualizări Verifică manual pe GitHub cea mai recentă versiune a add-on-ului.
Space Reapelează ultimul rezultat Afișează ultimul răspuns AI într-un dialog de chat pentru revizuire sau întrebări suplimentare.
H Ajutor comenzi Afișează o listă cu toate scurtăturile disponibile.
Alt + S Setări Deschide dialogul de setări Vision Assistant Pro.
Alt + Q Raport chei cu cotă epuizată Raportează numărul de chei API Gemini care și-au depășit cota zilnică și ora lor de resetare.
Alt + M Audit rutare Raportează modelele AI selectate în prezent în rutarea avansată.
Up / Down Navigare setări rapide Navighează între categoriile de setări rapide (furnizor, model etc.) în strat.
Left / Right Schimbă setarea rapidă Schimbă valoarea setării rapide selectate curent.

3. AI Operator - Control autonom al computerului

AI Operator transformă Vision Assistant Pro dintr-un cititor pasiv într-un asistent activ care poate interacționa cu computerul în numele tău. Îi poți cere să descrie ecranul, să răspundă la întrebări despre ce vede sau chiar să preia controlul—apăsând butoane, trăgând elemente, tastând text și navigând prin aplicații folosind comenzi în limbaj natural.

Cel mai mare avantaj? Funcționează perfect în software complet inaccesibil. Dacă ești blocat într-o aplicație personalizată, un desktop remote sau un site web în care cititorul tău de ecran rămâne complet tăcut, operatorul nu este deranjat. Pentru că „vede” ecranul vizual, poate găsi, citi și interacționa cu elemente care nu au deloc etichete de accesibilitate.

Cum funcționează

  1. Apasă NVDA + Shift + V, apoi apasă Shift + A (sau folosește scurtătura directă) pentru a deschide dialogul AI Operator.
  2. Tastează ce vrei să faci în limbaj simplu (de exemplu, „Apasă butonul Salvează”, „Ce spune mesajul de eroare?” sau „Redenumește fișierul în final.pdf”).
  3. AI-ul va analiza ecranul, va identifica elementele relevante și va executa acțiunea sau va oferi răspunsul. Dacă o sarcină necesită mai mulți pași, operatorul va continua să lucreze până când este completă.
  4. Apasă din nou Shift + A oricând pentru a opri instant o operație în desfășurare.

Acțiuni acceptate

Operatorul înțelege o gamă largă de comenzi:
- Descriere și răspuns: „Descrie layoutul ecranului” sau „Ce spune mesajul de eroare?”
- Clic: „Apasă butonul Salvează”
- Clic dreapta: „Dă clic dreapta pe fișier”
- Dublu clic: „Dă dublu clic pe document”
- Tragere și plasare: „Trage documentul în folderul Arhivă”
- Tastare: „Tastează «Hello World» în caseta de căutare”
- Derulare: „Derulează în jos de trei ori”
- Apăsare de tastă: „Apasă Enter”, „Apasă Tab”, „Apasă Escape”
- Sarcini cu mai mulți pași: „Deschide File Explorer, găsește raportul și redenumește-l în final.pdf”

Note importante

4. Analiză video și descriere audio

Notă: Funcțiile Analiză video și Descriere audio sunt alimentate strict de furnizorul Google Gemini. Asigură-te că furnizorul activ din setările add-on-ului este setat la Google Gemini.

Vision Assistant Pro introduce capabilități puternice de procesare video, concepute special pentru utilizatorii nevăzători. Poate analiza atât videoclipuri online, cât și înregistrări locale ale ecranului, pentru a oferi descrieri vizuale foarte detaliate și pentru a genera scripturi profesionale de descriere audio (SRT).

4.1 Înregistrare locală a ecranului (Control + V)

Dacă întâlnești un videoclip tăcut, o animație sau un tutorial pe ecran, îl poți captura direct:
1. Apasă NVDA + Shift + V pentru a intra în stratul de comenzi, apoi apasă Control + V.
2. Add-on-ul va înregistra silențios ecranul în fundal.
3. Apasă din nou Control + V pentru a opri înregistrarea.
4. AI-ul va analiza apoi segmentul video înregistrat și va oferi o descriere foarte detaliată a scenei, personajelor și acțiunilor.

4.2 Analiză video (Shift + V)

Poți analiza atât fișiere video locale, cât și videoclipuri online. Selectează pur și simplu un fișier video local în Windows Explorer sau copiază un link video online în clipboard. Poți apăsa și Shift + V oriunde (de exemplu, într-un player media) pentru a deschide un dialog unde poți căuta un fișier video sau lipi manual un URL.
- Platforme online acceptate: YouTube, Instagram, TikTok și Twitter (X).
- AI-ul va detecta automat fișierul local sau URL-ul, va procesa videoclipul și va oferi o descriere vizuală cuprinzătoare și un rezumat audio.

4.3 Generare descriere audio (SRT)

Pentru o experiență mai structurată, add-on-ul poate genera scripturi profesionale de descriere audio în formatul standard SubRip (SRT).
- Sincronizare inteligentă pe pauze: AI-ul ascultă pista audio și ancorează descrierile vizuale în mod specific în pauzele naturale și golurile de liniște, pentru a minimiza inteligent suprapunerea peste dialog.
- Urmărirea personajelor: Motorul face o trecere preliminară pentru a extrage personaje distincte pe baza trăsăturilor faciale imuabile. Construiește un dicționar global pentru a urmări și eticheta cu precizie personajele în scene diferite, fără confuzie.
- OCR text mot-à-mot: Orice text care apare pe ecran (semne, telefoane, generice) este citat strict mot-à-mot.
- Cum se folosește: Pentru a asculta subtitrarea generată, plasează pur și simplu fișierul .srt în același folder cu fișierul video și dă-i exact același nume. Apoi configurează playerul media (de exemplu, VLC sau PotPlayer) să trimită textul subtitrării direct către cititorul tău de ecran sau motorul TTS în timpul redării.

4.4 Narațiune audio sincronizată (export MP3)

Dincolo de crearea fișierelor SRT bazate pe text, add-on-ul funcționează ca un instrument complet de producție pentru descriere audio, sintetizând descrierile în vorbire și mixându-le cu videoclipul. Acum poți alege Gemini Live TTS ca motor vocal, care folosește API-ul Gemini Live pentru a genera narațiune vocală foarte realistă și nelimitată. Când generezi un MP3 pentru fișiere video locale, ai mai multe moduri de mixare:
- AD standard (mixare voce): Narațiunea este suprapusă direct peste sunetul videoclipului. Vei fi întrebat dacă vrei să aplici Audio Ducking (reducerea volumului de fundal în timpul descrierilor) pentru a te asigura că narațiunea este clară.
- AD extins (pauză audio): Motorul pune pe pauză sunetul video original în timpul descrierilor, asigurându-se că nu pierzi niciun cuvânt din dialogul original sau din narațiunea AI.
- Videoclipuri YouTube: Pentru sursele YouTube (care nu sunt descărcate local), exportul MP3 va conține strict pista vocală AI sincronizată, fără sunetul de fundal al videoclipului.

5. Transcriere și dublare media (M)

Transcriptorul audio a fost reconstruit complet pentru a accepta atât fișiere audio, cât și fișiere video (MP3, WAV, MP4, MKV etc.). Apasă M în stratul de comenzi pentru a selecta un fișier media și alege unul dintre cele 3 moduri de operare distincte:
1. Transcrie (limba originală): Transcrie cu acuratețe vorbirea în limba sa originală.
2. Transcrie și traduce (limba țintă): Transcrie vorbirea și o traduce în limba țintă configurată.
3. Dublează și traduce (limba țintă) (doar Gemini): O funcție nouă puternică ce transcrie vorbirea, o traduce în limba ta țintă și sintetizează o dublare audio vorbită folosind motorul TTS al add-on-ului.

6. Cititor avansat de documente și imagini

Vision Assistant Pro include un Cititor de documente foarte optimizat, conceput pentru PDF-uri cu mai multe pagini, imagini complexe și chiar formate iPhone HEIC.

6.1 Procesare în lot și reluare

Nu trebuie să citești un document masiv dintr-o singură dată. Introdu un interval de pagini (de exemplu, 1-20), iar AI-ul va procesa toate paginile în fundal. Dacă NVDA se blochează sau întrerupi scanarea, add-on-ul îți va reține progresul și îți va oferi opțiunea de reluare exact de unde a rămas!

6.2 Acțiune inteligentă pentru fișiere

Nu trebuie întotdeauna să deschizi mai întâi documentul. În Windows File Explorer, evidențiază pur și simplu un PDF sau o imagine și apasă D (Cititor de documente) sau F (Acțiune inteligentă pentru fișiere) în stratul de comenzi. Add-on-ul va ocoli instant dialogul de fișiere și va începe procesarea fișierului evidențiat.

6.3 Scurtături în vizualizatorul de documente

Când fereastra Cititorului de documente este deschisă, poți folosi următoarele scurtături:
- Ctrl + PageDown: Mută-te la pagina următoare.
- Ctrl + PageUp: Mută-te la pagina anterioară.
- Alt + A: Deschide un dialog de chat pentru a pune întrebări despre document.
- Alt + R: Forțează o rescanare cu AI folosind furnizorul activ.
- Alt + G: Generează și salvează un fișier audio de calitate înaltă (WAV/MP3). (Ascuns dacă furnizorul nu acceptă TTS).
- Alt + S / Ctrl + S: Salvează textul extras ca fișier TXT sau HTML.

7. Etichetare AI semantică și UI Explorer

Te-ai blocat într-o aplicație în care peste tot apare „buton fără etichetă”? Motorul de etichetare AI semantică rezolvă permanent acest lucru.

7.1 Etichetare permanentă a obiectelor (L)

Mută focusul cititorului de ecran pe un grafic sau buton fără etichetă și apasă L în stratul de comenzi. AI-ul va privi vizual butonul, îi va determina funcția și va aplica o etichetă permanentă.
Spre deosebire de instrumentele mai vechi de etichetare pentru cititoare de ecran, acest add-on folosește un sistem hibrid avansat de „semnătură a obiectului” (AutomationId/ControlID). Etichetele tale personalizate vor supraviețui redimensionării ferestrelor, schimbării monitorului și actualizărilor aplicației!

7.2 Scanarea completă a aplicației (Shift + L)

Apasă Shift + L pentru a scana întreaga fereastră activă dintr-o dată. AI-ul va găsi toate elementele fără etichetă și le va denumi inteligent într-o singură operație. Ulterior, poți gestiona, redenumi sau șterge în lot aceste etichete din Managerul de etichete integrat.

7.3 UI Explorer (E)

Ai nevoie să interacționezi cu un element fără să navighezi manual până la el? Apasă E pentru a activa UI Explorer. AI-ul va scana ecranul și va genera o listă accesibilă cu fiecare element pe care se poate face clic (ignorând zgomotul de sistem precum bara de activități). Alege un element din listă, iar add-on-ul îl va apăsa instant pentru tine.

8. Asistent vocal live

Live Assistant transformă Vision Assistant Pro într-un copilot interactiv în timp real.
(Notă: Această funcție este exclusivă pentru Google Gemini și furnizorii personalizați compatibili Gemini).

9. Prompturi personalizate și variabile

Poți gestiona prompturile în Setări > Prompturi > Gestionează prompturi....

Variabile acceptate

10. Cazuri reale de utilizare (Ce funcție ar trebui să folosesc?)

Vision Assistant Pro este plin de instrumente avansate. Iată câteva scenarii comune care te ajută să alegi funcția potrivită:


Notă: Pentru toate funcțiile AI este necesară o conexiune activă la internet. Documentele cu mai multe pagini sunt procesate automat.

11. Suport și comunitate

Rămâi la curent cu cele mai recente noutăți, funcții și lansări:
- Canal Telegram: t.me/VisionAssistantPro
- Issue-uri GitHub: Pentru raportări de erori și cereri de funcții.

Raportarea erorilor și jurnale

Când deschizi un issue pe GitHub sau ceri suport, te rog include detalii despre furnizorul AI activ, model și versiunea NVDA. Dacă ai probleme de conexiune sau blocări neașteptate, activează fișierul jurnal dedicat din Setări > Avansat, recreează problema și atașează fișierul vision_assistant.log pentru a ne ajuta să rezolvăm problema mai repede.

12. Susținătorii proiectului

Mulțumiri sincere membrilor comunității care susțin dezvoltarea și mentenanța continuă a acestui proiect prin contribuțiile lor financiare generoase:

Dacă dorești să susții financiar proiectul și să îți vezi numele aici, poți găsi opțiunea Donate în meniul Instrumente NVDA (submeniul Vision Assistant) sau în timpul procesului de configurare de după instalare.


Modificări pentru 2026.08.06

Modificări pentru 2026.07.15

Modificări pentru 7.0.0

Modificări pentru 6.5.0

Modificări pentru 6.1.2

Modificări pentru 6.1.1

Modificări pentru 6.1.0

Modificări pentru 6.0

Modificări pentru 5.6

Modificări pentru 5.5.2

Modificări pentru 5.5 (actualizarea pentru automatizare)

Modificări pentru 5.0

Modificări pentru 4.6

Modificări pentru 4.5

Modificări pentru 4.0.3

Modificări pentru 4.0.1

Modificări pentru 3.6.0

Modificări pentru 3.5.0

* **Strat de comenzi:** A fost introdus un sistem de strat de comenzi, implicit NVDA+Shift+V, pentru a grupa scurtăturile sub o singură tastă principală. De exemplu, în loc să apeși NVDA+Control+Shift+T pentru traducere, acum apeși NVDA+Shift+V, apoi T.
* **Analiză video online:** A fost adăugată o funcție nouă pentru analiza videoclipurilor YouTube și Instagram direct prin introducerea unui URL.

Modificări pentru 3.1.0

Modificări pentru 3.0

Modificări pentru 2.9

Modificări pentru 2.8

Modificări pentru 2.7

Modificări pentru 2.6

Modificări pentru 2.5

Modificări pentru 2.1.1

Modificări pentru 2.1

Modificări pentru 2.0

Modificări pentru 1.5

Modificări pentru 1.0