Documentazione di Vision Assistant Pro

Vision Assistant Pro è un assistente IA multimodale avanzato per NVDA. Utilizza motori di intelligenza artificiale di alto livello per fornire lettura intelligente dello schermo, traduzione, dettatura vocale e analisi dei documenti.

Questo componente aggiuntivo è stato rilasciato alla comunità in occasione della Giornata internazionale delle persone con disabilità.

1. Configurazione e impostazioni

Andare in Menu NVDA > Preferenze > Impostazioni > Vision Assistant Pro.

1.1 Impostazioni di connessione

1.2 Instradamento avanzato dei modelli

Disponibile per tutti i provider, inclusi Gemini, OpenAI, Groq, Mistral e Personalizzato.

⚠️ Avviso: queste impostazioni sono destinate esclusivamente agli utenti avanzati. Se non si conosce il funzionamento di un determinato modello, lasciare questa opzione non selezionata. La scelta di un modello incompatibile per una determinata attività (ad esempio un modello solo testuale per funzioni visive) provocherà errori e impedirà il funzionamento del componente aggiuntivo.

Selezionare “Instradamento avanzato dei modelli (specifico per attività)” per sbloccare i controlli dettagliati. Questa funzione consente di scegliere modelli specifici dall’elenco per diverse attività:
- Modello OCR / Visione: scegliere un modello specializzato per l’analisi delle immagini.
- Speech-to-Text (STT): scegliere un modello specifico per la dettatura.
- Text-to-Speech (TTS): scegliere un modello per la generazione dell’audio.
- Modello operatore IA: selezionare un modello specifico per attività autonome di controllo del computer.
Nota: le funzioni non supportate (ad esempio il TTS per Groq) verranno nascoste automaticamente.

1.3 Configurazione avanzata degli endpoint (provider personalizzato)

Disponibile solo quando è selezionato “Personalizzato”.

⚠️ Avviso: questa sezione consente la configurazione manuale delle API ed è progettata per utenti esperti che utilizzano server locali o proxy. URL o nomi modello errati interromperanno la connettività. Se non si conosce esattamente il significato di questi endpoint, lasciare questa opzione non selezionata.

Selezionare “Configurazione avanzata degli endpoint” per inserire manualmente i dettagli del server. A differenza dei provider nativi, qui è necessario digitare URL e nomi dei modelli specifici:
- URL elenco modelli: endpoint utilizzato per recuperare i modelli disponibili.
- URL endpoint OCR/STT/TTS: URL completi per servizi specifici (ad esempio http://localhost:11434/v1/audio/speech).
- Modelli personalizzati: digitare manualmente il nome del modello (ad esempio llama3:8b) per ogni attività.

1.4 Preferenze generali

2. Livello comandi e scorciatoie da tastiera

Per evitare conflitti da tastiera, questo componente aggiuntivo utilizza un livello comandi.
1. Premere NVDA + Shift + V (tasto principale) per attivare il livello (verrà emesso un segnale acustico).
2. Rilasciare i tasti, quindi premere uno dei seguenti tasti singoli:

Tasto Funzione Descrizione
Shift + A Operatore IA Operazione autonoma: consente all’IA di eseguire un’attività sullo schermo.
E Esploratore interfaccia Clic interattivo: identifica e fa clic sugli elementi dell’interfaccia in qualsiasi applicazione.
T Traduttore intelligente Traduce il testo sotto il cursore navigatore o la selezione.
Shift + T Traduttore appunti Traduce il contenuto attualmente presente negli appunti.
R Rifinitore testo Riassume, corregge la grammatica, spiega o esegue prompt personalizzati.
V Visione oggetto Descrive l’oggetto navigatore corrente.
O Visione schermo intero Analizza il layout e il contenuto dell’intero schermo.
Shift + V Analisi video online Analizza video di YouTube, Instagram, TikTok o Twitter (X).
D Lettore documenti Lettore avanzato per PDF e immagini con selezione dell’intervallo di pagine.
F Azione file intelligente Riconoscimento contestuale di immagini, PDF o file TIFF selezionati.
A Trascrizione audio Trascrive file MP3, WAV o OGG in testo.
C Risolutore CAPTCHA Cattura e risolve CAPTCHA (supporta portali governativi).
S Dettatura intelligente Converte il parlato in testo. Premere per avviare la registrazione, di nuovo per interrompere e scrivere.
I Segnalazione stato Annuncia lo stato corrente (ad esempio “Scansione...”, “Inattivo”).
L Etichetta oggetto Etichettatura semantica IA: assegna in modo permanente un’etichetta all’elemento o icona attualmente focalizzati.
Shift + L Gestisci/scansiona etichette Apre il gestore etichette (se esistono etichette) oppure analizza l’applicazione alla ricerca di elementi senza nome.
U Controllo aggiornamenti Controlla manualmente su GitHub la presenza di nuove versioni del componente aggiuntivo.
Spazio Richiama ultimo risultato Mostra l’ultima risposta dell’IA in una finestra chat per revisione o domande successive.
H Guida comandi Mostra un elenco di tutte le scorciatoie disponibili.

2.1 Scorciatoie del lettore documenti (all’interno del visualizzatore)

3. Prompt personalizzati e variabili

È possibile gestire i prompt in Impostazioni > Prompt > Gestisci prompt....

Variabili supportate


Nota: è necessaria una connessione Internet attiva per tutte le funzioni IA. I documenti multipagina vengono elaborati automaticamente.

4. Supporto e comunità

Rimani aggiornato sulle ultime notizie, funzionalità e versioni:
- Canale Telegram: t.me/VisionAssistantPro
- Segnalazioni GitHub: per segnalazioni di bug e richieste di nuove funzionalità.

5. Sostenitori del progetto

Un sentito ringraziamento ai membri della comunità che supportano lo sviluppo e la manutenzione continui di questo progetto tramite i loro generosi contributi economici:

Se desideri sostenere economicamente il progetto e vedere il tuo nome qui, puoi trovare l’opzione Dona nel menu Strumenti di NVDA (sottomenu Vision Assistant) oppure durante la procedura di configurazione dopo l’installazione.


Changes for 6.0

Changes for 5.6

Changes for 5.5.2

Changes for 5.5 (The Automation Update)

Changes for 5.0

Changes for 4.6

Changes for 4.5

Changes for 4.0.3

Changes for 4.0.1

Changes for 3.6.0

Changes for 3.5.0

* **Command Layer:** Introduced a Command Layer system (default: NVDA+Shift+V) to group shortcuts under a single master key. For example, instead of pressing NVDA+Control+Shift+T for translation, you now press NVDA+Shift+V followed by T.
* **Online Video Analysis:** Added a new feature to analyze YouTube and Instagram videos directly by providing a URL.

Changes for 3.1.0

Changes for 3.0

Changes for 2.9

Changes for 2.8

Changes for 2.7

Changes for 2.6

Changes for 2.5

Changes for 2.1.1

Changes for 2.1

Changes for 2.0

Changes for 1.5

Changes for 1.0