Documentação do Vision Assistant Pro

Total Downloads: 62,863

O Vision Assistant Pro é um assistente de IA avançado e multimodal para o NVDA. Ele utiliza motores de IA de classe mundial para fornecer leitura inteligente de ecrãs, tradução, ditado por voz e análise de documentos.

Este suplemento foi lançado para a comunidade em honra do Dia Internacional das Pessoas com Deficiência.

1. Configuração

Aceda a Menu do NVDA > Preferências > Configurações > Vision Assistant Pro. A caixa de diálogo de configurações está organizada em 9 separadores acessíveis: Conexão, Assistente em Direto, Comportamento da IA, Idiomas de Tradução, Leitor de Documentos, Vídeo, CAPTCHA, Prompts e Avançado.

1.1 Separador Conexão

1.2 Separador Assistente em Direto

Nota: Este separador aparece apenas quando o Google Gemini (ou um fornecedor personalizado compatível com o Gemini) é o seu fornecedor ativo.

1.3 Separador Comportamento da IA

1.4 Separador Idiomas de Tradução

1.5 Separador Leitor de Documentos

1.6 Separador Vídeo

1.7 Separador CAPTCHA

1.8 Separador Prompts

1.9 Separador Avançado e Registos Globais

Aceda ao separador Avançado para configurar o registo global do suplemento:

1.10 Cópia de Segurança e Restauro de Configurações

O separador Avançado também inclui uma secção de Cópia de Segurança e Restauro:

2. Camada de Comandos e Atalhos

Para evitar conflitos de teclado, este suplemento utiliza uma Camada de Comandos.

  1. Prima NVDA + Shift + V (Tecla Mestra) para ativar a camada (ouvirá um sinal sonoro).
  2. Largue as teclas e, em seguida, prima uma das seguintes teclas individuais:
Tecla Função Descrição
Shift + A Operador de IA Operação Autónoma: Diz à IA para executar uma tarefa no seu ecrã. Premir novamente cancela instantaneamente as operações ativas.
E Explorador de UI Clique Interativo: Identifica e clica em elementos de UI em qualquer aplicação.
T Tradutor Inteligente Traduz o texto sob o cursor do navegador ou a seleção.
Shift + T Tradutor da Área de Transferência Traduz o conteúdo atualmente presente na área de transferência.
R Refinador de Texto Resume, corrige gramática, explica ou executa Prompts Personalizados.
V Visão de Objeto Descreve o objeto navegador atual.
O Visão de Ecrã Completo Analisa todo o layout e conteúdo do ecrã.
Shift + V Análise de Vídeo Analisa ficheiros de vídeo locais ou vídeos online do YouTube, Instagram, TikTok ou Twitter (X).
Control + V Gravação de Vídeo Local Grava um vídeo silencioso do seu ecrã e analisa as ações e o layout.
D Leitor de Documentos Leitor avançado para PDF, imagens e ficheiros de texto simples/HTML com seleção de intervalo de páginas.
F Ação Inteligente em Ficheiros Reconhecimento consciente do contexto a partir de imagens, PDFs ou ficheiros TIFF selecionados.
M Transcrição e Dobragem de Média Transcreve ou dobra ficheiros de áudio/vídeo (MP3, WAV, MP4, etc.) para o seu idioma de destino.
C Resolvedor de CAPTCHA Captura e resolve CAPTCHAs.
Shift + C Chat Direto Abre uma interface de chat baseada em texto diretamente com a IA.
S Ditado Inteligente Converte fala em texto. Prima para iniciar a gravação, prima novamente para parar/escrever.
Control+T Tradução por Voz Transcreve, traduz e escreve o resultado com base nas suas definições de idioma.
Control+L Assistente em Direto Copilot em Tempo Real (apenas Gemini): Inicia ou termina uma conversação de voz e ecrã em direto com o assistente de IA.
I Relatório de Estado Anuncia o progresso atual (por exemplo, "A analisar...", "Inativo").
L Rotular Objeto Rotulagem Semântica por IA: Rotula permanentemente o elemento/ícone atualmente em foco.
Shift + L Gerir/Escanear Rótulos Abre o Gestor de Rótulos (se existirem rótulos) ou examina a aplicação em busca de elementos sem nome.
U Verificação de Atualizações Verifica manualmente no GitHub a versão mais recente do suplemento.
Espaço Chamar Último Resultado Mostra a última resposta da IA numa caixa de diálogo de chat para revisão ou seguimento.
H Ajuda de Comandos Exibe uma lista de todos os atalhos disponíveis.
Control + H Histórico Abre a caixa de diálogo de Histórico listando os seus chats e documentos passados, com filtros de tipo e opções de Eliminar/Limpar.
Alt + S Configurações Abre a caixa de diálogo de configurações do Vision Assistant Pro.
Alt + Q Relatório de Chaves com Quota Esgotada Informa o número de chaves da API do Gemini que excederam a sua quota diária e o respetivo tempo de reinicialização.
Alt + M Auditoria de Encaminhamento Informa os modelos de IA atualmente selecionados no encaminhamento avançado.
Para cima / Para baixo Navegação Rápida nas Configurações Navega entre categorias de configurações rápidas (Fornecedor, Modelo, etc.) na camada.
Esquerda / Direita Alterar Configuração Rápida Altera o valor da configuração rápida atualmente selecionada.

3. Chat e Histórico

As janelas de chat e a caixa de diálogo de Histórico funcionam em todas as funcionalidades, para que possa rever conversas e continuar exatamente de onde parou.

3.1 Atalhos da Janela de Chat

Quando uma janela de chat está aberta (Chat Direto, chat de documentos, refinamento e semelhantes), pode rever a conversação com:

3.2 Histórico (Control + H)

Prima Control + H na Camada de Comandos para abrir a caixa de diálogo Histórico com os seus chats e documentos anteriores, filtráveis por tipo (Todos / Chats / Documentos). Abra um chat para continuar a conversação - incluindo os seus ficheiros anexados, que são reanexados automaticamente - ou abra um documento e continue a ler. Prima Delete em qualquer item para o remover, ou Limpar Tudo para esvaziar a lista.

4. Operador de IA - Controlo Autónomo do Computador

O Operador de IA transforma o Vision Assistant Pro de um leitor passivo num assistente ativo que pode interagir com o seu computador em seu nome. Pode pedir-lhe para descrever o ecrã, responder a perguntas sobre o que vê ou até assumir o controlo - clicando em botões, arrastando itens, escrevendo texto e navegando por aplicações utilizando comandos em linguagem natural.

A maior vantagem? Funciona perfeitamente em softwares completamente inacessíveis. Se estiver preso numa aplicação personalizada, num ambiente de trabalho remoto (Remote Desktop) ou num site onde o seu leitor de ecrã fica totalmente em silêncio, o operador não se importa. Como "vê" o ecrã visualmente, consegue encontrar, ler e interagir com elementos que têm zero rótulos de acessibilidade.

Como Funciona

  1. Prima NVDA + Shift + V e, em seguida, prima Shift + A (ou utilize o atalho direto) para abrir a caixa de diálogo do Operador de IA.
  2. Escreva o que pretende fazer em linguagem simples (por exemplo, "Clica no botão Guardar", "O que diz a mensagem de erro?" ou "Muda o nome do ficheiro para final.pdf").
  3. A IA analisará o seu ecrã, identificará os elementos relevantes e executará a ação ou fornecerá a resposta. Se uma tarefa exigir vários passos, o operador continuará a trabalhar até que esteja concluída.
  4. Prima Shift + A novamente a qualquer momento para abortar instantaneamente uma operação em curso.

Ações Suportadas

O operador compreende uma vasta gama de comandos:

Notas Importantes

5. Análise de Vídeo e Audiodescrição

Nota: As funcionalidades de Análise de Vídeo e Audiodescrição são estritamente alimentadas pelo fornecedor Google Gemini. Certifique-se de que o seu fornecedor ativo nas definições do suplemento está definido como Google Gemini.

O Vision Assistant Pro introduz poderosas capacidades de processamento de vídeo concebidas especificamente para utilizadores cegos. Consegue analisar tanto vídeos online como gravações de ecrã locais para fornecer descrições visuais altamente detalhadas e gerar scripts de Audiodescrição profissionais (SRT).

5.1 Gravação de Ecrã Local (Control + V)

Se encontrar um vídeo silencioso, uma animação ou um tutorial no seu ecrã, pode capturá-lo diretamente:

  1. Prima NVDA + Shift + V para entrar na Camada de Comandos e, em seguida, prima Control + V.
  2. O suplemento gravará o seu ecrã silenciosamente em segundo plano.
  3. Prima Control + V novamente para parar a gravação.
  4. A IA analisará o segmento de vídeo gravado e fornecerá uma descrição altamente detalhada da cena, personagens e ações.

5.2 Análise de Vídeo (Shift + V)

Pode analisar tanto ficheiros de vídeo locais como vídeos online. Basta selecionar um ficheiro de vídeo local no Explorador do Windows ou copiar uma hiperligação (URL) de vídeo online para a sua área de transferência. Também pode premir Shift + V em qualquer lugar (como dentro de um leitor multimédia) para abrir uma caixa de diálogo onde pode procurar um ficheiro de vídeo ou colar um URL manualmente.

5.3 Geração de Audiodescrição (SRT)

Para uma experiência mais estruturada, o suplemento pode gerar scripts de Audiodescrição profissionais no formato padrão SubRip (SRT).

5.4 Narração de Áudio Sincronizada (Exportação MP3)

Para além de criar apenas ficheiros SRT baseados em texto, o suplemento funciona como uma ferramenta completa de produção de Audiodescrição, sintetizando as descrições em voz e misturando-as com o vídeo. Pode agora escolher Gemini Live TTS como o motor de voz, que utiliza a API Gemini Live para gerar narração de voz altamente realista e ilimitada. Ao gerar um MP3 para ficheiros de vídeo locais, tem múltiplos modos de mistura:

6. Transcrição e Dobragem de Média (M)

O Transcritor de Áudio foi completamente reestruturado para suportar ficheiros de áudio e vídeo (MP3, WAV, MP4, MKV, etc.). Prima M na Camada de Comandos para selecionar um ficheiro multimédia e escolher um de 3 modos de operação distintos:

  1. Transcrever (Idioma Original): Transcreve com precisão a fala no seu idioma original.
  2. Transcrever e Traduzir (Idioma de Destino): Transcreve a fala e traduz-a para o seu idioma de destino configurado.
  3. Dobrar e Traduzir (Idioma de Destino) (Apenas Gemini): Uma nova funcionalidade poderosa que transcreve a fala, traduz-a para o seu idioma de destino e sintetiza uma dobragem de áudio falada utilizando o motor TTS do suplemento.

7. Leitor Avançado de Documentos e Imagens

O Leitor de Documentos transforma os seus documentos em texto limpo e legível - para que possa ler, traduzir e ouvir qualquer coisa, desde um livro digitalizado até uma pilha de fotografias. Lida com PDFs de várias páginas, imagens complexas, formatos HEIC do iPhone e até ficheiros de texto simples (.txt) e HTML (.html, .htm), que são abertos instantaneamente sem OCR ou processamento por IA. Selecione vários ficheiros de uma vez e estes são unidos num único documento contínuo na ordem das páginas. Estão disponíveis três motores de OCR - Chrome (Rápido), AI (Avançado) para uma preservação superior do layout e Nenhum (Extrair Camada de Texto) para PDFs pesquisáveis -, selecionados em Definições → Leitor de Documentos.

Como Funciona

  1. Prima NVDA + Shift + V, depois D para abrir o Leitor de Documentos — ou realce primeiro um ficheiro no Explorador de Ficheiros e prima D / F para ignorar totalmente a caixa de diálogo de ficheiros.
  2. Escolha um ou mais PDFs ou imagens. O suplemento examina-os e anuncia a contagem total de páginas.
  3. Na caixa de diálogo de Opções, escolha o intervalo de páginas (De/Para). Também pode marcar Traduzir Saída e escolher o idioma de destino, ou alternar Descrever imagens inline durante o OCR.
  4. A extração de texto começa em segundo plano por lotes. Pode fechar a janela a qualquer momento e continuar mais tarde — nada é perdido.
  5. Assim que as páginas estiverem prontas, leia-as no visualizador: navegue entre páginas, salte para qualquer página, faça perguntas à IA, guarde o texto ou gere uma narração em áudio.

7.1 Processamento em Lote e Retoma

Não precisa de ler um documento massivo de uma só vez. Escolha um intervalo de páginas (por exemplo, 1-20) ou mantenha os valores predefinidos para processar tudo, e a IA extrai todas as páginas em segundo plano. Se o NVDA crashar ou interromper o exame, o suplemento lembra-se do seu progresso e oferece a opção de Retomar exatamente onde ficou — mesmo após reinicializações. Os documentos concluídos também ficam em cache, pelo que reabri-los (a partir de Documentos Recentes ou através de D) carrega o texto instantaneamente sem voltar a executar o OCR, a menos que os ficheiros de origem tenham sido alterados.

7.2 Ação Inteligente em Ficheiros

Não precisa de abrir sempre o documento primeiro. No Explorador de Ficheiros do Windows, basta realçar um PDF, imagem ou ficheiro de texto/HTML e premir D (Leitor de Documentos) — ou realçar um PDF ou imagem e premir F (Ação Inteligente em Ficheiros) — dentro da Camada de Comandos. O suplemento ignora instantaneamente a caixa de diálogo de ficheiros e começa a processar o ficheiro realçado. Selecionar vários ficheiros de uma vez processa-os em conjunto como um único documento.

7.3 Controlos e Atalhos do Visualizador de Documentos

Quando a janela do Leitor de Documentos está aberta, pode utilizar o seguinte:

Atalhos de Teclado

Botões e Controlos

7.4 Documentos Recentes (D)

Premir D na Camada de Comandos lista primeiro os seus documentos lidos recentemente. Escolha um para continuar a partir da página em que estava — mesmo que o OCR já tenha terminado — ou prima Abrir Ficheiro... (Ctrl + O) para procurar um ficheiro como habitualmente.

8. Rotulagem Semântica por IA e Explorador de UI

Apanhado numa aplicação com "botão sem rótulo" em todo o lado? O motor de Rotulagem Semântica por IA resolve isto permanentemente.

8.1 Rotulagem Permanente de Objetos (L)

Foque o seu leitor de ecrã num gráfico ou botão sem rótulo e prima L na Camada de Comandos. A IA examinará o botão visualmente, determinará a sua função e aplicará um rótulo permanente.
Ao contrário das ferramentas de rotulagem de leitores de ecrã mais antigas, este suplemento utiliza um sistema híbrido avançado de "Assinatura de Objeto" (AutomationId/ControlID). Os seus rótulos personalizados sobreviverão a redimensionamentos de janelas, trocas de monitores e atualizações de aplicações!

8.2 Exame Completo da Aplicação (Shift + L)

Prima Shift + L para examinar toda a janela ativa de uma só vez. A IA encontrará todos os elementos sem rótulo e nomeá-los-á de forma inteligente de uma só vez. Posteriormente, pode gerir, mudar o nome ou eliminar em lote estes rótulos a partir do Gestor de Rótulos integrado.

8.3 Explorador de UI (E)

Precisa de interagir com um elemento sem navegar até ele manualmente? Prima E para ativar o Explorador de UI. A IA examinará o ecrã e gerará uma lista acessível de cada elemento clicável (ignorando ruído do sistema como barras de tarefas). Escolha um item da lista e o suplemento clicará instantaneamente nele por si.

9. Assistente de Voz em Direto

O Assistente em Direto transforma o Vision Assistant Pro num copiloto interativo em tempo real.
(Nota: Esta funcionalidade é exclusiva do Google Gemini e de fornecedores Personalizados compatíveis com o Gemini).

10. Prompts Personalizados e Variáveis

Pode gerir prompts em Definições > Prompts > Gerir Prompts....

Atalhos de Prompts Personalizados

Atribua a qualquer prompt personalizado a sua própria tecla de atalho diretamente no Gestor de Prompts e execute-o instantaneamente com a sua seleção ou contexto atual:

Variáveis Suportadas

11. Casos de Uso no Mundo Real (Que funcionalidade devo utilizar?)

O Vision Assistant Pro está repleto de ferramentas avançadas. Eis alguns cenários comuns para o ajudar a escolher a correta:


Nota: É necessária uma ligação ativa à internet para todas as funcionalidades de IA. Os documentos de várias páginas são processados automaticamente.

12. Suporte e Comunidade

Mantenha-se atualizado com as últimas notícias, funcionalidades e lançamentos:

Relatar Erros e Registos

Ao abrir uma issue no GitHub ou pedir suporte, inclua detalhes sobre o seu fornecedor de IA ativo, modelo e versão do NVDA. Se estiver a experienciar problemas de ligação ou crashes inesperados, ative o ficheiro de registo dedicado em Definições > Avançado, recrie o problema e anexe o seu ficheiro vision_assistant.log para nos ajudar a resolver o problema mais rapidamente.

13. Apoiantes do Projeto

Um agradecimento sincero aos membros da nossa comunidade que apoiam o desenvolvimento contínuo e a manutenção deste projeto através das suas generosas contribuições financeiras:

Se desejar apoiar o projeto financeiramente e ver o seu nome aqui, pode encontrar a opção Doar no menu Ferramentas do NVDA (subdiretório Vision Assistant) ou durante o processo de configuração após a instalação.


Alterações para 2026.09.01

Alterações para 2026.08.06

Alterações para 2026.07.15

Alterações para 7.0.0

Alterações para 6.5.0

Alterações para 6.1.2

Alterações para 6.1.1

Alterações para 6.1.0

Alterações para 6.0

Alterações para 5.6

Alterações para 5.5.2

Alterações para 5.5 (A Atualização de Automação)

Alterações para 5.0

Alterações para 4.6

Alterações para 4.5

Alterações para 4.0.3

Alterações para 4.0.1

Alterações para 3.6.0

Alterações para 3.5.0

Alterações para 3.1.0

Alterações para 3.0

Alterações para 2.9

Alterações para 2.8

Alterações para 2.7

Alterações para 2.6

Alterações para 2.5

Alterações para 2.1.1

Alterações para 2.1

Alterações para 2.0

Alterações para 1.5

Alterações para 1.0