Documentação do Vision Assistant Pro

Total Downloads: 62,863

O Vision Assistant Pro é um assistente de IA multimodal avançado para o NVDA. Ele utiliza motores de IA de classe mundial para oferecer leitura de tela inteligente, tradução, ditado por voz e análise de documentos.

Este complemento foi disponibilizado à comunidade em homenagem ao Dia Internacional das Pessoas com Deficiência.

1. Configuração e Instalação

Acesse o Menu do NVDA > Preferências > Configurações > Vision Assistant Pro. A caixa de diálogo de configurações está organizada em 9 abas acessíveis: Conexão, Assistente ao Vivo, Comportamento da IA, Idiomas de Tradução, Leitor de Documentos, Vídeo, CAPTCHA, Prompts e Avançado.

1.1 Aba Conexão

1.2 Aba Assistente ao Vivo

Nota: Esta aba aparece apenas quando o Google Gemini (ou um provedor Personalizado compatível com o Gemini) estiver ativo.

1.3 Aba Comportamento da IA

1.4 Aba Idiomas de Tradução

1.5 Aba Leitor de Documentos

1.6 Aba Vídeo

1.7 Aba CAPTCHA

1.8 Aba Prompts

1.9 Aba Avançado e Log Global

Navegue até a aba Avançado para configurar o log global de eventos do complemento:

1.10 Backup e Restauração de Configurações

A aba Avançado também inclui uma seção de Backup e Restauração:

2. Camada de Comandos e Atalhos

Para evitar conflitos de teclado, este complemento utiliza uma Camada de Comandos.

  1. Pressione NVDA + Shift + V (Tecla Mestra) para ativar a camada (você ouvirá um sinal sonoro).
  2. Solte as teclas e, em seguida, pressione uma das seguintes teclas individuais:
Tecla Função Descrição
Shift + A Operador de IA Operação Autônoma: Peça à IA para realizar uma tarefa na tela. Pressionar novamente aborta instantaneamente as operações ativas.
E Explorador de UI Clique Interativo: Identifica e clica em elementos da interface em qualquer aplicativo.
T Tradutor Inteligente Traduz o texto sob o cursor de navegação ou seleção.
Shift + T Tradutor da Área de Transferência Traduz o conteúdo atualmente na área de transferência.
R Refinador de Texto Resumir, Corrigir Gramática, Explicar ou executar Prompts Personalizados.
V Visão do Objeto Descreve o objeto de navegação atual.
O Visão de Tela Inteira Analisa o layout e o conteúdo de toda a tela.
Shift + V Análise de Vídeo Analisa arquivos de vídeo locais ou vídeos online do YouTube, Instagram, TikTok ou Twitter (X).
Control + V Gravação de Vídeo Local Grava um vídeo silencioso da sua tela e analisa as ações e o layout.
D Leitor de Documentos Leitor avançado para PDF, imagens e arquivos de texto simples/HTML com seleção de intervalo de páginas.
F Ação de Arquivo Inteligente Reconhecimento sensível ao contexto de arquivos de imagem, PDF ou TIFF selecionados.
M Transcrição e Dublagem de Mídia Transcreve ou dubla arquivos de áudio/vídeo (MP3, WAV, MP4, etc.) para o seu idioma de destino.
C Solucionador de CAPTCHA Captura e resolve CAPTCHAs.
Shift + C Bate-Papo Direto Abre uma interface de bate-papo por texto direta com a IA.
S Ditado Inteligente Converte voz em texto. Pressione para iniciar a gravação e novamente para parar/digitar.
Control+T Tradução por Voz Transcreve, traduz e digita o resultado com base nas suas configurações de idioma.
Control+L Assistente ao Vivo Copiloto em Tempo Real (Apenas Gemini): Inicia ou encerra uma conversa de voz e tela ao vivo com o assistente de IA.
I Relatório de Status Anuncia o progresso atual (ex.: "Analisando...", "Inativo").
L Etiquetar Objeto Rotulagem Semântica por IA: Etiqueta permanentemente o elemento/ícone focado.
Shift + L Gerenciar/Escanear Etiquetas Abre o Gerenciador de Etiquetas (se existirem) ou escaneia o aplicativo em busca de elementos sem nome.
U Verificar Atualizações Verifica manualmente no GitHub a existência da versão mais recente do complemento.
Espaço Chamar Último Resultado Mostra a última resposta da IA em uma janela de bate-papo para revisão ou acompanhamento.
H Ajuda de Comandos Exibe uma lista de todos os atalhos disponíveis.
Control + H Histórico Abre a caixa de diálogo do Histórico listando seus bate-papos e documentos anteriores, com filtros por tipo e opções de Excluir/Limpar.
Alt + S Configurações Abre a caixa de diálogo de configurações do Vision Assistant Pro.
Alt + Q Relatório de Chaves com Quota Esgotada Informa o número de chaves de API do Gemini que excederam a cota diária e a respectiva hora de reinício.
Alt + M Auditoria de Roteamento Informa os modelos de IA atualmente selecionados no roteamento avançado.
Cima / Baixo Navegação nas Configurações Rápidas Navega entre as categorias de configurações rápidas (Provedor, Modelo, etc.) na camada.
Esquerda / Direita Alterar Configuração Rápida Altera o valor da configuração rápida atualmente selecionada.

3. Bate-Papo e Histórico

As janelas de bate-papo e a caixa de diálogo do Histórico funcionam em todos os recursos, permitindo que você revise conversas e continue exatamente de onde parou.

3.1 Atalhos da Janela de Bate-Papo

Quando uma janela de bate-papo estiver aberta (Bate-Papo Direto, bate-papo de documento, refinamento e similares), você poderá revisar a conversa com:

3.2 Histórico (Control + H)

Pressione Control + H na Camada de Comandos para abrir a caixa de diálogo do Histórico com seus bate-papos e documentos anteriores, filtráveis por tipo (Tudo / Bate-papos / Documentos). Abra um bate-papo para continuar a conversa - incluindo seus arquivos anexados, que são reanexados automaticamente - ou abra um documento e continue a leitura. Pressione Delete em qualquer item para removê-lo, ou Limpar Tudo para esvaziar a lista.

4. Operador de IA - Controle Autônomo do Computador

O Operador de IA transforma o Vision Assistant Pro de um leitor passivo em um assistente ativo capaz de interagir com o seu computador em seu nome. Você pode pedir a ele para descrever a tela, responder a perguntas sobre o que vê ou até mesmo assumir o controle - clicando em botões, arrastando itens, digitando textos e navegando pelos aplicativos usando comandos em linguagem natural.

A maior vantagem? Funciona perfeitamente em softwares completamente inacessíveis. Se você estiver preso em um aplicativo personalizado, em uma área de trabalho remota ou em um site onde o seu leitor de tela fica totalmente silencioso, o operador não se importa. Como ele "vê" a tela visualmente, consegue encontrar, ler e interagir com elementos que não possuem nenhuma etiqueta de acessibilidade.

Como Funciona

  1. Pressione NVDA + Shift + V e, em seguida, pressione Shift + A (ou use o atalho direto) para abrir a caixa de diálogo do Operador de IA.
  2. Digite o que deseja fazer em linguagem simples (ex.: "Clique no botão Salvar", "O que diz a mensagem de erro?" ou "Renomeie o arquivo para final.pdf").
  3. A IA analisará sua tela, identificará os elementos relevantes e executará a ação ou fornecerá a resposta. Se uma tarefa exigir várias etapas, o operador continuará trabalhando até que esteja concluída.
  4. Pressione Shift + A novamente a qualquer momento para abortar instantaneamente uma operação em andamento.

Ações Suportadas

O operador compreende uma ampla variedade de comandos:

Notas Importantes

5. Análise de Vídeo e Audiodescrição

Nota: Os recursos de Análise de Vídeo e Audiodescrição são executados estritamente pelo provedor Google Gemini. Certifique-se de que o seu provedor ativo nas configurações do complemento esteja definido como Google Gemini.

O Vision Assistant Pro introduz recursos poderosos de processamento de vídeo projetados especificamente para usuários cegos. Ele pode analisar tanto vídeos online quanto gravações de tela locais para fornecer descrições visuais altamente detalhadas e gerar roteiros profissionais de Audiodescrição (SRT).

5.1 Gravação de Tela Local (Control + V)

Se você encontrar um vídeo silencioso, uma animação ou um tutorial em sua tela, pode capturá-lo diretamente:

  1. Pressione NVDA + Shift + V para entrar na Camada de Comandos e, em seguida, pressione Control + V.
  2. O complemento gravará sua tela silenciosamente em segundo plano.
  3. Pressione Control + V novamente para parar a gravação.
  4. A IA analisará o segmento de vídeo gravado e fornecerá uma descrição altamente detalhada da cena, dos personagens e das ações.

5.2 Análise de Vídeo (Shift + V)

Você pode analisar tanto arquivos de vídeo locais quanto vídeos online. Basta selecionar um arquivo de vídeo local no Explorador de Arquivos do Windows ou copiar um link de vídeo online para a área de transferência. Você também pode pressionar Shift + V em qualquer lugar (como dentro de um reprodutor de mídia) para abrir uma caixa de diálogo onde pode procurar por um arquivo de vídeo ou colar uma URL manualmente.

5.3 Geração de Audiodescrição (SRT)

Para uma experiência mais estruturada, o complemento pode gerar roteiros profissionais de Audiodescrição no formato padrão SubRip (SRT).

5.4 Narração de Áudio Sincronizada (Exportação MP3)

Além de criar arquivos SRT em texto, o complemento funciona como uma ferramenta completa de produção de Audiodescrição, sintetizando as descrições em voz e misturando-as com o vídeo. Você agora pode escolher o Gemini Live TTS como motor de voz, o qual utiliza a API do Gemini Live para gerar narrações de voz altamente realistas e ilimitadas. Ao gerar um MP3 para arquivos de vídeo locais, você dispõe de vários modos de mixagem:

6. Transcrição e Dublagem de Mídia (M)

O Transcritor de Áudio foi completamente reconstruído para suportar arquivos de áudio e vídeo (MP3, WAV, MP4, MKV, etc.). Pressione M na Camada de Comandos para selecionar um arquivo de mídia e escolha um dos 3 modos de operação distintos:

  1. Transcrever (Idioma Original): Transcreve com precisão a fala em seu idioma original.
  2. Transcrever e Traduzir (Idioma de Destino): Transcreve a fala e a traduz para o seu idioma de destino configurado.
  3. Dublar e Traduzir (Idioma de Destino) (Apenas Gemini): Um novo recurso poderoso que transcreve a fala, traduz para o seu idioma de destino e sintetiza uma dublagem em áudio falado utilizando o motor TTS do complemento.

7. Leitor Avançado de Documentos e Imagens

O Leitor de Documentos transforma seus documentos em texto limpo e legível - para que você possa ler, traduzir e ouvir qualquer coisa, desde um livro escaneado até uma pilha de fotos. Ele manipula PDFs de várias páginas, imagens complexas, formatos HEIC do iPhone e até arquivos de texto simples (.txt) e HTML (.html, .htm), que são abertos instantaneamente sem OCR ou processamento de IA. Selecione vários arquivos de uma vez e eles serão mesclados em um único documento contínuo na ordem das páginas. Três motores de OCR estão disponíveis - Chrome (Rápido), IA (Avançado) para preservação superior de layout e Nenhum (Extrair Camada de Texto) para PDFs pesquisáveis - selecionados em Configurações → Leitor de Documentos.

Como Funciona

  1. Pressione NVDA + Shift + V e, em seguida, D para abrir o Leitor de Documentos - ou selecione um arquivo no Explorador de Arquivos primeiro e pressione D / F para ignorar completamente a caixa de seleção de arquivos.
  2. Escolha um ou mais PDFs ou imagens. O complemento os analisará e anunciará a contagem total de páginas.
  3. Na caixa de diálogo Opções, escolha o intervalo de páginas (De/Para). Você também pode marcar Traduzir Resultado e escolher o idioma de destino, ou alternar Descrever imagens embutidas durante o OCR.
  4. A extração de texto começa em segundo plano em lotes. Você pode fechar a janela a qualquer momento e continuar mais tarde - nada é perdido.
  5. Assim que as páginas estiverem prontas, leia-as no visualizador: mova-se entre as páginas, vá para qualquer página, faça perguntas à IA, salve o texto ou gere uma narração em áudio.

7.1 Processamento em Lote e Retomada

Você não precisa ler um documento enorme de uma só vez. Escolha um intervalo de páginas (ex.: 1-20) ou mantenha os padrões para processar tudo, e a IA extrairá todas as páginas em segundo plano. Se o NVDA travar ou se você interromper a análise, o complemento se lembrará do seu progresso e oferecerá a opção de Retomar exatamente de onde parou - mesmo após reiniciar. Documentos concluídos também são mantidos em cache, portanto, reabri-los (a partir dos Documentos Recentes ou via D) carrega o texto instantaneamente sem executar o OCR novamente, a menos que os arquivos de origem tenham sido alterados.

7.2 Ação de Arquivo Inteligente

Você nem sempre precisa abrir o documento primeiro. No Explorador de Arquivos do Windows, basta selecionar um arquivo PDF, imagem ou texto/HTML e pressionar D (Leitor de Documentos) - ou selecionar um PDF ou imagem e pressionar F (Ação de Arquivo Inteligente) - dentro da Camada de Comandos. O complemento ignora instantaneamente a caixa de seleção de arquivos e começa a processar o arquivo selecionado. Selecionar vários arquivos de uma vez os processa juntos como um único documento.

7.3 Controles e Atalhos do Visualizador de Documentos

Quando a janela do Leitor de Documentos estiver aberta, você poderá usar os seguintes recursos:

Atalhos de Teclado

Botões e Controles

7.4 Documentos Recentes (D)

Pressionar D na Camada de Comandos lista primeiramente os seus documentos lidos recentemente. Escolha um para continuar a partir da página em que parou - mesmo que o OCR já tenha sido concluído - ou pressione Abrir Arquivo... (Ctrl + O) para procurar por um arquivo normalmente.

8. Rotulagem Semântica por IA e Explorador de Interface

Preso em um aplicativo cheio de "botão sem rótulo" por toda parte? O motor de Rotulagem Semântica por IA resolve isso definitivamente.

8.1 Rotulagem Permanente de Objetos (L)

Foque o seu leitor de tela em um gráfico ou botão sem rótulo e pressione L na Camada de Comandos. A IA analisará o botão visualmente, determinará sua função e aplicará um rótulo permanente.
Ao contrário das ferramentas de rotulagem mais antigas dos leitores de tela, este complemento utiliza um sistema híbrido avançado de "Assinatura de Objeto" (AutomationId/ControlID). Seus rótulos personalizados resistirão ao redimensionamento de janelas, à troca de monitores e às atualizações dos aplicativos!

8.2 Varredura Completa do Aplicativo (Shift + L)

Pressione Shift + L para analisar toda a janela ativa de uma só vez. A IA encontrará todos os elementos sem rótulo e os nomeará inteligentemente de uma só vez. Mais tarde, você poderá gerenciar, renomear ou excluir em lote esses rótulos no Gerenciador de Rótulos integrado.

8.3 Explorador de Interface (E)

Precisa interagir com um elemento sem navegar até ele manualmente? Pressione E para ativar o Explorador de Interface. A IA analisará a tela e gerará uma lista acessível de todos os elementos clicáveis (ignorando ruídos do sistema como as barras de tarefas). Escolha um item da lista e o complemento clicará nele instantaneamente para você.

9. Assistente de Voz em Tempo Real

O Assistente em Tempo Real transforma o Vision Assistant Pro em um copiloto interativo em tempo real.
(Nota: Este recurso é exclusivo do Google Gemini e de provedores Personalizados compatíveis com o Gemini).

10. Prompts Personalizados e Variáveis

Você pode gerenciar os prompts em Configurações > Prompts > Gerenciar Prompts....

Atalhos de Prompts Personalizados

Atribua a qualquer prompt personalizado sua própria tecla de atalho diretamente no Gerenciador de Prompts e execute-o instantaneamente com sua seleção ou contexto atual:

Variáveis Suportadas

11. Casos de Uso Reais (Qual recurso devo utilizar?)

O Vision Assistant Pro está repleto de ferramentas avançadas. Aqui estão alguns cenários comuns para ajudar você a escolher a opção certa:


Nota: É necessária uma conexão ativa com a internet para todos os recursos de IA. Documentos de várias páginas são processados automaticamente.

12. Suporte e Comunidade

Mantenha-se atualizado com as últimas notícias, recursos e lançamentos:

Relatando Erros e Logs

Ao abrir um chamado (issue) no GitHub ou solicitar suporte, inclua detalhes sobre seu provedor de IA ativo, modelo e versão do NVDA. Se estiver enfrentando problemas de conexão ou fechamentos inesperados, habilite o arquivo de log dedicado em Configurações > Avançado, reproduza o problema e anexe seu arquivo vision_assistant.log para nos ajudar a resolver o problema mais rapidamente.

13. Apoiadores do Projeto

Um agradecimento do fundo do coração aos membros da nossa comunidade que apoiam o desenvolvimento contínuo e a manutenção deste projeto por meio de suas generosas contribuições financeiras:

Se você deseja apoiar o projeto financeiramente e ver seu nome aqui, poderá encontrar a opção Doar no menu Ferramentas do NVDA (submenù Vision Assistant) ou durante o processo de configuração após a instalação.


Alterações para 2026.09.01

Alterações para 2026.08.06

Alterações para 2026.07.15

Alterações para 7.0.0

Alterações para 6.5.0

Alterações para 6.1.2

Alterações para 6.1.1

Alterações para 6.1.0

Alterações para 6.0

Alterações para 5.6

Alterações para 5.5.2

Alterações para 5.5 (A Atualização de Automação)

Alterações para 5.0

Alterações para 4.6

Alterações para 4.5

Alterações para 4.0.3

Alterações para 4.0.1

Alterações para 3.6.0

Alterações para 3.5.0

* **Camada de Comandos:** Introduzido um sistema de Camada de Comandos (padrão: NVDA+Shift+V) para agrupar atalhos sob uma única tecla principal. Por exemplo, em vez de pressionar NVDA+Control+Shift+T para traduzir, você agora pressiona NVDA+Shift+V seguido de T.
* **Análise de Vídeos Online:** Adicionado um novo recurso para analisar vídeos do YouTube e Instagram diretamente fornecendo uma URL.

Alterações para 3.1.0

Alterações para 3.0

Alterações para 2.9

Alterações para 2.8

Alterações para 2.7

Alterações para 2.6

Alterações para 2.5

Alterações para 2.1.1

Alterações para 2.1

Alterações para 2.0

Alterações para 1.5

Alterações para 1.0