Documentação do Vision Assistant Pro

O Vision Assistant Pro é um assistente de IA multimodal avançado para o NVDA. Ele utiliza mecanismos de IA de classe mundial para fornecer leitura de tela inteligente, tradução, ditado por voz e análise de documentos.

Este complemento foi lançado para a comunidade em homenagem ao Dia Internacional das Pessoas com Deficiência.

1. Configuração

Vá para Menu do NVDA > Preferências > Configurações > Vision Assistant Pro.

1.1 Configurações de Conexão

1.2 Roteamento Avançado de Modelos

*Disponível para todos os provedores, incluindo Gemini, OpenAI, Groq, Mistral e Personalizado._

⚠️ Aviso: Estas configurações são destinadas apenas para usuários avançados. Se você não tiver certeza do que um modelo específico faz, por favor, deixe esta opção desmarcada. Selecionar um modelo incompatível para uma tarefa (por exemplo, um modelo apenas de texto para Visão) causará erros e fará o complemento parar de funcionar.

Marque "Roteamento Avançado de Modelos (Específico por Tarefa)" para liberar o controle detalhado. Isso permite que você selecione modelos específicos na lista suspensa para diferentes tarefas:

1.3 Configuração Avançada de Endpoint (Provedor Personalizado)

*Disponível apenas quando "Personalizado" estiver selecionado._

⚠️ Aviso: Esta seção permite a configuração manual da API e foi projetada para usuários experientes que executam servidores locais ou proxies. URLs ou nomes de modelos incorretos interromperão a conectividade. Se você não sabe exatamente o que são esses endpoints, mantenha isso desmarcado.

Marque "Configuração Avançada de Endpoint" para inserir manualmente os detalhes do servidor. Diferente dos provedores nativos, aqui você deve digitar as URLs e os Nomes dos Modelos específicos:

1.3.1 Configurar IA Local (Configuração em Uma Ação)

Para tornar a integração de IA local e totalmente offline extremamente simples, um botão dedicado "Configurar IA Local" está disponível dentro das Configurações do Provedor Personalizado.

Se você estiver executando um servidor de modelo de IA local no seu computador:

  1. Selecione Personalizado como seu Provedor.
  2. Pressione o botão Configurar IA Local.
  3. Escolha o seu mecanismo de IA local na caixa de diálogo acessível:
  4. Ollama (padrão para http://127.0.0.1:11434)
  5. LM Studio (padrão para http://127.0.0.1:1234)
  6. Jan.ai (padrão para http://127.0.0.1:1337)
  7. KoboldCPP (padrão para http://127.0.0.1:5001)
  8. O complemento configurará instantaneamente a URL local correta, o tipo de API e buscará automaticamente seus modelos offline ativos para preencher a caixa de seleção Modelo de IA.

Nota sobre Rede e Proxies: Este mecanismo de conexão local possui um sistema avançado de desvio de proxy. Mesmo que você esteja usando uma VPN de sistema ativa ou um proxy em modo TUN, suas requisições de IA locais irão ignorá-lo completamente, garantindo conexões offline estáveis sem erros do tipo "502 Bad Gateway".

1.4 Preferências Gerais

2. Camada de Comando e Atalhos

Para evitar conflitos de teclado, este complemento usa uma Camada de Comando.

  1. Pressione NVDA + Shift + V (Tecla Mestra) para ativar a camada (você ouvirá um bipe).
  2. Solte as teclas e pressione uma das seguintes teclas individuais:
Tecla Função Descrição
Shift + A Operador de IA Operação Autônoma: Diga à IA para realizar uma tarefa na sua tela. Pressionar novamente aborta a operação.
E Explorador de IU Clique Interativo: Identifica e clica em elementos de interface em qualquer aplicativo.
T Tradutor Inteligente Traduz o texto sob o cursor de navegação ou seleção.
Shift + T Tradutor de Área de Transf. Traduz o conteúdo atualmente na área de transferência.
R Refinador de Texto Resume, corrige gramática, explica ou executa Comandos Personalizados.
V Visão de Objeto Descreve o objeto de navegação atual.
O Visão de Tela Cheia Analisa o layout e o conteúdo de toda a tela.
Shift + V Análise de Vídeo Analisa arquivos de vídeo locais ou vídeos online do YouTube, Instagram, TikTok ou Twitter (X).
Control + V Gravação de Vídeo Local Grava um vídeo silencioso da sua tela e analisa as ações e o layout.
D Leitor de Documentos Leitor avançado para PDFs e imagens com seleção de intervalo de páginas.
F Ação de Arquivo Intel. Reconhecimento contextual de arquivos de imagem, PDF ou TIFF selecionados.
A Transcrição de Áudio Transcreve arquivos MP3, WAV ou OGG em texto.
C Solucionador de CAPTCHA Captura e resolve CAPTCHAs (Suporta portais governamentais).
S Ditado Inteligente Converte fala em texto. Pressione para iniciar a gravação, e novamente para parar/digitar.
Control+L Assistente ao Vivo Copiloto em Tempo Real (Apenas Gemini): Inicia ou encerra uma conversa de voz e tela com a IA.
I Relatório de Status Anuncia o progresso atual (por exemplo, "Escaneando...", "Inativo").
L Rotular Objeto Rotulagem Semântica por IA: Rotula permanentemente o elemento/ícone atualmente focado.
Shift + L Gerenciar/Escanear Rótulos Abre o Gerenciador de Rótulos (se existirem) ou escaneia o aplicativo em busca de elementos sem nome.
U Verificar Atualizações Verifica manualmente o GitHub em busca da versão mais recente do complemento.
Espaço Chamar Último Resultado Mostra a última resposta da IA em uma janela de chat para revisão ou acompanhamento.
H Ajuda de Comandos Exibe uma lista com todos os atalhos disponíveis.
Alt + S Configurações Abre a caixa de diálogo de configurações do Vision Assistant Pro.
Alt + Q Relatório de Cota Esgotada Relata o número de chaves de API do Gemini que excederam a cota diária e o tempo de redefinição delas.
Alt + M Auditoria de Roteamento Relata os modelos de IA atualmente selecionados no roteamento avançado.

3. Operador de IA - Controle Autônomo de Computador

O Operador de IA transforma o Vision Assistant Pro de um leitor passivo em um assistente ativo que pode interagir com o computador em seu nome. Você pode pedir para ele descrever a tela, responder a perguntas sobre o que ele vê ou até mesmo assumir o controle — clicando em botões, arrastando itens, digitando texto e navegando pelos aplicativos usando comandos em linguagem natural.

A maior vantagem? Ele funciona perfeitamente em softwares completamente inacessíveis. Se você estiver travado em um aplicativo proprietário, em uma área de trabalho remota ou em um site onde o seu leitor de tela fica totalmente silencioso, o operador não se importa. Como ele "vê" a tela visualmente, ele consegue encontrar, ler e interagir com elementos que possuem zero rótulos de acessibilidade.

Como Funciona

  1. Pressione NVDA + Shift + V, depois pressione Shift + A (or use o atalho direto) para abrir a caixa de diálogo do Operador de IA.
  2. Digite o que deseja fazer em linguagem simples (por exemplo, "Clique no botão Salvar", "O que diz a mensagem de erro?" ou "Renomeie o arquivo para final.pdf").
  3. A IA analisará sua tela, identificará os elementos relevantes e executará a ação ou fornecerá a resposta. Se uma tarefa exigir várias etapas, o operador continuará trabalhando até que ela seja concluída.
  4. Pressione Shift + A novamente a qualquer momento para abortar instantaneamente uma operação em andamento.

Ações Suportadas

O operador compreende uma ampla gama de comandos:

Notas Importantes

4. Análise de Vídeo e Audiodescrição

Nota: Os recursos de Análise de Vídeo e Audiodescrição são movidos estritamente pelo provedor Google Gemini. Certifique-se de que o seu provedor ativo nas configurações do complemento esteja definido como Google Gemini.

O Vision Assistant Pro introduz recursos poderosos de processamento de vídeo projetados especificamente para usuários cegos. Ele pode analisar tanto vídeos online quanto gravações de tela locais para fornecer descrições visuais altamente detalhadas e gerar roteiros profissionais de Audiodescrição (SRT).

4.1 Gravação de Tela Local (Control + V)

Se você se deparar com um vídeo silencioso, uma animação ou um tutorial na sua tela, você pode capturá-lo diretamente:

  1. Pressione NVDA + Shift + V para entrar na Camada de Comando, e depois pressione Control + V.
  2. O complemento gravará silenciosamente a sua tela em segundo plano.
  3. Pressione Control + V novamente para parar a gravação.
  4. A IA irá então analisar o segmento de vídeo gravado e fornecerá uma descrição altamente detalhada da cena, dos personagens e das ações.

4.2 Análise de Vídeo (Shift + V)

Você pode analisar tanto arquivos de vídeo locais quanto vídeos online. Basta selecionar um arquivo de vídeo local no Windows Explorer ou copiar o link de um vídeo online para a sua área de transferência. Você também pode pressionar Shift + V em qualquer lugar (como dentro de um player de mídia) para abrir uma caixa de diálogo onde poderá navegar por um arquivo de vídeo ou colar uma URL manualmente.

4.3 Geração de Audiodescrição (SRT)

Para uma experiência mais estruturada, o complemento pode gerar roteiros profissionais de Audiodescrição no formato padrão SubRip (SRT).

4.4 Narração de Áudio Sincronizada (Exportação para MP3)

Além de apenas criar arquivos SRT baseados em texto, o complemento funciona como uma ferramenta completa de produção de Audiodescrição, sintetizando as descrições em fala e mixando-as com o vídeo. Ao gerar um MP3 para arquivos de vídeo locais, você tem vários modos de mixagem:

5. Leitor Avançado de Documentos e Imagens

O Vision Assistant Pro inclui um Leitor de Documentos altamente otimizado, projetado para PDFs de várias páginas, imagens complexas e até formatos HEIC do iPhone.

5.1 Processamento em Lote e Retomada

Você não precisa ler um documento enorme de uma só vez. Insira um intervalo de páginas (por exemplo, 1-20) e a IA processará todas as páginas em segundo plano. Se o NVDA travar ou você interromper a varredura, o complemento se lembrará do seu progresso e oferecerá a opção de Retomar exatamente de onde você parou!

5.2 Ação de Arquivo Inteligente

Você nem sempre precisa abrir o documento primeiro. No Explorador de Arquivos do Windows, basta destacar um PDF ou imagem e pressionar D (Leitor de Documentos) ou F (Ação de Arquivo Inteligente) dentro da Camada de Comando. O complemento ignorará instantaneamente a caixa de diálogo de arquivo e começará a processar o arquivo destacado.

5.3 Atalhos do Visualizador de Documentos

Quando a janela do Leitor de Documentos estiver aberta, você poderá usar os seguintes atalhos:

6. Rotulagem Semântica por IA e Explorador de IU

Está travado em um aplicativo cheio de "botões sem rótulo" por toda parte? O mecanismo de Rotulagem Semântica por IA resolve isso permanentemente.

6.1 Rotulagem Permanente de Objetos (L)

Foques seu leitor de tela em um gráfico ou botão sem rótulo e pressione L na Camada de Comando. A IA olhará para o botão visualmente, determinará sua função e aplicará um rótulo permanente.
Ao contrário das ferramentas de rotulagem mais antigas dos leitores de tela, este complemento usa um sistema híbrido avançado de "Assinatura de Objeto" (AutomationId/ControlID). Seus rótulos personalizados sobreviverão ao redimensionamento de janelas, troca de monitores e atualizações de aplicativos!

6.2 Varredura Completa do Aplicativo (Shift + L)

Pressione Shift + L para escanear toda a janela ativa de uma vez. A IA encontrará todos os elementos sem rótulo e os nomeará de forma inteligente de uma só vez. Mais tarde, você poderá gerenciar, renomear ou excluir em lote esses rótulos a partir do Gerenciador de Rótulos integrado.

6.3 Explorador de IU (E)

Precisa interagir com um elemento sem navegar até ele manualmente? Pressione E para ativar o Explorador de IU. A IA escaneará a tela e gerará uma lista acessível de cada elemento clicável (ignorando ruídos do sistema como barras de tarefas). Escolha um item da lista e o complemento clicará nele instantaneamente para você.

7. Assistente de Voz ao Vivo

O Assistente ao Vivo transforma o Vision Assistant Pro em um copiloto interativo em tempo real.
(Nota: Este recurso é exclusivo para o Google Gemini e provedores Personalizados compatíveis com o Gemini).

8. Comandos Personalizados e Variáveis

Você pode gerenciar seus comandos em Configurações > Comandos > Gerenciar Comandos....

Variáveis Suportadas

9. Casos de Uso Reais (Qual recurso devo usar?)

O Vision Assistant Pro está repleto de ferramentas avançadas. Aqui estão alguns cenários comuns para ajudar você a escolher a ferramenta certa:


Nota: Uma conexão ativa com a internet é necessária para todos os recursos de IA. Documentos de várias páginas são processados automaticamente.

10. Suporte e Comunidade

Fique atualizado com as últimas notícias, recursos e lançamentos:

11. Apoiadores do Projeto

Um agradecimento sincero aos membros da nossa comunidade que apoiam o desenvolvimento contínuo e a manutenção deste projeto por meio de suas generosas contribuições financeiras:

Se você deseja apoiar o projeto financeiramente e ver seu nome aqui, você pode encontrar a opção Doar no menu Ferramentas do NVDA (submenu Vision Assistant) ou durante o processo de configuração após a instalação.

Alterações para 2026.07.15

Alterações para 7.0.0

Alterações para 6.5.0

Alterações para 6.1.2

Alterações para 6.1.1

Alterações para 6.1.0

Alterações para 6.0

Alterações para 5.6

Alterações para 5.5.2

Alterações para 5.5 (A Atualização de Automação)

Alterações para 5.0

Alterações para 4.6

Alterações para 4.5

Alterações para 4.0.3

Alterações para 4.0.1

Alterações para 3.6.0

Alterações para 3.5.0

Alterações para 3.1.0

Alterações para 3.0

Alterações para 2.9

Alterações para 2.8

Alterações para 2.7

Alterações para 2.6

Alterações para 2.5

Alterações para 2.1.1

Alterações para 2.1

Alterações para 2.0

Alterações para 1.5

Alterações para 1.0