Documentação do Vision Assistant Pro

O Vision Assistant Pro é um assistente de IA multimodal avançado para o NVDA. Aproveita motores de IA de classe mundial para fornecer leitura de ecrã inteligente, tradução, ditação por voz e análise de documentos.

Este extra foi lançado para a comunidade em homenagem ao Dia Internacional das Pessoas com Deficiência.

1. Configuração

Aceda a Menu do NVDA > Preferências > Definições > Vision Assistant Pro.

1.1 Definições de Conexão

1.2 Encaminhamento Avançado de Modelos

*Disponível para todos os fornecedores, incluindo Gemini, OpenAI, Groq, Mistral e Personalizado._

⚠️ Aviso: Estas definições destinam-se apenas a utilizadores avançados. Se não tiver a certeza do que um modelo específico faz, por favor, deixe esta opção desmarcada. A seleção de um modelo incompatível para uma tarefa (por exemplo, um modelo de apenas texto para Visão) causará erros e fará com que o extra deixe de funcionar.

Marque "Encaminhamento Avançado de Modelos (Específico por tarefa)" para desbloquear um controlo detalhado. Isto permite-lhe selecionar modelos específicos da lista pendente para diferentes tarefas:

1.3 Configuração Avançada de Endpoint (Fornecedor Personalizado)

*Disponível apenas quando "Personalizado" está selecionado._

⚠️ Aviso: Esta secção permite a configuração manual da API e foi concebida para utilizadores experientes que executam servidores locais ou proxies. URLs ou nomes de modelos incorretos irão quebrar a conectividade. Se não souber exatamente o que são estes endpoints, mantenha esta opção desmarcada.

Marque "Configuração Avançada de Endpoint" para introduzir manualmente os detalhes do servidor. Ao contrário dos fornecedores nativos, aqui deve escrever os URLs e nomes de modelos específicos:

1.3.1 Configurar IA Local (Configuração Numa Única Ação)

Para tornar a integração de IA local e completamente offline extremamente simples, está disponível um botão dedicado "Configurar IA Local" dentro das Definições do Fornecedor Personalizado.

Se estiver a executar um servidor de modelos de IA local no seu computador:

  1. Selecione Personalizado como o seu Fornecedor.
  2. Prima o botão Configurar IA Local.
  3. Escolha o seu motor de IA local a partir do diálogo acessível:
  4. Ollama (predefinido para http://127.0.0.1:11434)
  5. LM Studio (predefinido para http://127.0.0.1:1234)
  6. Jan.ai (predefinido para http://127.0.0.1:1337)
  7. KoboldCPP (predefinido para http://127.0.0.1:5001)
  8. O extra configurará instantaneamente o URL local correto, o tipo de API e procurará automaticamente os seus modelos offline ativos para preencher a caixa de seleção do Modelo de IA.

Nota sobre Rede e Proxies: Este motor de conexão local possui um mecanismo avançado de desvio de proxy. Mesmo que tenha uma VPN de sistema ativa ou um proxy em modo TUN, os seus pedidos de IA local irão ignorá-lo completamente, garantindo ligações offline estáveis sem erros 502 Bad Gateway.

1.4 Preferências Gerais

2. Camada de Comando e Atalhos

Para evitar conflitos de teclado, este extra utiliza uma Camada de Comando.

  1. Prima NVDA + Shift + V (Tecla Mestre) para ativar a camada (ouvirá um sinal sonoro).
  2. Solte as teclas e, em seguida, prima uma das seguintes teclas individuais:
Tecla Função Descrição
Shift + A Operador de IA Operação Autónoma: Diga à IA para realizar uma tarefa no seu ecrã. Premir novamente aborta instantaneamente as operações ativas.
E Explorador de IU Clique Interativo: Identifica e clica em elementos da interface do utilizador em qualquer aplicação.
T Tradutor Inteligente Traduz o texto sob o cursor do navegador ou a seleção.
Shift + T Tradutor da Área de Transferência Traduz o conteúdo que se encontra atualmente na área de transferência.
R Refinador de Texto Resume, corrige a gramática, explica ou executa Prompts Personalizados.
V Visão de Objetos Descreve o objeto atual do navegador.
O Visão de Ecrã Inteiro Analisa todo o esquema visual e conteúdo do ecrã.
Shift + V Análise de Vídeo Analisa ficheiros de vídeo locais ou vídeos online do YouTube, Instagram, TikTok ou Twitter (X).
Control + V Gravação de Vídeo Local Grava um vídeo silencioso do seu ecrã e analisa as ações e o esquema visual.
D Leitor de Documentos Leitor avançado para PDF e imagens com seleção de intervalo de páginas.
F Ação Inteligente de Ficheiros Reconhecimento contextual de ficheiros de imagem, PDF ou TIFF selecionados.
A Transcrição de Áudio Transcreve ficheiros MP3, WAV ou OGG para texto.
C Resolução de CAPTCHAs Captura e resolve CAPTCHAs (Suporta portais governamentais).
S Ditação Inteligente Converte voz em texto. Prima para iniciar a gravação, novamente para parar/escrever.
Control+L Assistente em Direto Copiloto em Tempo Real (apenas Gemini): Inicia ou termina uma conversa em direto por voz e ecrã com o assistente de IA.
I Relatório de Estado Anuncia o progresso atual (por exemplo, "A analisar...", "Inativo").
L Etiquetar Objeto Etiquetagem Semântica por IA: Etiqueta permanentemente o elemento/ícone atualmente focado.
Shift + L Gerir/Procurar Etiquetas Abre o Gestor de Etiquetas (se existirem etiquetas) ou examina a aplicação à procura de elementos sem nome.
U Verificar Atualizações Verifica manualmente o GitHub para obter a versão mais recente do extra.
Espaço Relembrar Último Resultado Mostra a última resposta da IA num diálogo de chat para revisão ou acompanhamento.
H Ajuda de Comandos Apresenta uma lista de todos os atalhos disponíveis.
Alt + S Definições Abre o diálogo de definições do Vision Assistant Pro.
Alt + Q Relatório de Chaves com Quota Excedida Comunica o número de chaves de API do Gemini que excederam a sua quota diária e o respetivo tempo de reposição.
Alt + M Auditoria de Encaminhamento Comunica os modelos de IA atualmente selecionados no encaminhamento avançado.

3. Operador de IA - Controlo Autónomo do Computador

O Operador de IA transforma o Vision Assistant Pro de um leitor passivo num assistente ativo que pode interagir com o seu computador em seu nome. Pode pedir-lhe para descrever o ecrã, responder a perguntas sobre o que vê ou até mesmo assumir o controlo — clicando em botões, arrastando itens, escrevendo texto e navegando pelas aplicações através de comandos em linguagem natural.

A maior vantagem? Funciona perfeitamente em software completamente inacessível. Se estiver bloqueado numa aplicação personalizada, num ambiente de trabalho remoto ou num sítio Web onde o seu leitor de ecrã fica totalmente silencioso, o operador não se importa. Como "vê" o ecrã visualmente, consegue encontrar, ler e interagir com elementos que têm zero etiquetas de acessibilidade.

Como Funciona

  1. Prima NVDA + Shift + V e, em seguida, prima Shift + A (ou utilize o atalho direto) para abrir o diálogo do Operador de IA.
  2. Escreva o que deseja fazer em linguagem simples (por exemplo, "Clicar no botão Guardar", "O que diz a mensagem de erro?" ou "Mudar o nome do ficheiro para final.pdf").
  3. A IA analisará o seu ecrã, identificará os elementos relevantes e executará a ação ou fornecerá a resposta. Se uma tarefa exigir múltiplos passos, o operador continuará a trabalhar até que esteja concluída.
  4. Prima Shift + A novamente a qualquer momento para abortar instantaneamente uma operação em curso.

Ações Suportadas

O operador compreende uma vasta gama de comandos:

Notas Importantes

4. Análise de Vídeo e Audiodescrição

Nota: As funcionalidades de Análise de Vídeo e Audiodescrição são alimentadas estritamente pelo fornecedor Google Gemini. Certifique-se de que o seu fornecedor ativo nas definições do extra está configurado como Google Gemini.

O Vision Assistant Pro introduz capacidades poderosas de processamento de vídeo concebidas especificamente para utilizadores cegos. Pode analisar tanto vídeos online como gravações de ecrã locais para fornecer descrições visuais altamente detalhadas e gerar guiões profissionais de Audiodescrição (SRT).

4.1 Gravação de Ecrã Local (Control + V)

Se encontrar um vídeo silencioso, uma animação ou um tutorial no seu ecrã, pode capturá-lo diretamente:

  1. Prima NVDA + Shift + V para entrar na Camada de Comando e, em seguida, prima Control + V.
  2. O extra gravará o seu ecrã silenciosamente em segundo plano.
  3. Prima Control + V novamente para parar a gravação.
  4. A IA analisará então o segmento de vídeo gravado e fornecerá uma descrição altamente detalhada da cena, das personagens e das ações.

4.2 Análise de Vídeo (Shift + V)

Pode analisar tanto ficheiros de vídeo locais como vídeos online. Basta selecionar um ficheiro de vídeo local no Explorador do Windows ou copiar o link de um vídeo online para a sua área de transferência. Também pode premir Shift + V em qualquer lugar (como dentro de um reprodutor de multimédia) para abrir um diálogo onde pode procurar um ficheiro de vídeo ou colar um URL manualmente.

4.3 Geração de Audiodescrição (SRT)

Para uma experiência mais estruturada, o extra pode gerar guiões profissionais de Audiodescrição no formato padrão SubRip (SRT).

4.4 Narração de Áudio Sincronizada (Exportação para MP3)

Além de apenas criar ficheiros SRT baseados em texto, o extra funciona como uma ferramenta completa de produção de Audiodescrição, sintetizando as descrições em voz e misturando-as com o vídeo. Ao gerar um MP3 para ficheiros de vídeo locais, dispõe de múltiplos modos de mistura:

5. Leitor Avançado de Documentos e Imagens

O Vision Assistant Pro inclui um Leitor de Documentos altamente otimizado, concebido para PDFs de várias páginas, imagens complexas e até formatos HEIC do iPhone.

5.1 Processamento em Lote e Retoma

Não precisa de ler um documento massivo de uma só vez. Introduza um intervalo de páginas (por exemplo, 1-20) e a IA processará todas as páginas em segundo plano. Se o NVDA falhar ou se interromper a análise, o extra lembrar-se-á do seu progresso e oferecer-se-á para Retomar exatamente de onde parou!

5.2 Ação Inteligente de Ficheiros

Nem sempre precisa de abrir o documento primeiro. No Explorador de Ficheiros do Windows, basta selecionar um PDF ou imagem e premir D (Leitor de Documentos) ou F (Ação Inteligente de Ficheiros) dentro da Camada de Comando. O extra contornará instantaneamente o diálogo de ficheiro e começará a processar o ficheiro selecionado.

5.3 Atalhos do Visualizador de Documentos

Quando a janela do Leitor de Documentos estiver aberta, pode utilizar os seguintes atalhos:

6. Etiquetagem Semântica por IA e Explorador de IU

Bloqueado numa aplicação com "botão sem etiqueta" por todo o lado? O motor de Etiquetagem Semântica por IA resolve isto permanentemente.

6.1 Etiquetagem Permanente de Objetos (L)

Foque o seu leitor de ecrã num gráfico ou botão sem etiqueta e prima L na Camada de Comando. A IA olhará para o botão visualmente, determinará a sua função e aplicará uma etiqueta permanente.
Ao contrário das antigas ferramentas de etiquetagem dos leitores de ecrã, este extra utiliza um sistema híbrido avançado de "Assinatura do Objeto" (AutomationId/ControlID). As suas etiquetas personalizadas sobreviverão ao redimensionamento de janelas, à troca de monitores e às atualizações da aplicação!

6.2 Análise Completa da Aplicação (Shift + L)

Prima Shift + L para analisar toda a janela ativa de uma só vez. A IA encontrará todos os elementos sem etiqueta e nomeá-los-á inteligentemente de uma só assentada. Mais tarde, poderá gerir, renomear ou eliminar em lote estas etiquetas a partir do Gestor de Etiquetas integrado.

6.3 Explorador de IU (E)

Precisa de interagir com um elemento sem navegar até ele manualmente? Prima E para ativar o Explorador de IU. A IA analisará o ecrã e gerará uma lista acessível de todos os elementos clicáveis (ignorando o ruído do sistema, como as barras de tarefas). Escolha um item da lista e o extra clicará instantaneamente nele por si.

7. Assistente de Voz em Direto

O Assistente em Direto transforma o Vision Assistant Pro num copiloto interativo em tempo real.
(Nota: Esta funcionalidade é exclusiva do Google Gemini e de fornecedores Personalizados compatíveis com o Gemini).

8. Prompts Personalizados e Variáveis

Pode gerir os prompts em Definições > Prompts > Gerir Prompts....

Variáveis Suportadas

9. Casos de Uso do Mundo Real (Que funcionalidade devo utilizar?)

O Vision Assistant Pro está repleto de ferramentas avançadas. Eis alguns cenários comuns para o ajudar a escolher a ferramenta certa:


Nota: É necessária uma ligação ativa à Internet para todas as funcionalidades de IA. Os documentos de várias páginas são processados automaticamente.

10. Suporte e Comunidade

Mantenha-se atualizado com as últimas notícias, funcionalidades e lançamentos:

11. Apoiantes do Projeto

Um agradecimento sincero aos membros da nossa comunidade que apoiam o desenvolvimento contínuo e a manutenção deste projeto através das suas generosas contribuições financeiras:

Se desejar apoiar financeiramente o projeto e ver o seu nome aqui, pode encontrar a opção Doar no menu Ferramentas do NVDA (submenu Vision Assistant) ou durante o processo de configuração após a instalação.

Alterações para 2026.07.15

Alterações para 7.0.0

Alterações para 6.5.0

Alterações para 6.1.2

Alterações para 6.1.1

Alterações para 6.1.0

Alterações para 6.0

Alterações para 5.6

Alterações para 5.5.2

Alterações para 5.5 (A Atualização de Automação)

Alterações para 5.0

Alterações para 4.6

Alterações para 4.5

Alterações para 4.0.3

Alterações para 4.0.1

Alterações para 3.6.0

Changes for 3.5.0

Alterações para 3.1.0

Alterações para 3.0

Alterações para 2.9

Alterações para 2.8

Alterações para 2.7

Alterações para 2.6

Alterações para 2.5

Alterações para 2.1.1

Alterações para 2.1

Alterações para 2.0

Alterações para 1.5

Alterações para 1.0