Documentación de Vision Assistant Pro

Vision Assistant Pro es un asistente de IA avanzado y multimodal para NVDA. Utiliza motores de IA de primer nivel para proporcionar lectura de pantalla inteligente, traducción, dictado por voz y análisis de documentos.

Este complemento fue lanzado a la comunidad en honor al Día Internacional de las Personas con Discapacidad.

1. Configuración

Ve a Menú de NVDA > Preferencias > Configuración > Vision Assistant Pro. El diálogo de configuración está organizado en 9 pestañas accesibles: Conexión, Asistente en vivo, Comportamiento de IA, Idiomas de traducción, Lector de documentos, Vídeo, CAPTCHA, Indicaciones y Avanzado.

1.1 Pestaña Conexión

1.2 Pestaña Asistente en vivo

Nota: Esta pestaña aparece solo cuando Google Gemini (o un proveedor personalizado compatible con Gemini) es tu proveedor activo.

1.3 Pestaña Comportamiento de IA

1.4 Pestaña Idiomas de traducción

1.5 Pestaña Lector de documentos

1.6 Pestaña Vídeo

1.7 Pestaña CAPTCHA

1.8 Pestaña Indicaciones

1.9 Pestaña Avanzado y registro global

Navega a la pestaña Avanzado para configurar el registro global del complemento:
- Habilitar archivo de registro dedicado: Activa el registro de todos los eventos operativos, tráfico de API y errores en todos los módulos del complemento en un archivo separado (vision_assistant.log).
- Nivel de registro: Selecciona la verbosidad entre Depuración (todos los detalles), Información (información general), Advertencia (solo advertencias) y Error (solo errores).
- Conservar registros durante: Configura períodos de retención automática para limpiar entradas de registro antiguas (desde 1 hora hasta 90 días).
- Controles de gestión de registros: Usa Abrir archivo de registro, Abrir carpeta de registro o Limpiar archivo de registro para inspeccionar o borrar datos de registro directamente sin reiniciar NVDA.

1.10 Copia de seguridad y restauración de configuración

La pestaña Avanzado también incluye una sección de Copia de seguridad y restauración:
- Copia de seguridad: Guarda tu configuración en un único archivo JSON. Al hacer clic, eliges qué incluir: Todo (configuración, etiquetas personalizadas, progreso de OCR e historial) o Solo configuración.
- Restaurar: Carga una copia de seguridad guardada previamente para restaurar tu configuración y datos en cualquier momento, en cualquier equipo o después de reinstalar NVDA. Se te pedirá confirmación primero, ya que la restauración reemplaza toda la configuración y datos actuales.

2. Capa de comandos y atajos

Para evitar conflictos de teclado, este complemento usa una Capa de comandos.
1. Presiona NVDA + Shift + V (tecla maestra) para activar la capa (escucharás un pitido).
2. Suelta las teclas, luego presiona una de las siguientes teclas individuales:

Tecla Función Descripción
Shift + A Operador de IA Operación autónoma: Indica a la IA que realice una tarea en tu pantalla. Presionarlo de nuevo cancela las operaciones activas al instante.
E Explorador de interfaz Clic interactivo: Identifica y hace clic en elementos de la interfaz en cualquier aplicación.
T Traductor inteligente Traduce el texto bajo el cursor del navegador o la selección.
Shift + T Traductor del portapapeles Traduce el contenido que hay actualmente en el portapapeles.
R Refinador de texto Resume, corrige gramática, explica o ejecuta Indicaciones personalizadas.
V Visión de objeto Describe el objeto del navegador actual.
O Visión de pantalla completa Analiza el diseño y contenido completo de la pantalla.
Shift + V Análisis de vídeo Analiza archivos de vídeo locales o vídeos en línea de YouTube, Instagram, TikTok o Twitter (X).
Control + V Grabación de vídeo local Graba un vídeo silencioso de tu pantalla y analiza las acciones y el diseño.
D Lector de documentos Lector avanzado de PDF, imágenes y archivos de texto/HTML con selección de rango de páginas.
F Acción inteligente de archivo Reconocimiento contextual desde imagen, PDF o archivos TIFF seleccionados.
M Transcripción y doblaje de medios Transcribe o dobla archivos de audio/vídeo (MP3, WAV, MP4, etc.) a tu idioma de destino.
C Solucionador de CAPTCHA Captura y resuelve CAPTCHAs.
Shift + C Chat directo Abre una interfaz de chat de texto directo con la IA.
S Dictado inteligente Convierte voz a texto. Presiona para iniciar la grabación, vuelve a presionar para detener/escribir.
Control+T Traducción de voz Transcribe, traduce y escribe el resultado según la configuración de idioma.
Control+L Asistente en vivo Copiloto en tiempo real (solo Gemini): Inicia o finaliza una conversación de voz y pantalla en vivo con el asistente de IA.
I Informe de estado Anuncia el progreso actual (por ejemplo, "Escaneando...", "Inactivo").
L Etiquetar objeto Etiquetado semántico con IA: Etiqueta permanentemente el elemento/icono enfocado actualmente.
Shift + L Administrar/Escanear etiquetas Abre el administrador de etiquetas (si existen etiquetas) o escanea la aplicación en busca de elementos sin nombre.
U Buscar actualizaciones Busca manualmente en GitHub la última versión del complemento.
Espacio Recuperar último resultado Muestra la última respuesta de IA en un diálogo de chat para revisión o seguimiento.
H Ayuda de comandos Muestra una lista de todos los atajos disponibles.
Control + H Historial Abre el diálogo de historial con tus chats y documentos anteriores, con filtros por tipo y opciones de eliminar/borrar.
Alt + S Configuración Abre el diálogo de configuración de Vision Assistant Pro.
Alt + Q Informe de claves con cuota agotada Informa sobre el número de claves API de Gemini que han superado su cuota diaria y su hora de restablecimiento.
Alt + M Auditoría de enrutamiento Informa sobre los modelos de IA actualmente seleccionados en el enrutamiento avanzado.
Arriba / Abajo Navegar configuración rápida Navega entre categorías de configuración rápida (Proveedor, Modelo, etc.) en la capa.
Izquierda / Derecha Cambiar configuración rápida Cambia el valor de la configuración rápida actualmente seleccionada.

3. Chat e Historial

Las ventanas de chat y el diálogo de historial funcionan en todas las funciones, para que puedas revisar conversaciones y continuar exactamente donde lo dejaste.

3.1 Atajos de la ventana de chat

Cuando hay una ventana de chat abierta (Chat directo, chat de documento, refinar y similares), puedes revisar la conversación con:
- Alt + Abajo: Leer el siguiente mensaje.
- Alt + Arriba: Leer el mensaje anterior.
- Alt + C: Copiar el mensaje actual.

3.2 Historial (Control + H)

Presiona Control + H en la Capa de comandos para abrir el diálogo de Historial con tus chats y documentos anteriores, filtrables por tipo (Todo / Chats / Documentos). Abre un chat para continuar la conversación — incluyendo sus archivos adjuntos, que se vuelven a adjuntar automáticamente — o abre un documento y sigue leyendo. Presiona Eliminar en cualquier elemento para quitarlo, o Borrar todo para vaciar la lista.

4. Operador de IA — Control autónomo del equipo

El Operador de IA convierte Vision Assistant Pro de un lector pasivo en un asistente activo capaz de interactuar con tu equipo en tu nombre. Puedes pedirle que describa la pantalla, responda preguntas sobre lo que ve, o tome el control: hacer clic en botones, arrastrar elementos, escribir texto y navegar por aplicaciones mediante comandos en lenguaje natural.

La mayor ventaja es que funciona perfectamente en software completamente inaccesible. Si estás atascado en una aplicación personalizada, un escritorio remoto o un sitio web donde tu lector de pantalla permanece en silencio, al Operador no le importa. Como "ve" la pantalla visualmente, puede encontrar, leer e interactuar con elementos que no tienen ninguna etiqueta de accesibilidad.

Cómo funciona

  1. Presiona NVDA + Shift + V, luego presiona Shift + A para abrir el diálogo del Operador de IA.
  2. Escribe lo que quieres hacer en lenguaje natural (por ejemplo, "Haz clic en el botón Guardar", "¿Qué dice el mensaje de error?" o "Cambia el nombre del archivo a final.pdf").
  3. La IA analizará tu pantalla, identificará los elementos relevantes y realizará la acción o proporcionará la respuesta. Si una tarea requiere varios pasos, el Operador continuará trabajando hasta completarla.
  4. Presiona Shift + A de nuevo en cualquier momento para cancelar una operación en curso al instante.

Acciones compatibles

Notas importantes

5. Análisis de vídeo y audiodescripción

Nota: Las funciones de análisis de vídeo y audiodescripción funcionan exclusivamente con el proveedor Google Gemini. Asegúrate de que tu proveedor activo sea Google Gemini.

5.1 Grabación de pantalla local (Control + V)

  1. Presiona NVDA + Shift + V para entrar en la Capa de comandos, luego presiona Control + V.
  2. El complemento grabará silenciosamente tu pantalla en segundo plano.
  3. Presiona Control + V de nuevo para detener la grabación.
  4. La IA analizará el segmento de vídeo grabado y proporcionará una descripción muy detallada.

5.2 Análisis de vídeo (Shift + V)

Selecciona un archivo de vídeo local en el Explorador de Windows, o copia un enlace en línea al portapapeles. También puedes presionar Shift + V en cualquier lugar para abrir un diálogo donde examinar un archivo o pegar una URL.
- Plataformas en línea compatibles: YouTube, Instagram, TikTok y Twitter (X).

5.3 Generación de audiodescripción (SRT)

5.4 Narración de audio sincronizada (exportación a MP3)

Puedes elegir TTS de Gemini en vivo como motor de voz para narración de alta calidad y sin límites de caracteres. Modos de mezcla disponibles para vídeos locales:
- AD estándar (mezclar voz): La narración se superpone sobre el audio del vídeo. Puedes aplicar Atenuación de audio para bajar el volumen de fondo.
- AD extendida (pausar audio): El motor pausa el audio original durante las descripciones.
- Vídeos de YouTube: El MP3 contendrá solo la pista de voz de la IA sincronizada, sin el audio de fondo.

6. Transcripción y doblaje de medios (M)

El transcriptor de audio ha sido completamente reconstruido para admitir archivos de audio y vídeo (MP3, WAV, MP4, MKV, etc.). Presiona M en la Capa de comandos para seleccionar un archivo multimedia y elegir uno de los 3 modos de operación:
1. Transcribir (idioma original): Transcribe con precisión el habla en su idioma original.
2. Transcribir y traducir (idioma de destino): Transcribe el habla y la traduce al idioma de destino configurado.
3. Doblar y traducir (idioma de destino) (solo Gemini): Transcribe el habla, la traduce al idioma de destino y sintetiza un doblaje de audio hablado usando el motor TTS del complemento.

7. Lector avanzado de documentos e imágenes

El Lector de documentos convierte tus documentos en texto legible y limpio. Maneja PDFs de varias páginas, imágenes complejas, formatos HEIC de iPhone y archivos de texto sin formato (.txt) y HTML (.html, .htm), que se abren instantáneamente sin OCR ni IA. Selecciona varios archivos a la vez y se fusionan en un único documento continuo. Hay tres motores OCR disponibles — Chrome (Rápido), IA (Avanzado) y Ninguno (Extraer capa de texto) para PDFs con capacidad de búsqueda — seleccionables en Configuración → Lector de documentos.

Cómo funciona

  1. Presiona NVDA + Shift + V, luego D para abrir el Lector de documentos — o resalta primero un archivo en el Explorador de archivos y presiona D / F para omitir el diálogo de archivo.
  2. Elige uno o más PDFs o imágenes. El complemento los escanea y anuncia el número total de páginas.
  3. En el diálogo Opciones, elige el rango de páginas. También puedes marcar Traducir salida y elegir el idioma de destino, o activar Describir imágenes en línea durante el OCR.
  4. La extracción de texto comienza en segundo plano por lotes. Puedes cerrar la ventana en cualquier momento y continuar después.
  5. Una vez que las páginas estén listas, léelas en el visor: muévete entre páginas, salta a cualquier página, hazle preguntas a la IA, guarda el texto o genera una narración de audio.

7.1 Procesamiento en lotes y reanudación

Elige un rango de páginas (por ejemplo, 1-20) y la IA extrae todas las páginas en segundo plano. Si NVDA se bloquea o interrumpes el escaneo, el complemento recuerda tu progreso y ofrece Reanudar exactamente donde lo dejaste. Los documentos completados también se guardan en caché, por lo que volver a abrirlos carga el texto instantáneamente sin volver a ejecutar el OCR.

7.2 Acción inteligente de archivo

En el Explorador de archivos de Windows, resalta un PDF, imagen o archivo de texto/HTML y presiona D (Lector de documentos) o F (Acción inteligente de archivo) dentro de la Capa de comandos. El complemento omite instantáneamente el diálogo de archivo y comienza a procesar el archivo resaltado. Seleccionar varios archivos a la vez los procesa juntos como un único documento.

7.3 Controles y atajos del visor de documentos

Atajos de teclado

Botones y controles

7.4 Documentos recientes (D)

Presionar D en la Capa de comandos lista primero tus documentos leídos recientemente. Elige uno para continuar desde la página donde lo dejaste, o presiona Abrir archivo... (Ctrl + O) para explorar un archivo como siempre.

8. Etiquetado semántico con IA y Explorador de interfaz

8.1 Etiquetado permanente de objetos (L)

Enfoca tu lector de pantalla en un gráfico o botón sin etiquetar y presiona L en la Capa de comandos. La IA determinará su función y aplicará una etiqueta permanente usando un sistema avanzado híbrido de "firma de objeto" (AutomationId/ControlID) que sobrevive al redimensionamiento de ventanas, cambio de monitor y actualizaciones de la aplicación.

8.2 Escaneo completo de la aplicación (Shift + L)

Presiona Shift + L para escanear toda la ventana activa de una vez. La IA encontrará todos los elementos sin etiquetar y los nombrará inteligentemente. Luego puedes administrar, renombrar o eliminar en lote estas etiquetas desde el Administrador de etiquetas incorporado.

8.3 Explorador de interfaz (E)

Presiona E para activar el Explorador de interfaz. La IA escaneará la pantalla y generará una lista accesible de cada elemento en el que se puede hacer clic (ignorando el ruido del sistema como las barras de tareas). Elige un elemento de la lista y el complemento hará clic en él instantáneamente. Ahora también puedes añadir etiquetas directamente a los elementos encontrados mediante el botón Añadir etiqueta.

9. Asistente en vivo

El Asistente en vivo convierte Vision Assistant Pro en un copiloto interactivo en tiempo real.
(Nota: Esta función es exclusiva de Google Gemini y los proveedores personalizados compatibles con Gemini).

10. Indicaciones personalizadas y variables

Puedes administrar las indicaciones en Configuración > Indicaciones > Administrar indicaciones....

Atajos para indicaciones personalizadas

Asigna a cualquier indicación personalizada su propia tecla de atajo directamente en el Administrador de indicaciones:
- Tecla simple (por ejemplo, 1, p o F3): Funciona dentro de la Capa de comandos, y también globalmente como NVDA + Shift + tecla.
- Combinación de teclas (por ejemplo, Control + Shift + 1, Alt + P o Insert + 1): Funciona globalmente por sí sola.

Variables compatibles

11. Casos de uso reales (¿Qué función debo usar?)


Nota: Se requiere una conexión a Internet activa para todas las funciones de IA. Los documentos de varias páginas se procesan automáticamente.

12. Soporte y comunidad

Informar errores y registros

Al abrir un issue en GitHub o pedir soporte, incluye detalles sobre tu proveedor de IA activo, modelo y versión de NVDA. Si experimentas problemas de conexión o fallos inesperados, habilita el archivo de registro dedicado en Configuración > Avanzado, reproduce el problema y adjunta tu archivo vision_assistant.log.

13. Colaboradores del proyecto

Un agradecimiento de corazón a los miembros de nuestra comunidad que apoyan el desarrollo continuo y el mantenimiento de este proyecto con sus generosas contribuciones económicas:

Si deseas apoyar el proyecto económicamente y ver tu nombre aquí, puedes encontrar la opción Donar en el menú Herramientas de NVDA (submenú Vision Assistant) o durante el proceso de configuración después de la instalación.


Cambios para 2026.09.01

Cambios para 2026.08.06

Cambios para 2026.07.15

Cambios para 7.0.0

Cambios para 6.5.0

Cambios para 6.1.2

Cambios para 6.1.1

Cambios para 6.1.0

Cambios para 6.0

Cambios para 5.6

Cambios para 5.5.2

Cambios para 5.5 (La actualización de automatización)

Cambios para 5.0

Cambios para 4.6

Cambios para 4.5

Cambios para 4.0.3

Cambios para 4.0.1

Cambios para 3.6.0

Cambios para 3.5.0

* Sistema de capa de comandos (NVDA+Shift+V).
* Análisis de vídeos de YouTube e Instagram por URL.

Cambios para 3.1.0

Cambios para 3.0

Cambios para 2.9

Cambios para 2.8

Cambios para 2.7

Cambios para 2.6

Cambios para 2.5

Cambios para 2.1.1

Cambios para 2.1

Cambios para 2.0

Cambios para 1.5

Cambios para 1.0