Documentación de Vision Assistant Pro

Vision Assistant Pro es un asistente de IA avanzado y multimodal para NVDA. Utiliza motores de IA de primer nivel para proporcionar lectura de pantalla inteligente, traducción, dictado por voz y análisis de documentos.

Este complemento fue lanzado a la comunidad en honor al Día Internacional de las Personas con Discapacidad.

1. Configuración

Ve a Menú de NVDA > Preferencias > Configuración > Vision Assistant Pro.

1.1 Configuración de conexión

1.2 Enrutamiento avanzado de modelos

Disponible para todos los proveedores, incluidos Gemini, OpenAI, Groq, Mistral y Personalizado.

⚠️ Advertencia: Estos ajustes están destinados solo a usuarios avanzados. Si no sabes qué hace un modelo específico, déjalo desmarcado. Seleccionar un modelo incompatible para una tarea (por ejemplo, un modelo solo de texto para Visión) causará errores y detendrá el funcionamiento del complemento.

Marca "Enrutamiento avanzado de modelos (específico por tarea)" para desbloquear el control detallado. Esto te permite seleccionar modelos específicos de la lista desplegable para diferentes tareas:
- Modelo de OCR/Visión: Elige un modelo especializado para analizar imágenes.
- Texto a voz (STT): Elige un modelo específico para dictado.
- Voz a texto (TTS): Elige un modelo para generar audio.
- Modelo del Operador de IA: Selecciona un modelo específico para tareas de operación autónoma del equipo.
- Modelo de vídeo: Selecciona un modelo específico para análisis de vídeo y generación de audiodescripción.
Nota: Las funciones no compatibles (por ejemplo, TTS para Groq) se ocultarán automáticamente.

1.3 Configuración avanzada de punto de acceso (Proveedor personalizado)

Disponible solo cuando se selecciona "Personalizado".

⚠️ Advertencia: Esta sección permite la configuración manual de la API y está diseñada para usuarios avanzados que ejecutan servidores locales o proxies. URLs o nombres de modelos incorrectos interrumpirán la conectividad. Si no sabes exactamente qué son estos puntos de acceso, mantén esto desmarcado.

Marca "Configuración avanzada de punto de acceso" para ingresar manualmente los detalles del servidor. A diferencia de los proveedores nativos, aquí debes escribir las URLs específicas y los nombres de los modelos:
- URL de lista de modelos: El punto de acceso para obtener los modelos disponibles.
- URL de punto de acceso OCR/STT/TTS: URLs completas para servicios específicos (por ejemplo, http://localhost:11434/v1/audio/speech).
- Modelos personalizados: Escribe manualmente el nombre del modelo (por ejemplo, llama3:8b) para cada tarea.

1.3.1 Configurar IA local (Configuración en un paso)

Para hacer la integración con IA local completamente sin conexión extremadamente sencilla, hay un botón dedicado "Configurar IA local" disponible dentro de la Configuración del proveedor personalizado.

Si tienes un servidor de modelos de IA local en ejecución en tu equipo:
1. Selecciona Personalizado como tu proveedor.
2. Presiona el botón Configurar IA local.
3. Elige tu motor de IA local desde el diálogo accesible:
- Ollama (por defecto en http://127.0.0.1:11434)
- LM Studio (por defecto en http://127.0.0.1:1234)
- Jan.ai (por defecto en http://127.0.0.1:1337)
- KoboldCPP (por defecto en http://127.0.0.1:5001)
4. El complemento configurará instantáneamente la URL local correcta, el tipo de API, y obtendrá automáticamente tus modelos sin conexión activos para llenar el cuadro de selección del Modelo de IA.

Nota sobre red y proxies: Este motor de conexión local cuenta con un mecanismo avanzado de omisión de proxy. Incluso si tienes una VPN activa o un proxy en modo TUN, tus solicitudes de IA local lo omitirán completamente, garantizando conexiones sin conexión estables sin errores 502 Bad Gateway.

1.4 Preferencias generales

2. Capa de comandos y atajos

Para evitar conflictos de teclado, este complemento usa una Capa de comandos.
1. Presiona NVDA + Shift + V (tecla maestra) para activar la capa (escucharás un pitido).
2. Suelta las teclas, luego presiona una de las siguientes teclas individuales:

Tecla Función Descripción
Shift + A Operador de IA Operación autónoma: Indica a la IA que realice una tarea en tu pantalla. Presionarlo de nuevo cancela las operaciones activas.
E Explorador de interfaz Clic interactivo: Identifica y hace clic en elementos de la interfaz en cualquier aplicación.
T Traductor inteligente Traduce el texto bajo el cursor del navegador o la selección.
Shift + T Traductor del portapapeles Traduce el contenido que hay actualmente en el portapapeles.
R Refinador de texto Resume, corrige gramática, explica o ejecuta Indicaciones personalizadas.
V Visión de objeto Describe el objeto del navegador actual.
O Visión de pantalla completa Analiza el diseño y contenido completo de la pantalla.
Shift + V Análisis de vídeo Analiza archivos de vídeo locales o vídeos en línea de YouTube, Instagram, TikTok o Twitter (X).
Control + V Grabación de vídeo local Graba un vídeo silencioso de tu pantalla y analiza las acciones y el diseño.
D Lector de documentos Lector avanzado de PDF e imágenes con selección de rango de páginas.
F Acción inteligente de archivo Reconocimiento contextual desde imagen, PDF o archivos TIFF seleccionados.
A Transcripción de audio Transcribe archivos MP3, WAV u OGG a texto.
C Solucionador de CAPTCHA Captura y resuelve CAPTCHAs (compatible con portales gubernamentales).
S Dictado inteligente Convierte voz a texto. Presiona para iniciar la grabación, vuelve a presionar para detener/escribir.
Control+L Asistente en vivo Copiloto en tiempo real (solo Gemini): Inicia o finaliza una conversación de voz y pantalla en vivo con el asistente de IA.
I Informe de estado Anuncia el progreso actual (por ejemplo, "Escaneando...", "Inactivo").
L Etiquetar objeto Etiquetado semántico con IA: Etiqueta permanentemente el elemento/icono enfocado actualmente.
Shift + L Administrar/Escanear etiquetas Abre el administrador de etiquetas (si existen etiquetas) o escanea la aplicación en busca de elementos sin nombre.
U Buscar actualizaciones Busca manualmente en GitHub la última versión del complemento.
Espacio Recuperar último resultado Muestra la última respuesta de IA en un diálogo de chat para revisión o seguimiento.
H Ayuda de comandos Muestra una lista de todos los atajos disponibles.
Alt + S Configuración Abre directamente el diálogo de configuración de Vision Assistant Pro.
Alt + Q Informe de claves con cuota agotada Informa sobre el número de claves API de Gemini que han superado su cuota diaria y cuándo se restablecerán.
Alt + M Auditoría de enrutamiento Informa sobre los modelos de IA actualmente seleccionados en el enrutamiento avanzado.

3. Operador de IA — Control autónomo del equipo

El Operador de IA convierte Vision Assistant Pro de un lector pasivo en un asistente activo capaz de interactuar con tu equipo en tu nombre. Puedes pedirle que describa la pantalla, responda preguntas sobre lo que ve, o tome el control: hacer clic en botones, arrastrar elementos, escribir texto y navegar por aplicaciones mediante comandos en lenguaje natural.

La mayor ventaja es que funciona perfectamente en software completamente inaccesible. Si estás atascado en una aplicación personalizada, un escritorio remoto o un sitio web donde tu lector de pantalla permanece en silencio, al Operador no le importa. Como "ve" la pantalla visualmente, puede encontrar, leer e interactuar con elementos que no tienen ninguna etiqueta de accesibilidad.

Cómo funciona

  1. Presiona NVDA + Shift + V, luego presiona Shift + A para abrir el diálogo del Operador de IA.
  2. Escribe lo que quieres hacer en lenguaje natural (por ejemplo, "Haz clic en el botón Guardar", "¿Qué dice el mensaje de error?" o "Cambia el nombre del archivo a final.pdf").
  3. La IA analizará tu pantalla, identificará los elementos relevantes y realizará la acción o proporcionará la respuesta. Si una tarea requiere varios pasos, el Operador continuará trabajando hasta completarla.
  4. Presiona Shift + A de nuevo en cualquier momento para cancelar una operación en curso al instante.

Acciones compatibles

El Operador entiende una amplia gama de comandos:
- Describir y responder: "Describe el diseño de la pantalla" o "¿Qué dice el mensaje de error?"
- Clic: "Haz clic en el botón Guardar"
- Clic derecho: "Haz clic derecho en el archivo"
- Doble clic: "Haz doble clic en el documento"
- Arrastrar y soltar: "Arrastra el documento a la carpeta Archivo"
- Escribir: "Escribe 'Hola Mundo' en el cuadro de búsqueda"
- Desplazar: "Desplázate hacia abajo tres veces"
- Tecla: "Presiona Enter", "Presiona Tab", "Presiona Escape"
- Tareas de varios pasos: "Abre el Explorador de archivos, encuentra el informe y cámbiale el nombre a final.pdf"

Notas importantes

4. Análisis de vídeo y audiodescripción

Nota: Las funciones de análisis de vídeo y audiodescripción funcionan exclusivamente con el proveedor Google Gemini. Asegúrate de que tu proveedor activo en la configuración del complemento sea Google Gemini.

Vision Assistant Pro introduce potentes capacidades de procesamiento de vídeo diseñadas específicamente para usuarios ciegos. Puede analizar tanto vídeos en línea como grabaciones de pantalla locales para proporcionar descripciones visuales altamente detalladas y generar scripts profesionales de audiodescripción (SRT).

4.1 Grabación de pantalla local (Control + V)

Si encuentras un vídeo silencioso, una animación o un tutorial en tu pantalla, puedes capturarlo directamente:
1. Presiona NVDA + Shift + V para entrar en la Capa de comandos, luego presiona Control + V.
2. El complemento grabará silenciosamente tu pantalla en segundo plano.
3. Presiona Control + V de nuevo para detener la grabación.
4. La IA analizará el segmento de vídeo grabado y proporcionará una descripción muy detallada de la escena, los personajes y las acciones.

4.2 Análisis de vídeo (Shift + V)

Puedes analizar tanto archivos de vídeo locales como vídeos en línea. Simplemente selecciona un archivo de vídeo local en el Explorador de Windows, o copia un enlace de vídeo en línea al portapapeles. También puedes presionar Shift + V en cualquier lugar para abrir un diálogo donde puedes examinar un archivo de vídeo o pegar una URL manualmente.
- Plataformas en línea compatibles: YouTube, Instagram, TikTok y Twitter (X).
- La IA detectará automáticamente el archivo local o la URL, procesará el vídeo y proporcionará una descripción visual completa y un resumen de audio.

4.3 Generación de audiodescripción (SRT)

Para una experiencia más estructurada, el complemento puede generar scripts profesionales de audiodescripción en formato estándar SubRip (SRT).
- Temporización inteligente de pausas: La IA escucha la pista de audio y ancla específicamente sus descripciones visuales a las pausas naturales y los silencios para minimizar inteligentemente la superposición con el diálogo.
- Seguimiento de personajes: El motor realiza una pre-pasada para extraer personajes distintos basándose en rasgos faciales inmutables. Construye un diccionario global para rastrear y etiquetar con precisión a los personajes en diferentes escenas sin confundirlos.
- OCR textual literal: Cualquier texto que aparezca en pantalla (carteles, teléfonos, créditos) se cita literalmente.
- Cómo usar: Para escuchar el subtítulo generado, simplemente coloca el archivo .srt en la misma carpeta que tu archivo de vídeo y dale exactamente el mismo nombre. Luego configura tu reproductor multimedia (por ejemplo, VLC o PotPlayer) para enrutar el texto de los subtítulos directamente a tu lector de pantalla o motor TTS durante la reproducción.

4.4 Narración de audio sincronizada (exportación a MP3)

Más allá de crear archivos SRT basados en texto, el complemento funciona como una herramienta completa de producción de audiodescripción sintetizando las descripciones en voz y mezclándolas con el vídeo. Al generar un MP3 para archivos de vídeo locales, tienes varios modos de mezcla:
- AD estándar (mezclar voz): La narración se superpone directamente sobre el audio del vídeo. Se te preguntará si deseas aplicar Atenuación de audio (bajar el volumen de fondo durante las descripciones) para garantizar que la narración sea clara.
- AD extendida (pausar audio): El motor pausa el audio original del vídeo durante las descripciones, asegurando que no te pierdas ni una sola palabra del diálogo original ni de la narración de la IA.
- Vídeos de YouTube: Para fuentes de YouTube (que no se descargan localmente), la exportación a MP3 contendrá estrictamente la pista de voz de la IA sincronizada sin el audio de fondo del vídeo.

5. Lector avanzado de documentos e imágenes

Vision Assistant Pro incluye un Lector de documentos altamente optimizado diseñado para PDFs de varias páginas, imágenes complejas e incluso formatos HEIC de iPhone.

5.1 Procesamiento en lotes y reanudación

No necesitas leer un documento extenso de una sola vez. Introduce un rango de páginas (por ejemplo, 1-20) y la IA procesará todas las páginas en segundo plano. Si NVDA se bloquea o interrumpes el escaneo, el complemento recordará tu progreso y ofrecerá Reanudar exactamente donde lo dejaste.

5.2 Acción inteligente de archivo

No siempre necesitas abrir el documento primero. En el Explorador de archivos de Windows, simplemente resalta un PDF o imagen y presiona D (Lector de documentos) o F (Acción inteligente de archivo) dentro de la Capa de comandos. El complemento omitirá instantáneamente el diálogo de archivo y comenzará a procesar el archivo resaltado.

5.3 Atajos del visor de documentos

Cuando la ventana del Lector de documentos está abierta, puedes usar los siguientes atajos:
- Ctrl + AvPág: Ir a la siguiente página.
- Ctrl + RePág: Ir a la página anterior.
- Alt + A: Abrir un diálogo de chat para hacer preguntas sobre el documento.
- Alt + R: Forzar un Nuevo escaneo con IA usando tu proveedor activo.
- Alt + G: Generar y guardar un archivo de audio de alta calidad (WAV/MP3). Oculto si el proveedor no admite TTS.
- Alt + S / Ctrl + S: Guardar el texto extraído como archivo TXT o HTML.

6. Etiquetado semántico con IA y Explorador de interfaz

¿Atascado en una aplicación llena de "botones sin etiqueta"? El motor de etiquetado semántico con IA resuelve esto de forma permanente.

6.1 Etiquetado permanente de objetos (L)

Enfoca tu lector de pantalla en un gráfico o botón sin etiquetar y presiona L en la Capa de comandos. La IA mirará el botón visualmente, determinará su función y aplicará una etiqueta permanente.
A diferencia de las herramientas de etiquetado de lectores de pantalla más antiguas, este complemento usa un sistema avanzado híbrido de "firma de objeto" (AutomationId/ControlID). ¡Tus etiquetas personalizadas sobrevivirán al redimensionamiento de ventanas, cambio de monitor y actualizaciones de la aplicación!

6.2 Escaneo completo de la aplicación (Shift + L)

Presiona Shift + L para escanear toda la ventana activa de una vez. La IA encontrará todos los elementos sin etiquetar y los nombrará inteligentemente de un solo golpe. Luego puedes administrar, renombrar o eliminar en lote estas etiquetas desde el Administrador de etiquetas incorporado.

6.3 Explorador de interfaz (E)

¿Necesitas interactuar con un elemento sin navegar hasta él manualmente? Presiona E para activar el Explorador de interfaz. La IA escaneará la pantalla y generará una lista accesible de cada elemento en el que se puede hacer clic (ignorando el ruido del sistema como las barras de tareas). Elige un elemento de la lista y el complemento hará clic en él instantáneamente.

7. Asistente en vivo

El Asistente en vivo convierte Vision Assistant Pro en un copiloto interactivo en tiempo real.
(Nota: Esta función es exclusiva de Google Gemini y los proveedores personalizados compatibles con Gemini).

8. Indicaciones personalizadas y variables

Puedes administrar las indicaciones en Configuración > Indicaciones > Administrar indicaciones....

Variables compatibles

9. Casos de uso reales (¿Qué función debo usar?)

Vision Assistant Pro está repleto de herramientas avanzadas. Aquí tienes algunos escenarios comunes para ayudarte a elegir la correcta:


Nota: Se requiere una conexión a Internet activa para todas las funciones de IA. Los documentos de varias páginas se procesan automáticamente.

10. Soporte y comunidad

Mantente actualizado con las últimas noticias, funciones y lanzamientos:
- Canal de Telegram: t.me/VisionAssistantPro
- GitHub Issues: Para informes de errores y solicitudes de funciones.

11. Colaboradores del proyecto

Un agradecimiento de corazón a los miembros de nuestra comunidad que apoyan el desarrollo continuo y el mantenimiento de este proyecto con sus generosas contribuciones económicas:

Si deseas apoyar el proyecto económicamente y ver tu nombre aquí, puedes encontrar la opción Donar en el menú Herramientas de NVDA (submenú Vision Assistant) o durante el proceso de configuración después de la instalación.


Cambios para 2026.07.15

Cambios para 7.0.0

Cambios para 6.5.0

Cambios para 6.1.2

Cambios para 6.1.1

Cambios para 6.1.0

Cambios para 6.0

Cambios para 5.6

Cambios para 5.5.2

Cambios para 5.5 (La actualización de automatización)

Cambios para 5.0

Cambios para 4.6

Cambios para 4.5

Cambios para 4.0.3

Cambios para 4.0.1

Cambios para 3.6.0

Cambios para 3.5.0

* **Capa de comandos:** Sistema de capa de comandos (NVDA+Shift+V) para agrupar los atajos bajo una sola tecla maestra.
* **Análisis de vídeos en línea:** Nueva función para analizar vídeos de YouTube e Instagram directamente por URL.

Cambios para 3.1.0

Cambios para 3.0

Cambios para 2.9

Cambios para 2.8

Cambios para 2.7

Cambios para 2.6

Cambios para 2.5

Cambios para 2.1.1

Cambios para 2.1

Cambios para 2.0

Cambios para 1.5

Cambios para 1.0