Native Speech Generation para NVDA

Autor: Muhammad Gagah muha.aku@gmail.com

Native Speech Generation es un complemento para NVDA que integra Google Gemini AI para generar voz natural y de alta calidad directamente desde NVDA. Ofrece una interfaz limpia y totalmente accesible para convertir texto en audio, con soporte tanto para narración de un solo hablante como para diálogos dinámicos con varios hablantes.

Este complemento está pensado para ofrecer un flujo de trabajo fluido, una interacción centrada en la accesibilidad y un control flexible de la voz, ideal para narración, diálogos y producción de contenido de audio.


Características

Generación de voz de alta calidad

Modos de hablante único y múltiple

Control de voz avanzado

Interfaz accesible y clara

Flujo de trabajo fluido

Carga inteligente de voces y caché

Hablar con IA (conversación en vivo)


Requisitos


Instalación

  1. Descarga el paquete más reciente del complemento desde la página de versiones: https://github.com/MuhammadGagah/native-speech-generation/releases
  2. Instálalo como cualquier complemento estándar de NVDA.
  3. Reinicia NVDA cuando se te solicite.

Configuración de la clave de API (obligatoria)

  1. Crea una clave de API en Google AI Studio: https://aistudio.google.com/apikey
  2. Abre NVDA y ve a: Menú de NVDA -> Herramientas -> Native Speech Generation
  3. Haz clic en "Configuración de la clave API".
  4. Esto abre la configuración de NVDA directamente en la categoría Native Speech Generation.
  5. Pega tu clave de API de Gemini en el campo GEMINI API Key.
  6. Haz clic en Aceptar para guardar.

Las claves guardadas se almacenan de forma segura mediante Windows DPAPI, por lo que el valor cifrado no puede descifrarse en otro equipo con Windows ni en otra cuenta de usuario.

Para entornos avanzados o gestionados, también puedes proporcionar la clave mediante la variable de entorno GEMINI_API_KEY. El complemento la usará automáticamente cuando no haya una clave guardada disponible.


Cómo usar

Abre el diálogo usando:

Elementos principales de la interfaz


Generación de voz

Modo de hablante único

  1. Selecciona Un solo hablante.
  2. Elige una voz en la lista Seleccionar voz.
  3. Introduce tu texto.
  4. Añade instrucciones de estilo si lo deseas.
  5. Haz clic en Generar voz.
  6. El audio se reproducirá automáticamente cuando termine la generación.

Modo multihablante

  1. Selecciona Multihablante (2).
  2. Para cada hablante:
  3. Introduce un nombre de hablante único.
  4. Elige una voz distinta.
  5. Da formato al texto para que cada línea comience con el nombre del hablante seguido de dos puntos.

Ejemplo:

Alicia: Hola, Bob. ¿Cómo estás hoy? Bob: ¡Muy bien, Alicia! Hace un tiempo fantástico.

  1. Haz clic en Generar voz. Las voces se asignarán automáticamente según los nombres de los hablantes.

Hablar con IA (modo en vivo)

Disfruta de una conversación de voz bidireccional y natural con Gemini.

  1. Configura la Voz y las Instrucciones de estilo que quieras en el diálogo principal. (Nota: Hablar con IA actualmente solo admite el modo de un solo hablante).
  2. Haz clic en Hablar con IA.
  3. En la nueva ventana:
  4. Iniciar conversación: inicia la sesión. Habla por tu micrófono.
  5. Detener conversación: finaliza la sesión.
  6. Grounding con Google Search: marca esta casilla para permitir que Gemini busque respuestas en la web (por ejemplo, noticias o el clima actual).
  7. Nivel de razonamiento: elige entre Sin razonamiento, Bajo, Medio o Alto.
  8. Micrófono: silencia o activa tu micrófono.
  9. Volumen: ajusta el volumen de reproducción de la IA.

Configuración avanzada


Resumen de botones


Gestos de entrada

Personalizable desde: Menú de NVDA -> Preferencias -> Gestos de entrada -> Native Speech Generation

Gesto predeterminado:


Guía de desarrollo y contribución

Si quieres desarrollar o modificar este complemento, sigue los pasos siguientes.

Configuración del entorno

uv sync uv run pre-commit run --all-files uv run scons uv run scons pot

SCons 4.10.1, Markdown 3.10, Ruff 0.14.10, Pyright 1.1.407 y las demás herramientas de compilación se instalan desde uv.lock. * Herramientas GNU Gettext (opcional, recomendado para localización) * Normalmente vienen preinstaladas en Linux/Cygwin. * Windows: https://gnuwin32.sourceforge.net/downlinks/gettext.php

Dependencias adicionales

Solo para desarrollo local, instala las dependencias de audio de Talk With AI directamente en la ruta de bibliotecas del complemento usando la versión y arquitectura de Python que coincidan con el runtime de NVDA que estás probando:

python.exe -m pip install google-genai pyaudio --target "D:/myAdd-on/Native-Speech-Generation/addon/globalPlugins/NativeSpeechGeneration/lib"

Ajusta la ruta según tu directorio local del código fuente del complemento.

Para la implementación actual de Talk With AI basada solo en audio, no necesitas opencv-python, pillow ni mss.

Para paquetes de lanzamiento, el complemento descarga el archivo de dependencias verificado más reciente según la versión de NVDA en ejecución:

El complemento lee los datos SHA-256 desde la versión de dependencias más reciente en GitHub, usando el digest del asset de la versión o archivos de checksum. Los checksums aprobados incluidos se conservan solo como fallback para primeras instalaciones cuando falla la consulta de la versión más reciente. La reinstalación manual de bibliotecas requiere la versión verificada más reciente. La carpeta extraída siempre se instala como addon/globalPlugins/NativeSpeechGeneration/lib.

Después, copia lo siguiente desde tu instalación de Python a:

addon/globalPlugins/NativeSpeechGeneration/lib


Contribuir

Las contribuciones, sugerencias y reportes de errores son muy bienvenidos.

Contacto