Natürliche Spracherzeugung für NVDA

Autor: Muhammad Gagah muha.aku@gmail.com **

Natürliche Spracherzeugung ist ein NVDA‑Add-on, das Google Gemini AI integriert, um hochwertige, natürlich klingende Sprache direkt in NVDA zu erzeugen.

Es bietet eine klare, vollständig zugängliche Oberfläche zur Umwandlung von Text in Audio und unterstützt sowohl Einzelsprecher‑Vorlesemodi als auch dynamische Dialoge mit zwei Sprechern.

Dieses Addon ist für reibungslose Arbeitsabläufe, barrierefreie Bedienung und flexible Stimmkontrolle ausgelegt – ideal für Vorlesetexte, Dialoge und Audio‑Content‑Produktion.

Funktionen

Hochwertige Spracherzeugung

Einzel- & Mehrsprecher-Modi

Erweiterte Stimmkontrolle

Zugängliche & übersichtliche Oberfläche

Nahtloser Arbeitsablauf

Intelligentes Laden & zwischenspeichern von Stimmen

Sprechen mit der KI (Live‑Konversation)

-## Voraussetzungen

-## Installation

  1. Lade das neueste Add-on von der Veröffentlichungsseite: https://github.com/MuhammadGagah/native-speech-generation/releases
  2. Installiere es wie jedes NVDA‑Add-on.
  3. Starte NVDA neu, wenn du dazu aufgefordert wirst.

-## API‑Schlüssel einrichten (erforderlich)

  1. Erstelle einen API‑Schlüssel in Google AI Studio: https://aistudio.google.com/apikey
  2. Öffne NVDA und gehe zu: NVDA-Menü → Werkzeuge → Natürliche Spracherzeugung
  3. Klicke auf „API Key Einstellungen“.
  4. Dadurch öffnet sich der NVDA‑Einstellungsdialog direkt im Bereich Natürliche Spracherzeugung.
  5. Füge deinen Gemini API‑Schlüssel in das Feld GEMINI API Key ein.
  6. Klicke auf OK, um zu speichern.

Gespeicherte Schlüssel werden sicher über Windows DPAPI verschlüsselt – sie können auf anderen Windows‑Systemen oder Benutzerkonten nicht entschlüsselt werden.

Für fortgeschrittene Bereitstellungen kannst du den Schlüssel auch über die Umgebungsvariable GEMINI_API_KEY bereitstellen. Das Add-on nutzt ihn automatisch, wenn kein gespeicherter Schlüssel vorhanden ist.

Verwendung

Öffne den Dialog über:

Hauptelemente der Oberfläche

Spracherzeugung

Einzelsprecher‑Modus

  1. Wähle Einzelsprecher.
  2. Wähle eine Stimme aus der Liste.
  3. Gib deinen Text ein.
  4. Optional: Stil‑Anweisungen hinzufügen.
  5. Klicke Sprache erzeugen.
  6. Das Audio wird automatisch abgespielt.

Mehrsprecher‑Modus

  1. Wähle Mehrsprecher (2).
  2. Für jeden Sprecher:

  3. Einen eindeutigen Sprechernamen eingeben.

  4. Eine Stimme auswählen.

  5. Text so formatieren, dass jede Zeile mit dem Sprechernamen und Doppelpunkt beginnt.

Beispiel:

Alice: Hallo Bob, wie geht es dir heute? Bob: Mir geht’s super, Alice! Das Wetter ist fantastisch.

  1. Klicke *Sprache erzeugen. Stimmen werden automatisch anhand der Namen zugeordnet.

Sprechen mit der KI (Live‑Modus)

Erlebe ein natürliches Sprachgespräch mit Gemini.

  1. Stimme und Stil‑Anweisungen im Hauptdialog konfigurieren. (Hinweis: Sprechen mit der KI unterstützt derzeit nur Einzelsprecher‑Modus.)
  2. Klicke Sprechen mit der KI.
  3. Im neuen Fenster:

  4. Gespräch beginnen – beginnt die Sitzung, Mikrofon aktiv.

  5. Gespräch stoppen – beendet die Sitzung.
  6. Verbindung mit Google-Suche – erlaubt Web‑Recherche. (Während einer aktiven Sitzung ausgeblendet.)
  7. **Verarbeitungstiefe: ** – Nein, Niedrig, Medium, Hoch.
  8. Mikrofon‑Schalter – Stummschalten/aktivieren.
  9. Lautstärke – Wiedergabelautstärke der KI.

Erweiterte Einstellungen

Übersicht der Schaltflächen

Tastenkombinationen

Anpassbar unter: NVDA-Menü → Optionen → Tastenbefehle → Natürliche Spracherzeugung

Standard:

Entwicklung & Beitrag

Wenn du das Add-on Weiterentwickeln oder anpassen möchtest:

Entwicklungsumgebung

uv sync uv run pre-commit run --all-files uv run scons uv run scons pot

SCons 4.10.1, Markdown 3.10, Ruff 0.14.10, Pyright 1.1.407 und die weiteren Build-Tools werden aus uv.lock installiert.

Zusätzliche Abhängigkeiten

Installiere die Audio‑Abhängigkeiten für Sprechen mit der KI nur für lokale Entwicklung direkt in den Add-on‑Lib‑Ordner. Verwende dabei die Python-Version und Architektur, die zur getesteten NVDA-Laufzeit passen:

python.exe -m pip install google-genai pyaudio --target "D:/myAdd-on/Native-Speech-Generation/addon/globalPlugins/NativeSpeechGeneration/lib"

Pfad entsprechend anpassen.

Für die aktuelle Audio‑only‑Implementierung werden opencv-python, pillow und mss nicht benötigt.

Für Release-Pakete lädt das Add-on das neueste verifizierte Abhängigkeitsarchiv passend zur laufenden NVDA-Version herunter:

Das Add-on liest die SHA-256-Daten aus dem neuesten GitHub-Abhängigkeitsrelease, entweder aus dem Release-Asset-Digest oder aus Checksum-Dateien. Mitgelieferte genehmigte Checksums bleiben nur als Fallback für Erstinstallationen erhalten, wenn die Abfrage des neuesten Releases fehlschlägt. Manuelle Bibliotheks-Neuinstallationen verlangen das neueste verifizierte Release. Der extrahierte Ordner wird immer als addon/globalPlugins/NativeSpeechGeneration/lib installiert.

Kopiere anschließend aus deiner Python‑Installation in:

addon/globalPlugins/NativeSpeechGeneration/lib

Beiträge

Beiträge, Vorschläge und Fehlerberichte sind willkommen.

Kontakt

Übersetzung

Diese Erweiterung wurde von BFW Würzburg im Rahmen des Projektes "NVDA Nachhaltig" ins Deutsche übersetzt.