Autor: Muhammad Gagah muha.aku@gmail.com **
Natürliche Spracherzeugung ist ein NVDA‑Add-on, das Google Gemini AI integriert, um hochwertige, natürlich klingende Sprache direkt in NVDA zu erzeugen.
Es bietet eine klare, vollständig zugängliche Oberfläche zur Umwandlung von Text in Audio und unterstützt sowohl Einzelsprecher‑Vorlesemodi als auch dynamische Dialoge mit zwei Sprechern.
Dieses Addon ist für reibungslose Arbeitsabläufe, barrierefreie Bedienung und flexible Stimmkontrolle ausgelegt – ideal für Vorlesetexte, Dialoge und Audio‑Content‑Produktion.
Auswahl zwischen:
Gemini Flash – Standardqualität, schnelle Erzeugung, geringe Latenz.
Kreativitäts-Regler Steuert Variation und Kreativität:
Niedrige Werte → stabiler, vorhersehbarer.
.wav‑Datei gespeichert werden.No Thinking, Low, Medium, High.-## Voraussetzungen
-## Installation
https://github.com/MuhammadGagah/native-speech-generation/releases-## API‑Schlüssel einrichten (erforderlich)
Gespeicherte Schlüssel werden sicher über Windows DPAPI verschlüsselt – sie können auf anderen Windows‑Systemen oder Benutzerkonten nicht entschlüsselt werden.
Für fortgeschrittene Bereitstellungen kannst du den Schlüssel auch über die Umgebungsvariable
GEMINI_API_KEY bereitstellen. Das Add-on nutzt ihn automatisch, wenn kein gespeicherter Schlüssel vorhanden ist.
Öffne den Dialog über:
Modell auswählen
Flash (Standardqualität)
Sprechermodus
Einzelsprecher
Für jeden Sprecher:
Einen eindeutigen Sprechernamen eingeben.
Eine Stimme auswählen.
Text so formatieren, dass jede Zeile mit dem Sprechernamen und Doppelpunkt beginnt.
Beispiel:
Alice: Hallo Bob, wie geht es dir heute?
Bob: Mir geht’s super, Alice! Das Wetter ist fantastisch.
Erlebe ein natürliches Sprachgespräch mit Gemini.
Im neuen Fenster:
Gespräch beginnen – beginnt die Sitzung, Mikrofon aktiv.
Nein, Niedrig, Medium, Hoch.Bereich für den Kreativitäts-Regler:
0.0 → am stabilsten, deterministisch.
1.0 → Standardbalance.2.0 → kreativste, variabelste Ausgabe..wav speichern.Escape).Anpassbar unter: NVDA-Menü → Optionen → Tastenbefehle → Natürliche Spracherzeugung
Standard:
Wenn du das Add-on Weiterentwickeln oder anpassen möchtest:
uv sync
uv run pre-commit run --all-files
uv run scons
uv run scons pot
SCons 4.10.1, Markdown 3.10, Ruff 0.14.10, Pyright 1.1.407 und die weiteren Build-Tools werden aus uv.lock installiert.
GNU Gettext Tools (optional, empfohlen)
Unter Linux/Cygwin meist vorinstalliert.
https://gnuwin32.sourceforge.net/downlinks/gettext.php (gnuwin32.sourceforge.net in Bing)Installiere die Audio‑Abhängigkeiten für Sprechen mit der KI nur für lokale Entwicklung direkt in den Add-on‑Lib‑Ordner. Verwende dabei die Python-Version und Architektur, die zur getesteten NVDA-Laufzeit passen:
python.exe -m pip install google-genai pyaudio --target "D:/myAdd-on/Native-Speech-Generation/addon/globalPlugins/NativeSpeechGeneration/lib"
Pfad entsprechend anpassen.
Für die aktuelle Audio‑only‑Implementierung werden opencv-python, pillow und mss nicht benötigt.
Für Release-Pakete lädt das Add-on das neueste verifizierte Abhängigkeitsarchiv passend zur laufenden NVDA-Version herunter:
lib.zip für NVDA 2025.3.3 und ältere unterstützte Builds.lib64.zip für NVDA 2026.1 und neuer.Das Add-on liest die SHA-256-Daten aus dem neuesten GitHub-Abhängigkeitsrelease, entweder aus dem Release-Asset-Digest oder aus Checksum-Dateien. Mitgelieferte genehmigte Checksums bleiben nur als Fallback für Erstinstallationen erhalten, wenn die Abfrage des neuesten Releases fehlschlägt. Manuelle Bibliotheks-Neuinstallationen verlangen das neueste verifizierte Release. Der extrahierte Ordner wird immer als addon/globalPlugins/NativeSpeechGeneration/lib installiert.
Kopiere anschließend aus deiner Python‑Installation in:
addon/globalPlugins/NativeSpeechGeneration/lib
zoneinfosecrets.pyBeiträge, Vorschläge und Fehlerberichte sind willkommen.
Kontakt
muha.aku@gmail.comhttps://github.com/MuhammadGagah (github.com in Bing)Diese Erweiterung wurde von BFW Würzburg im Rahmen des Projektes "NVDA Nachhaltig" ins Deutsche übersetzt.