KI Assistent pro Dokumentation

KI Assistent pro ist ein fortschrittlicher, multimodaler KI-Assistent für NVDA. Er nutzt erstklassige KI-Engines, um intelligentes Screenreading, Übersetzungen, Sprachdiktate und Dokumentenanalysen zu ermöglichen.

Dieses Add-on wurde zu Ehren des Internationalen Tages der Menschen mit Behinderungen für die Community veröffentlicht.

1. Einrichtung & Konfiguration

Gehen Sie zu NVDA-Menü > Optionen > Einstellungen > KI Assistent pro. Das Einstellungsfenster ist in 8 barrierefreie Reiter unterteilt: Verbindung, KI-Verhalten, Übersetzungssprachen, Dokumentenleser, Video, CAPTCHA, Prompts und Erweitert.

1.1 Verbindung Reiter

1.2 KI-Verhalten Reiter

1.3 Übersetzungssprachen Reiter

1.4 Dokumentenleser Reiter

1.5 Video Reiter

1.6 CAPTCHA Reiter

1.7 Prompts Reiter

1.8 Erweitert Reiter & Globales Logging

Navigieren Sie zum Reiter Erweitert, um das globale Logging des Add-ons zu konfigurieren:


2. Befehlsebene & Tastenkombinationen

Um Tastaturkonflikte zu vermeiden, verwendet dieses Add-on eine Befehlsebene.

  1. Drücken Sie NVDA + Umschalt + V (Haupttaste), um die Ebene zu aktivieren (Sie hören einen Signalton).

  2. Lassen Sie die Tasten los und drücken Sie dann eine der folgenden Einzeltasten:

Taste Funktion Beschreibung
Umschalt+A KI-Operator Autonome Steuerung: Weisen Sie die KI an, eine Aufgabe auf Ihrem Bildschirm auszuführen. Erneutes Drücken bricht die Aktion sofort ab.

|
| E | UI-Explorer | Interaktiver Klick: Identifiziert und klickt auf UI-Elemente in jeder Anwendung. Beschriftungen können direkt hinzugefügt werden.

|
| T | Intelligenter Übersetzer | Übersetzt Text unter dem Navigator-Objekt oder der Markierung.

|
| Umschalt+T | Zwischenablage-Übersetzer | Übersetzt den aktuellen Inhalt der Zwischenablage.

|
| R | Text-Optimierer | Zusammenfassen, Grammatik korrigieren, Erklären oder Eigene Prompts.

|
| V | Objekt-Vision | Beschreibt das aktuelle Navigator-Objekt.

|
| O | Vollbild-Vision | Analysiert das gesamte Bildschirmlayout und den Inhalt.

|
| Umschalt+V | Videoanalyse | Analysiert lokale Videodateien oder Online-Videos von YouTube, Instagram, TikTok oder Twitter (X).

|
| Strg+V | Lokale Videoaufnahme | Nimmt ein lautloses Video Ihres Bildschirms auf und analysiert die Aktionen und das Layout.

|
| D | Dokumentenleser | Fortgeschrittener Leser für PDF und Bilder mit Seitenbereichsauswahl.

|
| F | Smarte Datei-Aktion | Kontextabhängige Erkennung aus ausgewählten Bild-, PDF- oder TIFF-Dateien.

|
| M | Medien-Transkription & Synchronisation | Transkribiert oder synchronisiert Audio-/Videodateien (MP3, WAV, MP4 usw.) in Ihre Zielsprache.

|
| C | CAPTCHA-Löser | Erfasst und löst visuelle sowie textbasierte CAPTCHAs.

|
| Umschalt+C | Direkter Chat | Öffnet direkt ein Text-Chat-Fenster mit der KI ohne vorherige Bild- oder Dokumentauswahl.

|
| S | Intelligentes Diktat | Wandelt Sprache in Text um. Drücken zum Starten, erneut drücken zum Stoppen/Einfügen.

|
| Strg+T | Sprach-Übersetzung | Diktieren Sie Sprache, die sofort übersetzt und als Text eingefügt wird.

|
| Strg+L | Live-Assistent | Echtzeit-Copilot (nur Gemini): Startet oder beendet ein Live-Sprach- und Bildschirmgespräch mit dem KI-Assistenten.

|
| I | Statusbericht | Meldet den aktuellen Fortschritt (z. B. "Scannen...", "Bereit").

|
| L | Objekt beschriften | Semantische KI-Beschriftung: Beschriftet das aktuell fokussierte Element/Symbol dauerhaft.

|
| Umschalt+L | Beschriftungen verwalten/scannen | Öffnet den Beschriftungs-Manager (falls Beschriftungen existieren) oder scannt die App nach unbenannten Elementen.

|
| U | Update-Prüfung | Prüft manuell auf GitHub nach der neuesten Version des Add-ons.

|
| Leertaste | Letztes Ergebnis abrufen | Zeigt den vollständigen Verlauf der letzten KI-Antwort in einem Chat-Dialog zur Überprüfung an.

|
| H | Befehlshilfe | Zeigt eine Liste aller verfügbaren Kürzel innerhalb der Befehlsebene an.

|
| Alt+S | Einstellungen | Öffnet direkt den Einstellungsdialog von KI Assistent pro.

|
| Alt+Q | Bericht über erschöpfte Kontingente | Meldet die Anzahl der Gemini-API-Schlüssel, die ihr tägliches Kontingent überschritten haben, für welches Modell dies gilt und deren genaue Zurücksetzungszeit.

|
| Alt+M | Routing-Prüfung | Meldet die aktuell im erweiterten Modell-Routing ausgewählten KI-Modelle.

|
| Pfeil hoch / runter | Schnelleinstellung Navigation | Wechselt zwischen den Schnelleinstellungskategorien (Anbieter, Modell etc.) direkt in der Befehlsebene.

|
| Pfeil links / rechts | Schnelleinstellung ändern | Ändert den Wert der aktuell ausgewählten Schnelleinstellung mit sofortigem Sprachfeedback.

|

2.1 Tastenkombinationen im Dokumentenleser (Innerhalb des Viewers)


3. KI-Operator - Autonome Computersteuerung

Der KI-Operator macht aus dem KI Assistent pro von einem passiven Leser einen aktiven Assistenten, der in Ihrem Namen mit Ihrem Computer interagieren kann. Sie können ihn bitten, den Bildschirm zu beschreiben, Fragen zu dem zu beantworten, was er sieht, oder sogar die Kontrolle zu übernehmen – Knöpfe anklicken, Elemente ziehen, Text tippen und durch Anwendungen navigieren, indem Sie ganz normale Alltagssprache verwenden.

Der größte Vorteil? Es funktioniert perfekt in absolut unzugänglicher Software. Wenn Sie in einer benutzerdefinierten Anwendung, einer Remotedesktop-Verbindung oder auf einer Website feststecken, bei der Ihr Screenreader völlig stumm bleibt, stört das den Operator nicht. Da er den Bildschirm visuell „sieht“, kann er Elemente finden, lesen und mit ihnen interagieren, die keinerlei Barrierefreiheits-Labels besitzen.

Wie es funktioniert

  1. Drücken Sie NVDA + Umschalt + V und dann Umschalt + A (oder nutzen Sie die direkte Tastenkombination), um den KI-Operator-Dialog zu öffnen.

  2. Tippen Sie in verständlicher Sprache ein, was Sie tun möchten (z. B. „Klicke auf die Schaltfläche Speichern“, „Was sagt die Fehlermeldung?“ oder „Benenne die Datei in endgueltig.pdf um“).

  3. Die KI analysiert Ihren Bildschirm, identifiziert die relevanten Elemente und führt die Aktion aus oder liefert die Antwort. Wenn eine Aufgabe mehrere Schritte erfordert, arbeitet der Operator so lange weiter, bis sie abgeschlossen ist.

  4. Drücken Sie jederzeit erneut Umschalt + A, um eine laufende Aktion sofort abzubrechen.

Unterstützte Aktionen

Der Operator versteht eine Vielzahl von Befehlen:

Wichtige Hinweise


4. Videoanalyse & Audiobeschreibung

Hinweis: Die Funktionen zur Videoanalyse und Audiobeschreibung werden ausschließlich durch den Anbieter Google Gemini unterstützt. Stellen Sie sicher, dass Ihr aktiver Anbieter in den Add-on-Einstellungen auf Google Gemini eingestellt ist.

KI Assistent pro führt leistungsstarke Videoverarbeitungsfunktionen ein, die speziell für blinde und sehbehinderte Benutzer entwickelt wurden. Es kann sowohl Online-Videos als auch lokale Bildschirmaufnahmen analysieren, um hochdetaillierte visuelle Beschreibungen zu liefern und professionelle Audiobeschreibungs-Skripte (SRT) zu erstellen.

4.1 Lokale Bildschirmaufnahme (Strg + V)

Wenn Sie auf ein stummes Video, eine Animation oder eine Anleitung auf Ihrem Bildschirm stoßen, können Sie diese direkt aufnehmen:

  1. Drücken Sie NVDA + Umschalt + V, um die Befehlsebene zu aktivieren, und drücken Sie dann Strg + V.

  2. Das Add-on nimmt Ihren Bildschirm geräuschlos im Hintergrund auf.

  3. Drücken Sie erneut Strg + V, um die Aufnahme zu stoppen.

  4. Die KI analysiert den aufgenommenen Videoabschnitt und liefert eine hochdetaillierte Beschreibung der Szene, des Layouts und der Aktionen.

4.2 Videoanalyse (Umschalt + V)

Sie können sowohl lokale Videodateien als auch Online-Videos analysieren. Wählen Sie einfach eine lokale Videodatei im Windows-Explorer aus oder kopieren Sie einen Online-Videolink in Ihre Zwischenablage. Sie können auch überall Umschalt + V drücken (z. B. in einem Media-Player), um einen Dialog zu öffnen, in dem Sie nach einer Videodatei suchen oder eine URL manuell einfügen können.

4.3 Erstellung von Audiobeschreibungen (SRT)

Für ein strukturierteres Erlebnis kann das Add-on professionelle Audiobeschreibungs-Skripte im Standard-SubRip-Format (SRT) generieren.

4.4 Synchronisierte Audio-Sprachausgabe (MP3-Export)

Das Add-on geht über die Erstellung textbasierter SRT-Dateien hinaus und fungiert als vollständiges Werkzeug zur Erstellung von Audiobeschreibungen, indem es die Beschreibungen in Sprache synthetisiert und mit dem Video abmischt. Sie können nun Gemini Live TTS als Sprach-Engine wählen, um unbegrenzte und realistischere Beschreibungen ohne Längenbeschränkungen zu erzeugen. Beim Generieren einer MP3-Datei für lokale Videodateien stehen Ihnen mehrere Mischmodi zur Verfügung:


5. Medien-Transkription & Synchronisation (M)

Das Modul zur Audio-Transkription wurde komplett überarbeitet und unterstützt nun sowohl Audio- als auch Videodateien (MP3, WAV, MP4, MKV etc.). Drücken Sie M in der Befehlsebene, um eine Mediendatei auszuwählen und eine von 3 Betriebsarten zu wählen:

  1. Transkribieren (Originalsprache): Transkribiert die gesprochene Sprache präzise in ihrer Originalsprache.

  2. Transkribieren und Übersetzen (Zielsprache): Transkribiert die Sprache und übersetzt sie in Ihre konfigurierte Zielsprache.

  3. Synchronisieren und Übersetzen (Zielsprache) (nur Gemini): Eine leistungsstarke neue Funktion, die Sprache transkribiert, übersetzt und mit der TTS-Engine des Add-ons eine neu eingesprochene Audio-Synchronfassung erzeugt.


6. Fortgeschrittener Dokumenten- & Bildleser

KI Assistent pro enthält einen hochoptimierten Dokumentenleser, der für mehrseitige PDFs, komplexe Bilder und sogar iPhone-HEIC-Formate entwickelt wurde.

6.1 Stapelverarbeitung & Fortsetzen

Sie müssen ein riesiges Dokument nicht auf einmal lesen. Geben Sie einen Seitenbereich ein (z. B. 1-20), und die KI verarbeitet alle Seiten im Hintergrund. Wenn NVDA abstürzt oder Sie den Scan unterbrechen, merkt sich das Add-on Ihren Fortschritt und bietet an, genau dort fortzufahren, wo Sie aufgehört haben!

6.2 Smarte Datei-Aktion

Sie müssen das Dokument nicht immer zuerst öffnen. Markieren Sie im Windows-Explorer einfach eine PDF- oder Bilddatei und drücken Sie D (Dokumentenleser) oder F (Smarte Datei-Aktion) in der Befehlsebene. Das Add-on umgeht den Dateidialog sofort und beginnt direkt mit der Verarbeitung der markierten Datei.

6.3 Tastenkombinationen im Dokumenten-Viewer

Wenn das Fenster des Dokumentenlesers geöffnet ist, können Sie folgende Tastenkombinationen verwenden:


7. Semantische KI-Beschriftung & UI-Explorer

Stecken Sie in einer Anwendung fest, in der überall nur „unbenannte Schaltfläche“ angesagt wird? Die semantische KI-Beschriftungs-Engine löst dieses Problem dauerhaft.

7.1 Permanente Objektbeschriftung (L)

Fokussieren Sie Ihren Screenreader auf eine unbenannte Grafik oder Schaltfläche und drücken Sie L in der Befehlsebene. Die KI schaut sich die Schaltfläche visuell an, ermittelt ihre Funktion und vergibt eine dauerhafte Beschriftung.
Im Gegensatz zu älteren Beschriftungswerkzeugen verwendet dieses Add-on ein fortschrittliches, hybrides „Objektsignatur-System“ (AutomationId/ControlID). Ihre benutzerdefinierten Beschriftungen überstehen das Ändern der Fenstergröße, Monitorwechsel und Anwendungs-Updates!

7.2 Vollständiger Anwendungs-Scan (Umschalt + L)

Drücken Sie Umschalt + L, um das gesamte aktive Fenster auf einmal zu scannen. Die KI findet alle unbeschrifteten Elemente und benennt sie intelligent in einem Rutsch. Sie können diese Beschriftungen später im integrierten Beschriftungs-Manager anzeigen, umbenennen oder im Stapel löschen.

7.3 UI-Explorer (E)

Möchten Sie mit einem Element interagieren, ohne manuell dorthin zu navigieren? Drücken Sie E, um den UI-Explorer zu aktivieren. Die KI scannt den Bildschirm und generiert eine barrierefreie Liste aller anklickbaren Elemente (und ignoriert dabei System-Rauschen wie die Taskleiste). Wählen Sie ein Element aus der Liste, und das Add-on klickt es sofort für Sie an. Zudem können Sie Elemente direkt aus der Liste heraus beschriften.


8. Live-Sprachassistent

Der Live-Assistent macht KI Assistent pro zu einem interaktiven Echtzeit-Copiloten.
(Hinweis: Diese Funktion ist exklusiv für Google Gemini und Gemini-kompatible benutzerdefinierte Anbieter verfügbar).


9. Eigene Prompts & Variablen

Sie können Prompts unter Einstellungen > Prompts > Prompts verwalten... verwalten.

Unterstützte Variablen


10. Praktische Anwendungsfälle (Welche Funktion soll ich nutzen?)

KI Assistent pro ist vollgepackt mit fortschrittlichen Werkzeugen. Hier sind einige häufige Szenarien, die Ihnen bei der Auswahl der richtigen Funktion helfen:


Hinweis: Für alle KI-Funktionen ist eine aktive Internetverbindung erforderlich. Mehrseitige Dokumente werden automatisch verarbeitet.


11. Support & Community

Bleiben Sie auf dem Laufenden über Neuigkeiten, Funktionen und Veröffentlichungen:

Fehlerbehebung & Protokolle melden

Wenn Sie ein Issue auf GitHub erstellen oder Support anfragen, geben Sie bitte Details zu Ihrem aktiven KI-Anbieter, Modell und der NVDA-Version an. Wenn Sie Verbindungsprobleme oder unerwartete Abstürze haben, aktivieren Sie die dedizierte Log-Datei unter Einstellungen > Erweitert, stellen Sie das Problem nach und hängen Sie Ihre vision_assistant.log-Datei an.


12. Projekt-Unterstützer

Ein herzliches Dankeschön an unsere Community-Mitglieder, die die kontinuierliche Entwicklung und Pflege dieses Projekts durch ihre großzügigen finanziellen Beiträge unterstützen:

Wenn Sie das Projekt finanziell unterstützen und Ihren Namen hier sehen möchten, finden Sie die Option Spenden im NVDA-Werkzeuge-Menü (Untermenü KI-Assistent) oder während des Einrichtungsprozesses nach der Installation.


Änderungen für 06.08.2026


Änderungen für 15.07.2026


Änderungen in 7.0.0


Änderungen in 6.5.0


Änderungen in 6.1.2


Änderungen in 6.1.1


Änderungen in 6.1.0


Änderungen in 6.0


Änderungen in 5.6


Änderungen in 5.5.2


Änderungen in 5.5 (Das Automatisierungs-Update)


Änderungen in 5.0


Änderungen in 4.6


Änderungen in 4.5


Änderungen in 4.0.3


Änderungen in 4.0.1


Änderungen in 3.6.0


Änderungen in 3.5.0


Änderungen in 3.1.0


Änderungen in 3.0


Änderungen in 2.9


Änderungen in 2.8


Änderungen in 2.7


Änderungen in 2.6


Änderungen in 2.5


Änderungen in 2.1


Änderungen in 2.0


Änderungen in 1.5


Änderungen in 1.0


Übersetzung