Native Speech Generation untuk NVDA

Penulis: Muhammad Gagah muha.aku@gmail.com

Native Speech Generation adalah add-on NVDA yang mengintegrasikan Google Gemini AI untuk menghasilkan ucapan berkualitas tinggi dengan suara yang terdengar alami langsung di NVDA. Add-on ini menyediakan antarmuka yang bersih dan sepenuhnya dapat diakses untuk mengubah teks menjadi audio, serta mendukung narasi pembicara tunggal maupun dialog multi-pembicara yang dinamis.

Add-on ini dirancang untuk alur kerja yang lancar, interaksi yang mengutamakan aksesibilitas, dan kontrol suara yang fleksibel, sehingga cocok untuk narasi, dialog, serta produksi konten audio.


Fitur

Pembuatan Ucapan Berkualitas Tinggi

Mode Pembicara Tunggal dan Multi-Pembicara

Kontrol Suara Lanjutan

Antarmuka yang Bersih dan Dapat Diakses

Alur Kerja yang Lancar

Pemuatan Suara Cerdas dan Cache

Bicara dengan AI (Percakapan Langsung)


Persyaratan


Instalasi

  1. Unduh paket add-on terbaru dari halaman Rilis: https://github.com/MuhammadGagah/native-speech-generation/releases
  2. Instal seperti add-on NVDA standar lainnya.
  3. Mulai ulang NVDA saat diminta.

Pengaturan Kunci API (Wajib)

  1. Buat kunci API dari Google AI Studio: https://aistudio.google.com/apikey
  2. Buka NVDA lalu masuk ke: Menu NVDA -> Alat -> Native Speech Generation
  3. Klik "Pengaturan Kunci API".
  4. Ini akan membuka Pengaturan NVDA langsung di kategori Native Speech Generation.
  5. Tempelkan kunci API Gemini Anda ke dalam kolom GEMINI API Key.
  6. Klik OK untuk menyimpan.

Kunci yang disimpan diamankan menggunakan Windows DPAPI, sehingga nilai terenkripsi tidak dapat didekripsi di komputer Windows lain atau akun pengguna lain.

Untuk deployment tingkat lanjut, Anda juga dapat menyediakan kunci melalui variabel lingkungan GEMINI_API_KEY. Add-on akan menggunakannya secara otomatis saat tidak ada kunci tersimpan.


Cara Menggunakan

Buka dialog dengan:

Elemen Antarmuka Utama


Menghasilkan Ucapan

Mode Pembicara Tunggal

  1. Pilih Pembicara tunggal.
  2. Pilih suara dari daftar Pilih Suara.
  3. Masukkan teks Anda.
  4. Tambahkan instruksi gaya bila diperlukan.
  5. Klik Hasilkan Ucapan.
  6. Audio akan diputar otomatis setelah proses selesai.

Mode Multi-Pembicara

  1. Pilih Multi-pembicara (2).
  2. Untuk setiap pembicara:
  3. Masukkan Nama Pembicara yang unik.
  4. Pilih Suara yang berbeda.
  5. Format teks sehingga setiap baris diawali nama pembicara, lalu diikuti tanda titik dua.

Contoh:

Alice: Hai Bob, apa kabar hari ini? Bob: Aku baik-baik saja, Alice! Cuacanya luar biasa.

  1. Klik Hasilkan Ucapan. Suara akan dipetakan secara otomatis berdasarkan nama pembicara.

Bicara dengan AI (Mode Langsung)

Rasakan percakapan suara dua arah yang alami dengan Gemini.

  1. Atur Suara dan Instruksi Gaya yang diinginkan di dialog utama. (Catatan: Bicara dengan AI saat ini hanya mendukung mode Pembicara Tunggal.)
  2. Klik Bicara dengan AI.
  3. Di jendela baru:
  4. Mulai percakapan: memulai sesi. Bicaralah ke mikrofon Anda.
  5. Hentikan percakapan: mengakhiri sesi.
  6. Grounding dengan Google Search: centang opsi ini untuk mengizinkan Gemini menelusuri web guna mencari jawaban, misalnya berita atau cuaca terkini.
  7. Tingkat penalaran: pilih Tanpa Penalaran, Rendah, Sedang, atau Tinggi.
  8. Tombol mikrofon: membisukan atau mengaktifkan mikrofon Anda.
  9. Volume: menyesuaikan volume pemutaran AI.

Pengaturan Lanjutan


Ringkasan Tombol


Gestur Input

Dapat disesuaikan melalui: Menu NVDA -> Preferensi -> Gestur Input -> Native Speech Generation

Gestur default:


Panduan Pengembangan dan Kontribusi

Jika Anda ingin mengembangkan atau memodifikasi add-on ini, ikuti langkah-langkah berikut.

Pengaturan Lingkungan

uv sync uv run pre-commit run --all-files uv run scons uv run scons pot

SCons 4.10.1, Markdown 3.10, Ruff 0.14.10, Pyright 1.1.407, dan tool build lainnya diinstal dari uv.lock. * GNU Gettext Tools (opsional, disarankan untuk lokalisasi) * Biasanya sudah terpasang di Linux/Cygwin. * Windows: https://gnuwin32.sourceforge.net/downlinks/gettext.php

Dependensi Tambahan

Untuk pengembangan lokal saja, instal dependensi audio untuk Talk With AI langsung ke jalur pustaka add-on menggunakan versi dan arsitektur Python yang sesuai dengan runtime NVDA yang diuji:

python.exe -m pip install google-genai pyaudio --target "D:/myAdd-on/Native-Speech-Generation/addon/globalPlugins/NativeSpeechGeneration/lib"

Sesuaikan jalur tersebut dengan direktori sumber add-on di komputer Anda.

Untuk implementasi Talk With AI versi audio saat ini, Anda tidak memerlukan opencv-python, pillow, atau mss.

Untuk paket rilis, add-on mengunduh arsip dependensi terverifikasi terbaru berdasarkan versi NVDA yang berjalan:

Add-on membaca data SHA-256 dari rilis dependensi GitHub terbaru, menggunakan digest asset rilis atau file checksum. Checksum bawaan yang disetujui hanya disimpan sebagai fallback untuk instalasi pertama ketika lookup rilis terbaru gagal. Reinstall library manual mewajibkan rilis terbaru yang terverifikasi. Folder hasil ekstraksi selalu diinstal sebagai addon/globalPlugins/NativeSpeechGeneration/lib.

Lalu salin file berikut dari instalasi Python Anda ke:

addon/globalPlugins/NativeSpeechGeneration/lib


Berkontribusi

Kontribusi, saran, dan laporan bug sangat kami harapkan.

Kontak