Dokumentasi Vision Assistant Pro

Total Unduhan: 61.000+

Vision Assistant Pro adalah asisten AI multimodal tingkat lanjut untuk NVDA. Add-on ini memakai mesin AI kelas dunia untuk membantu pembacaan layar cerdas, penerjemahan, dikte suara, dan analisis dokumen.

Add-on ini dirilis untuk komunitas dalam rangka memperingati Hari Internasional Penyandang Disabilitas.

1. Pengaturan & Konfigurasi

Buka Menu NVDA > Preferensi > Pengaturan > Vision Assistant Pro. Dialog pengaturan tersusun dalam 8 tab yang aksesibel: Koneksi, Perilaku AI, Bahasa Terjemahan, Pembaca Dokumen, Video, CAPTCHA, Prompt, dan Lanjutan.

1.1 Tab Koneksi

1.2 Tab Perilaku AI

1.3 Tab Bahasa Terjemahan

1.4 Tab Pembaca Dokumen

1.5 Tab Video

1.6 Tab CAPTCHA

1.7 Tab Prompt

1.8 Tab Lanjutan & Pencatatan Global

Buka tab Lanjutan untuk mengatur pencatatan global add-on:
- Aktifkan file log khusus: Mencatat semua peristiwa operasional, lalu lintas API, dan error dari seluruh modul add-on ke file terpisah (vision_assistant.log).
- Tingkat Log: Pilih tingkat perincian antara Debug (Semua Detail), Info (Informasi Umum), Peringatan (Hanya Peringatan), dan Error (Hanya Error).
- Simpan Log Selama: Atur masa penyimpanan dari 1 jam hingga 90 hari. Entri yang lebih lama akan dibersihkan secara otomatis.
- Kontrol Pengelolaan Log: Gunakan Buka File Log, Buka Folder Log, atau Bersihkan File Log untuk memeriksa atau membersihkan data log tanpa memulai ulang NVDA dan tanpa mengganggu log standar NVDA.

2. Lapisan Perintah & Pintasan

Untuk mencegah konflik tombol keyboard, add-on ini memakai Lapisan Perintah.
1. Tekan NVDA + Shift + V (Tombol Utama) untuk mengaktifkan lapisan (Anda akan mendengar bunyi bip).
2. Lepaskan tombol, lalu tekan salah satu tombol tunggal berikut:

Tombol Fungsi Deskripsi
Shift + A Operator AI Operasi Mandiri: Minta AI melakukan tugas di layar Anda. Tekan lagi untuk langsung membatalkan operasi yang sedang berjalan.
E UI Explorer Klik Interaktif: Mengenali dan mengklik elemen UI di aplikasi apa pun.
T Penerjemah Cerdas Menerjemahkan teks di kursor navigator atau teks yang dipilih.
Shift + T Penerjemah Papan Klip Menerjemahkan isi papan klip saat ini.
R Penyempurna Teks Meringkas, memperbaiki tata bahasa, menjelaskan, atau menjalankan Prompt Kustom.
V Visi Objek Mendeskripsikan Objek Navigator saat ini.
O Visi Layar Penuh Menganalisis tata letak dan isi seluruh layar.
Shift + V Analisis Video Menganalisis file video lokal atau video online YouTube, Instagram, TikTok, atau Twitter (X).
Control + V Perekaman Video Lokal Merekam video tanpa suara dari layar Anda dan menganalisis tindakan serta tata letaknya.
D Pembaca Dokumen Pembaca lanjutan untuk PDF dan gambar dengan pilihan rentang halaman.
F Tindakan File Cerdas Mengenali konteks dari file gambar, PDF, atau TIFF yang dipilih.
M Transkripsi dan Sulih Suara Media Mentranskripsikan atau menyulihsuarakan file audio/video ke bahasa target.
C Pemecah CAPTCHA Menangkap dan memecahkan CAPTCHA.
Shift + C Obrolan Langsung Membuka antarmuka obrolan berbasis teks secara langsung dengan AI.
S Dikte Cerdas Mengubah ucapan menjadi teks. Tekan untuk mulai merekam, tekan lagi untuk berhenti dan mengetik hasilnya.
Control+T Terjemahan Suara Mentranskripsikan, menerjemahkan, lalu mengetik hasil sesuai pengaturan bahasa.
Control+L Asisten Langsung Kopilot Real-time (Khusus Gemini): Memulai atau mengakhiri percakapan suara dan layar langsung dengan asisten AI.
I Laporan Status Mengumumkan progres saat ini (misalnya, "Memindai...", "Siaga").
L Label Objek Pelabelan AI Semantik: Memberi label permanen pada elemen/ikon fokus saat ini.
Shift + L Kelola/Pindai Label Membuka Pengelola Label (jika label sudah ada) atau memindai aplikasi untuk elemen tanpa nama.
U Cek Pembaruan Mengecek versi terbaru add-on di GitHub secara manual.
Space Buka Hasil Terakhir Menampilkan respons AI terakhir di dialog obrolan untuk ditinjau atau ditindaklanjuti.
H Bantuan Perintah Menampilkan daftar semua pintasan yang tersedia.
Alt + S Pengaturan Membuka dialog pengaturan Vision Assistant Pro secara instan.
Alt + Q Laporan Kunci Kuota Habis Melaporkan jumlah kunci API Gemini yang telah melebihi kuota harian beserta waktu pengaturannya ulang.
Alt + M Audit Perutean Melaporkan model AI yang saat ini dipilih dalam perutean lanjutan.
Up / Down Navigasi Pengaturan Cepat Berpindah antar kategori Pengaturan Cepat di dalam lapisan.
Left / Right Ubah Pengaturan Cepat Mengubah nilai Pengaturan Cepat yang sedang dipilih.

3. Operator AI - Kontrol Komputer Mandiri

Operator AI mengubah Vision Assistant Pro dari pembaca pasif menjadi asisten aktif yang dapat berinteraksi dengan komputer untuk Anda. Anda dapat memintanya mendeskripsikan layar, menjawab pertanyaan tentang apa yang dilihatnya, atau bahkan mengambil kendali - mengklik tombol, menyeret item, mengetik teks, dan menavigasi aplikasi dengan perintah bahasa alami.

Keunggulan terbesarnya adalah kemampuan bekerja di perangkat lunak yang sama sekali tidak aksesibel. Jika Anda terjebak di aplikasi kustom, desktop jarak jauh, atau situs web yang membuat pembaca layar benar-benar diam, Operator AI tetap dapat membantu. Karena "melihat" layar secara visual, fitur ini dapat menemukan, membaca, dan berinteraksi dengan elemen tanpa label aksesibilitas.

Cara Kerja

  1. Tekan NVDA + Shift + V, lalu Shift + A (atau gunakan pintasan langsung) untuk membuka dialog Operator AI.
  2. Ketik tindakan yang Anda inginkan dengan bahasa biasa, misalnya "Klik tombol Simpan", "Apa isi pesan error?", atau "Ubah nama file menjadi final.pdf".
  3. AI akan menganalisis layar, mengenali elemen yang sesuai, lalu menjalankan tindakan atau memberikan jawaban. Jika tugas memerlukan beberapa langkah, Operator AI akan terus bekerja hingga selesai.
  4. Tekan Shift + A lagi kapan saja untuk langsung membatalkan operasi yang sedang berlangsung.

Tindakan yang Didukung

Operator AI memahami beragam perintah:
- Deskripsikan & Jawab: "Deskripsikan tata letak layar" atau "Apa isi pesan error?"
- Klik: "Klik tombol Simpan"
- Klik Kanan: "Klik kanan file tersebut"
- Klik Ganda: "Klik ganda dokumen tersebut"
- Seret & Lepas: "Seret dokumen ke folder Arsip"
- Ketik: "Ketik 'Hello World' di kotak pencarian"
- Gulir: "Gulir ke bawah tiga kali"
- Tekan Tombol: "Tekan Enter", "Tekan Tab", "Tekan Escape"
- Tugas Bertahap: "Buka File Explorer, cari laporan, lalu ubah namanya menjadi final.pdf"

Catatan Penting

4. Analisis Video & Deskripsi Audio

Catatan: Fitur Analisis Video dan Deskripsi Audio didukung sepenuhnya oleh penyedia Google Gemini. Pastikan penyedia aktif Anda di pengaturan add-on diatur ke Google Gemini.

Vision Assistant Pro memperkenalkan kemampuan pemrosesan video andal yang dirancang khusus untuk pengguna tunanetra. Add-on ini dapat menganalisis video online dan rekaman layar lokal untuk memberikan deskripsi visual yang sangat mendetail dan menghasilkan skrip Deskripsi Audio (SRT) profesional.

4.1 Perekaman Layar Lokal (Control + V)

Jika Anda menemukan video tanpa suara, animasi, atau tutorial di layar, Anda dapat merekamnya secara langsung:
1. Tekan NVDA + Shift + V untuk masuk ke Lapisan Perintah, lalu tekan Control + V.
2. Add-on akan merekam layar Anda secara diam-diam di latar belakang.
3. Tekan Control + V lagi untuk menghentikan perekaman.
4. AI kemudian akan menganalisis segmen video yang direkam dan memberikan deskripsi yang sangat mendetail tentang pemandangan, karakter, dan tindakan.

4.2 Analisis Video (Shift + V)

Anda dapat menganalisis file video lokal maupun video online. Cukup pilih file video lokal di Windows Explorer, atau salin tautan video online ke papan klip Anda. Anda juga dapat menekan Shift + V di mana saja (seperti di dalam pemutar media) untuk membuka dialog tempat Anda dapat menelusuri file video atau menempelkan URL secara manual.
- Platform Online yang Didukung: YouTube, Instagram, TikTok, dan Twitter (X).
- AI akan mendeteksi file lokal atau URL secara otomatis, memproses video, dan memberikan deskripsi visual serta ringkasan audio yang komprehensif.

4.3 Pembuatan Deskripsi Audio (SRT)

Untuk pengalaman yang lebih terstruktur, add-on dapat menghasilkan skrip Deskripsi Audio profesional dalam format standar SubRip (SRT).
- Pengaturan Waktu Jeda Cerdas: AI mendengarkan trek audio dan menempatkan deskripsi visual pada jeda hening alami untuk meminimalkan tumpang tindih dengan dialog.
- Pelacakan Karakter: Mesin melakukan tahap awal untuk mengekstrak karakter yang berbeda berdasarkan fitur wajah yang tidak berubah. Ini membangun kamus global untuk melacak dan melabeli karakter secara akurat di berbagai adegan tanpa kebingungan.
- OCR Teks Verbatim: Teks apa pun yang muncul di layar (papan tanda, ponsel, kredit) dikutip secara tepat apa adanya.
- Cara Menggunakan: Untuk mendengarkan subtitel yang dihasilkan, cukup letakkan file .srt di folder yang sama dengan file video Anda dan beri nama yang sama persis. Kemudian, konfigurasikan pemutar media Anda (misalnya, VLC atau PotPlayer) untuk mengarahkan teks subtitel langsung ke pembaca layar atau mesin TTS Anda selama pemutaran.

4.4 Narasi Audio Tersinkron (Ekspor MP3)

Selain membuat file SRT berbasis teks, add-on ini berfungsi sebagai alat produksi Deskripsi Audio lengkap dengan mengubah deskripsi menjadi ucapan dan mencampurnya dengan video. Anda dapat memilih Gemini Live TTS sebagai mesin suara. Mesin ini menggunakan Gemini Live API untuk menghasilkan narasi suara yang sangat realistis tanpa batas. Saat membuat MP3 untuk file video lokal, tersedia beberapa mode pencampuran:
- AD Standar (Campur Suara): Narasi diputar langsung di atas audio video. Anda akan ditanya apakah ingin menerapkan Peredaman Audio (menurunkan volume latar belakang selama deskripsi) agar narasi terdengar jelas.
- AD Diperpanjang (Jeda Audio): Mesin menjeda audio video asli selama deskripsi, memastikan Anda tidak pernah melewatkan satu kata pun dari dialog asli atau narasi AI.
- Video YouTube: Untuk sumber YouTube (yang tidak diunduh secara lokal), ekspor MP3 hanya akan berisi trek suara AI yang disinkronkan tanpa audio latar belakang video.

5. Transkripsi dan Sulih Suara Media (M)

Transkripsi Audio telah dibangun ulang sepenuhnya agar mendukung file audio dan video (MP3, WAV, MP4, MKV, dan lainnya). Tekan M di Lapisan Perintah untuk memilih file media dan salah satu dari 3 mode operasi berikut:
1. Transkripsikan (Bahasa Asli): Mentranskripsikan ucapan secara akurat dalam bahasa aslinya.
2. Transkripsikan dan Terjemahkan (Bahasa Target): Mentranskripsikan ucapan lalu menerjemahkannya ke bahasa target yang telah Anda atur.
3. Sulih Suara dan Terjemahkan (Bahasa Target) (Khusus Gemini): Mentranskripsikan ucapan, menerjemahkannya ke bahasa target, lalu membuat sulih suara dengan mesin TTS add-on.

6. Pembaca Dokumen & Gambar Lanjutan

Vision Assistant Pro menyertakan Pembaca Dokumen yang sangat dioptimalkan yang dirancang untuk PDF multi-halaman, gambar kompleks, dan bahkan format HEIC iPhone.

6.1 Pemrosesan Batch & Melanjutkan

Anda tidak perlu membaca dokumen besar sekaligus. Masukkan rentang halaman (misalnya, 1-20), dan AI akan memproses semua halaman di latar belakang. Jika NVDA crash atau Anda menghentikan pemindaian, add-on akan mengingat progres Anda dan menawarkan untuk Melanjutkan (Resume) tepat di tempat Anda berhenti!

6.2 Tindakan File Cerdas

Anda tidak selalu harus membuka dokumen terlebih dahulu. Di Windows File Explorer, cukup sorot PDF atau gambar dan tekan D (Pembaca Dokumen) atau F (Tindakan File Cerdas) di dalam Lapisan Perintah. Add-on akan langsung melewati dialog file dan mulai memproses file yang disorot.

6.3 Pintasan Penampil Dokumen

Ketika jendela Pembaca Dokumen terbuka, Anda dapat menggunakan pintasan berikut:
- Ctrl + PageDown: Pindah ke halaman berikutnya.
- Ctrl + PageUp: Pindah ke halaman sebelumnya.
- Alt + A: Buka dialog obrolan untuk mengajukan pertanyaan tentang dokumen.
- Alt + R: Paksa Pindai ulang dengan AI menggunakan penyedia aktif Anda.
- Alt + G: Hasilkan dan simpan file audio berkualitas tinggi (WAV/MP3). (Disembunyikan jika penyedia tidak mendukung TTS).
- Alt + S / Ctrl + S: Simpan teks hasil ekstraksi sebagai file TXT atau HTML.

7. Pelabelan AI Semantik & UI Explorer

Terjebak dalam aplikasi dengan banyak "tombol tanpa label"? Mesin Pelabelan AI Semantik menyelesaikannya secara permanen.

7.1 Pelabelan Objek Permanen (L)

Fokuskan pembaca layar Anda pada grafik atau tombol tanpa label dan tekan L di Lapisan Perintah. AI akan melihat tombol tersebut secara visual, menentukan fungsinya, dan menerapkan label permanen.
Berbeda dengan alat pelabelan pembaca layar lama, add-on ini menggunakan sistem hibrida "Object Signature" (AutomationId/ControlID) yang canggih. Label kustom Anda akan tetap bertahan meskipun jendela diubah ukurannya, monitor dipindahkan, dan aplikasi diperbarui!

7.2 Pemindaian Aplikasi Penuh (Shift + L)

Tekan Shift + L untuk memindai seluruh jendela aktif sekaligus. AI akan menemukan semua elemen tanpa label dan menamainya secara cerdas sekaligus. Anda nantinya dapat mengelola, mengganti nama, atau menghapus label ini secara massal dari Pengelola Label bawaan.

7.3 UI Explorer (E)

Perlu berinteraksi dengan suatu elemen tanpa mencarinya secara manual? Tekan E untuk mengaktifkan UI Explorer. AI akan memindai layar dan menghasilkan daftar yang aksesibel dari setiap elemen yang dapat diklik (mengabaikan gangguan sistem seperti taskbar). Pilih item dari daftar, dan add-on akan langsung mengkliknya untuk Anda.

8. Asisten Suara Langsung

Asisten Langsung mengubah Vision Assistant Pro menjadi kopilot interaktif real-time.
(Catatan: Fitur ini eksklusif untuk Google Gemini dan penyedia Kustom yang kompatibel dengan Gemini).

9. Prompt Kustom & Variabel

Anda dapat mengelola prompt di Pengaturan > Prompt > Kelola Prompt....

Variabel yang Didukung

10. Kasus Penggunaan di Dunia Nyata (Fitur mana yang harus saya gunakan?)

Vision Assistant Pro dilengkapi dengan berbagai alat canggih. Berikut adalah beberapa skenario umum untuk membantu Anda memilih fitur yang tepat:


Catatan: Koneksi internet aktif diperlukan untuk semua fitur AI. Dokumen multi-halaman diproses secara otomatis.

11. Dukungan & Komunitas

Ikuti perkembangan berita terbaru, fitur, dan rilis:
- Saluran Telegram: t.me/VisionAssistantPro
- GitHub Issues: Untuk laporan bug dan permintaan fitur.

Melaporkan Bug & Log

Saat meminta dukungan, sertakan penyedia AI, model, dan versi NVDA. Untuk masalah koneksi atau crash, aktifkan file log khusus di Pengaturan > Lanjutan, ulangi masalahnya, lalu lampirkan vision_assistant.log.

12. Pendukung Proyek

Terima kasih sebesar-besarnya kepada anggota komunitas yang mendukung pengembangan dan pemeliharaan proyek ini melalui kontribusi finansial:

Jika Anda ingin mendukung proyek secara finansial dan ingin nama Anda ditampilkan di sini, buka opsi Donasi di menu Tools NVDA (submenu Vision Assistant) atau pada proses pengaturan setelah instalasi.


Perubahan untuk 2026.08.06

Perubahan untuk 2026.07.15

Perubahan untuk 7.0.0

Perubahan untuk 6.5.0

Perubahan untuk 6.1.2

Perubahan untuk 6.1.1

Perubahan untuk 6.1.0

Perubahan untuk 6.0

Perubahan untuk 5.6

Perubahan untuk 5.5.2

Perubahan untuk 5.5 (Pembaruan Otomasi)

Perubahan untuk 5.0

Perubahan untuk 4.6

Perubahan untuk 4.5

Perubahan untuk 4.0.3

Perubahan untuk 4.0.1

Perubahan untuk 3.6.0

Perubahan untuk 3.5.0

Perubahan untuk 3.1.0

Perubahan untuk 3.0

Perubahan untuk 2.9

Perubahan untuk 2.8

Perubahan untuk 2.7

Perubahan untuk 2.6

Perubahan untuk 2.5

Perubahan untuk 2.1.1

Perubahan untuk 2.1

Perubahan untuk 2.0

Perubahan untuk 1.5

Perubahan untuk 1.0