Tài liệu hướng dẫn Vision Assistant Pro

Vision Assistant Pro là một trợ lý AI đa phương thức, nâng cao dành cho NVDA. Nó tận dụng các công cụ AI hàng đầu thế giới để cung cấp khả năng đọc màn hình thông minh, dịch thuật, đọc chính tả bằng giọng nói và phân tích tài liệu.

Add-on này được phát hành cho cộng đồng nhằm tôn vinh Ngày Quốc tế Người khuyết tật.

1. Thiết lập & Cấu hình

Đi tới Menu NVDA > Tùy chọn > Cài đặt > Vision Assistant Pro.

1.1 Cài đặt kết nối

1.2 Định tuyến mô hình nâng cao (Advanced Model Routing)

Khả dụng cho tất cả các nhà cung cấp bao gồm Gemini, OpenAI, Groq, Mistral và Tùy chỉnh.

⚠️ Cảnh báo: Các cài đặt này chỉ dành cho người dùng nâng cao. Nếu bạn không chắc chắn một mô hình cụ thể làm gì, vui lòng để trống phần này. Việc chọn một mô hình không tương thích cho một tác vụ (ví dụ: chọn mô hình chỉ có văn bản cho Thị giác) sẽ gây ra lỗi và khiến add-on ngừng hoạt động.

Chọn "Định tuyến mô hình nâng cao (Theo tác vụ)" để mở khóa quyền kiểm soát chi tiết. Điều này cho phép bạn chọn các mô hình cụ thể từ danh sách thả xuống cho các tác vụ khác nhau:
- Mô hình OCR / Thị giác: Chọn một mô hình chuyên dụng để phân tích hình ảnh.
- Chuyển giọng nói thành văn bản (STT): Chọn một mô hình cụ thể để đọc chính tả.
- Chuyển văn bản thành giọng nói (TTS): Chọn một mô hình để tạo âm thanh.
- Mô hình AI Operator: Chọn một mô hình cụ thể cho các tác vụ điều khiển máy tính tự động.
Lưu ý: Các tính năng không được hỗ trợ (ví dụ: TTS cho Groq) sẽ tự động bị ẩn.

1.3 Cấu hình Endpoint nâng cao (Nhà cung cấp tùy chỉnh)

Chỉ khả dụng khi chọn "Tùy chỉnh".

⚠️ Cảnh báo: Phần này cho phép cấu hình API thủ công và được thiết kế cho người dùng chuyên sâu đang chạy các máy chủ cục bộ hoặc proxy. URL hoặc tên mô hình không chính xác sẽ làm mất kết nối. Nếu bạn không biết chính xác các endpoint này là gì, hãy để trống.

Chọn "Cấu hình Endpoint nâng cao" để nhập chi tiết máy chủ theo cách thủ công. Không giống như các nhà cung cấp gốc, tại đây bạn phải tự nhập các URL và Tên mô hình cụ thể:
- URL danh sách mô hình (Models List URL): Endpoint để tải các mô hình hiện có.
- URL Endpoint OCR/STT/TTS: URL đầy đủ cho các dịch vụ cụ thể (ví dụ: http://localhost:11434/v1/audio/speech).
- Mô hình tùy chỉnh: Nhập thủ công tên mô hình (ví dụ: llama3:8b) cho từng tác vụ.

1.4 Tùy chọn chung

2. Lớp lệnh & Phím tắt

Để ngăn ngừa xung đột bàn phím, add-on này sử dụng một Lớp lệnh (Command Layer).
1. Nhấn NVDA + Shift + V (Phím chính) để kích hoạt lớp lệnh (bạn sẽ nghe thấy tiếng bíp).
2. Nhả các phím, sau đó nhấn một trong các phím đơn sau:

Phím Chức năng Mô tả
Shift + A AI Operator Điều khiển tự động: Yêu cầu AI thực hiện một tác vụ trực tiếp trên màn hình của bạn.
E UI Explorer Click tương tác: Nhận diện và click vào các thành phần giao diện trong bất kỳ ứng dụng nào.
T Dịch thông minh Dịch văn bản dưới con trỏ navigator hoặc vùng đang chọn.
Shift + T Dịch Clipboard Dịch nội dung hiện có trong clipboard.
R Tinh chỉnh văn bản Tóm tắt, Sửa ngữ pháp, Giải thích hoặc chạy các Prompt tùy chỉnh.
V Thị giác đối tượng Mô tả đối tượng navigator hiện tại.
O Thị giác toàn màn hình Phân tích toàn bộ bố cục và nội dung màn hình.
Shift + V Phân tích Video trực tuyến Phân tích video trên YouTube, Instagram, TikTok, hoặc Twitter (X).
D Trình đọc tài liệu Trình đọc nâng cao cho PDF và hình ảnh với tùy chọn chọn phạm vi trang.
F Hành động tệp thông minh Nhận diện theo ngữ cảnh từ các tệp hình ảnh, PDF hoặc TIFF được chọn.
A Chuyển biên âm thanh Chuyển biên các tệp MP3, WAV hoặc OGG thành văn bản.
C Giải CAPTCHA Chụp và giải mã CAPTCHA trên màn hình hoặc đối tượng navigator.
S Đọc chính tả thông minh Chuyển đổi giọng nói thành văn bản. Nhấn để bắt đầu ghi âm, nhấn lần nữa để dừng/gõ văn bản.
L Thông báo trạng thái Thông báo tiến trình hiện tại (ví dụ: "Đang quét...", "Nhàn rỗi").
U Kiểm tra cập nhật Kiểm tra thủ công trên GitHub để tìm phiên bản mới nhất của add-on.
Space Gọi lại kết quả cuối Hiển thị phản hồi cuối cùng của AI trong hộp thoại trò chuyện để xem lại hoặc hỏi tiếp.
H Trợ giúp lệnh Hiển thị danh sách tất cả các phím tắt có sẵn trong lớp lệnh.

2.1 Phím tắt Trình đọc tài liệu (Bên trong Trình xem)

3. Prompt tùy chỉnh & Biến

Bạn có thể quản lý các prompt trong Cài đặt > Prompts > Manage Prompts....

Các biến được hỗ trợ


Lưu ý: Cần có kết nối internet đang hoạt động cho tất cả các tính năng AI. Tài liệu nhiều trang được xử lý tự động.

4. Hỗ trợ & Cộng đồng

Cập nhật những tin tức, tính năng và bản phát hành mới nhất:
- Kênh Telegram: t.me/VisionAssistantPro
- GitHub Issues: Dành cho báo cáo lỗi và yêu cầu tính năng.

5. Người ủng hộ dự án

Lời cảm ơn chân thành đến các thành viên trong cộng đồng đã ủng hộ việc phát triển và duy trì liên tục dự án này thông qua những đóng góp tài chính hào phóng của họ:

Nếu bạn muốn ủng hộ dự án về mặt tài chính và muốn thấy tên mình ở đây, bạn có thể tìm thấy tùy chọn Quyên góp trong menu Công cụ của NVDA (menu con Vision Assistant) hoặc trong quá trình thiết lập sau khi cài đặt.


Những thay đổi trong phiên bản 5.6

Những thay đổi trong phiên bản 5.5.2

Những thay đổi trong phiên bản 5.5 (Bản cập nhật Tự động hóa)

Những thay đổi trong phiên bản 5.0

Những thay đổi trong phiên bản 4.6

Những thay đổi trong phiên bản 4.5

Những thay đổi trong phiên bản 4.0.3

Những thay đổi trong phiên bản 4.0.1

Những thay đổi trong phiên bản 3.6.0

Những thay đổi trong phiên bản 3.5.0

Những thay đổi trong phiên bản 3.1.0

Những thay đổi trong phiên bản 3.0

Những thay đổi trong phiên bản 2.9

Những thay đổi trong phiên bản 2.8

Những thay đổi trong phiên bản 2.7

Những thay đổi trong phiên bản 2.6

Những thay đổi trong phiên bản 2.5

Những thay đổi trong phiên bản 2.1.1

Những thay đổi trong phiên bản 2.1

Những thay đổi trong phiên bản 2.0

Những thay đổi trong phiên bản 1.5

Những thay đổi trong phiên bản 1.0