总下载量:61,000+
Vision Assistant Pro 是一款专为 NVDA 设计的高级多模态 AI 助手。它利用世界顶级的 AI 引擎提供智能屏幕阅读、翻译、语音听写和文档分析功能。
本插件的发布旨在纪念国际残疾人日,以此回馈社区。
请前往 NVDA 菜单 > 偏好设置 > 设置 > Vision Assistant Pro。设置对话框分为 8 个易于访问的标签页:连接、AI 行为、翻译语言、文档阅读器、视频、验证码、提示词 以及 高级。
[selection]、[screen_fg_obj])创建、编辑、重排和预览自定义提示词。导航到 高级 标签页以配置全局插件日志记录:
- 启用专用日志文件: 切换是否将所有模块的运行事件、API 流量和错误记录到单独的文件 (vision_assistant.log) 中。
- 日志级别: 在 调试 (所有细节)、信息 (常规信息)、警告 (仅警告) 和 错误 (仅错误) 之间选择日志详细程度。
- 日志保留时长: 设置自动保留时长以自动清理较旧的日志条目(范围从 1 小时到 90 天)。
- 日志管理控制: 使用 打开日志文件、打开日志文件夹 或 清空日志文件,无需重启 NVDA 或干扰标准 NVDA 日志即可直接检查或清除日志数据。
为防止键盘冲突,本插件使用 命令层。
1. 按 NVDA + Shift + V(主键)激活该层(您会听到“嘟”的一声)。
2. 松开按键,然后按以下单键之一:
| 按键 | 功能 | 描述 |
|---|---|---|
| Shift + A | AI 操作员 | 自主操作: 指示 AI 在您的屏幕上执行任务。再次按下可立即中止正在进行的操作。 |
| E | UI 资源管理器 | 交互式点击: 识别并点击任何应用中的 UI 元素。 |
| T | 智能翻译 | 翻译导航对象光标下的文本或选中文本。 |
| Shift + T | 剪贴板翻译 | 翻译当前剪贴板中的内容。 |
| R | 文本润色 | 摘要、语法修复、解释或运行 自定义提示词。 |
| V | 对象视觉 | 描述当前导航对象。 |
| O | 全屏视觉 | 分析整个屏幕布局和内容。 |
| Shift + V | 视频分析 | 分析本地视频文件或在线 YouTube、Instagram、TikTok 或 Twitter (X) 视频。 |
| Control + V | 本地屏幕录制 | 录制屏幕静音视频并分析其中的操作和布局。 |
| D | 文档阅读器 | 具有页面范围选择功能的高级 PDF 和图像阅读器。 |
| F | 智能文件操作 | 基于上下文从选定的图像、PDF 或 TIFF 文件中进行识别。 |
| M | 媒体转录与配音 | 将媒体文件(MP3, WAV, MP4 等)转录或配音为您的目标语言。 |
| C | 验证码求解器 | 捕获并解析验证码。 |
| Shift + C | 直接对话 | 打开一个与 AI 直接进行文本对话的界面。 |
| S | 智能听写 | 将语音转换为文本。按一次开始录音,再按一次停止并打出文本。 |
| Control + T | 语音翻译 | 根据您的语言设置转录、翻译并打出结果。 |
| Control + L | 实时助手 | 实时 Copilot (仅限 Gemini): 开始或结束与 AI 助手的实时语音和屏幕对话。 |
| I | 状态报告 | 播报当前进度(例如“正在扫描...”、“空闲”)。 |
| L | 标记对象 | 语义 AI 标记: 永久标记当前聚焦的元素/图标。 |
| Shift + L | 管理/扫描标记 | 打开标记管理器(如果存在标记)或扫描应用中未命名的元素。 |
| U | 检查更新 | 手动检查 GitHub 以获取插件的最新版本。 |
| Space | 调用上一次结果 | 在聊天对话框中显示上一次 AI 回复,以便查看或进行后续提问。 |
| H | 命令帮助 | 显示所有可用快捷键的列表。 |
| Alt + S | 设置 | 打开 Vision Assistant Pro 设置对话框。 |
| Alt + Q | 耗尽密钥报告 | 报告超出每日配额的 Gemini API 密钥数量及其重置时间。 |
| Alt + M | 路由审计 | 报告当前在高级路由中选定的 AI 模型。 |
| 方向键 上/下 | 快捷设置导航 | 在命令层中在快捷设置类别(提供商、模型等)之间切换。 |
| 方向键 左/右 | 更改快捷设置 | 更改当前选中的快捷设置的值。 |
AI 操作员 将 Vision Assistant Pro 从被动阅读器转变为可以代表您与计算机交互的主动助手。您可以要求它描述屏幕、回答关于所见内容的问题,甚至接管控制——使用自然语言指令点击按钮、拖动项目、输入文本并在应用程序中导航。
最大的优势?它在完全无障碍缺失的软件中也能完美工作。如果您卡在自定义应用、远程桌面或屏幕阅读器完全静音的网站中,操作员完全不受影响。因为它能直观地“看到”屏幕,所以可以找到、读取并与零无障碍标记的元素进行交互。
操作员理解广泛的命令:
- 描述与回答:“描述屏幕布局” 或 “错误信息说了什么?”
- 点击:“点击保存按钮”
- 右键点击:“右键点击文件”
- 双击:“双击文档”
- 拖放:“将文档拖到 Archive 文件夹”
- 输入:“在搜索框中输入 'Hello World'”
- 滚动:“向下滚动三次”
- 按键:“按 Enter”、“按 Tab”、“按 Escape”
- 多步骤任务:“打开文件资源管理器,找到报告,并将其重命名为 final.pdf”
注意: 视频分析和旁白描述功能严格由 Google Gemini 提供商驱动。请确保插件设置中您的活动提供商设置为 Google Gemini。
Vision Assistant Pro 引入了专为视障用户设计的强大视频处理功能。它可以分析在线视频和本地屏幕录像,提供高度详细的视觉描述,并生成专业的旁白描述脚本 (SRT)。
如果您在屏幕上遇到无声视频、动画或教程,您可以直接捕获它:
1. 按 NVDA + Shift + V 进入命令层,然后按 Control + V。
2. 插件将在后台静音录制您的屏幕。
3. 再次按 Control + V 停止录制。
4. AI 随后将分析录制的视频片段,并对场景、角色和操作提供高度详细的描述。
您可以分析本地视频文件和在线视频。只需在 Windows 文件资源管理器中选中本地视频文件,或将在线视频链接复制到剪贴板。您也可以在任何地方(例如媒体播放器内部)按 Shift + V 打开对话框,手动浏览视频文件或粘贴 URL。
- 支持的在线平台: YouTube, Instagram, TikTok, 和 Twitter (X)。
- AI 将自动检测本地文件或 URL,处理视频,并提供全面的视觉描述和音频总结。
为了获得更有条理的体验,插件可以生成标准 SubRip (SRT) 格式的专业旁白描述脚本。
- 智能间隙对齐: AI 会监听音频轨道,并将视觉描述专门锚定到自然停顿和静音间隙,以明智地减少与原声对话的重叠。
- 角色追踪: 引擎执行预处理 pass,根据面部特征提取不同的角色。它构建了一个全局字典,以便在不同场景之间准确跟踪和标注角色而不会混淆。
- 逐字文本 OCR: 屏幕上出现的任何文本(标志、手机、字幕)都会被严格逐字引用。
- 如何使用: 要听取生成的字幕,只需将 .srt 文件放在与视频文件相同的文件夹中,并给它赋予完全相同的名称。然后配置您的媒体播放器(如 VLC 或 PotPlayer)在播放期间将字幕文本直接发送到您的屏幕阅读器或 TTS 引擎。
除了仅仅创建基于文本的 SRT 文件外,插件还可以通过将描述合成语音并与视频混合,作为完整的旁白描述制作工具。您现在可以选择 Gemini Live TTS 作为语音引擎,它利用 Gemini Live API 生成高度逼真且无限制的语音旁白。在为本地视频文件生成 MP3 时,您有多种混合模式:
- 标准旁白 (混合原声): 旁白语音直接叠加在视频的原声之上。系统会询问您是否应用 音频降低 (Ducking)(在旁白期间降低背景音量),以确保旁白清晰。
- 扩展旁白 (暂停原声): 引擎在旁白描述期间暂停原始视频音频,确保您不会错过原始对话或 AI 旁白的任何一个字。
- YouTube 视频: 对于 YouTube 来源(未在本地下载),导出的 MP3 将严格仅包含同步的 AI 语音轨道,而不包含背景视频音频。
音频转录器已完全重构,以支持音频和视频文件(MP3, WAV, MP4, MKV 等)。在命令层中按 M 选择媒体文件,并从 3 种不同模式中选择一种:
1. 转录 (原始语言):准确转录原始语言的口语。
2. 转录并翻译 (目标语言):转录语音并将其翻译为您的目标语言。
3. 配音并翻译 (目标语言) (仅限 Gemini):一项强大的新功能,可转录语音、翻译为目标语言,并使用插件的 TTS 引擎合成口语配音。
Vision Assistant Pro 包含针对多页 PDF、复杂图像甚至 iPhone HEIC 格式进行高度优化的文档阅读器。
您不需要一次性阅读庞大的文档。输入页面范围(例如 1-20),AI 将在后台处理所有页面。如果 NVDA 崩溃或您中断了扫描,插件将记住您的进度并提供从上次停止的地方 恢复 的选项!
您并不总是需要先打开文档。在 Windows 文件资源管理器中,只需突出显示 PDF 或图像,然后在命令层中按 D (文档阅读器) 或 F (智能文件操作)。插件将立即跳过文件对话框并开始处理突出显示的文件。
在文档阅读器窗口打开时,您可以使用以下快捷键:
- Ctrl + PageDown: 移至下一页。
- Ctrl + PageUp: 移至上一页。
- Alt + A: 打开聊天对话框以针对文档内容提问。
- Alt + R: 强制使用您的活动提供商 使用 AI 重新扫描。
- Alt + G: 生成并保存高质量音频文件 (WAV/MP3)。(如果提供商不支持 TTS 则隐藏)。
- Alt + S / Ctrl + S: 将提取的文本保存为 TXT 或 HTML 文件。
卡在到处都是“未标记按钮”的应用程序中?语义 AI 标记引擎永久解决了这个问题。
将屏幕阅读器聚焦在未标记的图形或按钮上,然后在命令层中按 L。AI 将从视觉上观察按钮,确定其功能,并施加永久标记。
与较旧的屏幕阅读器标记工具不同,本插件使用高级的混合“对象签名”系统 (AutomationId/ControlID)。您的自定义标记将在窗口缩放、显示器切换和应用更新后依然保持有效!
按 Shift + L 一次性扫描整个活动窗口。AI 将找到所有未标记的元素并在一次运行中智能命名它们。您稍后可以在内置的标记管理器中管理、重命名或批量删除这些标记。
需要与某个元素交互而无需手动导航到它?按 E 激活 UI 资源管理器。AI 将扫描屏幕并生成每个可点击元素的无障碍列表(忽略诸如任务栏之类的系统噪音)。从列表中选择一个项目,插件将立即为您点击它。
实时助手将 Vision Assistant Pro 转变为实时交互式 Copilot。
(注意:此功能仅限 Google Gemini 和兼容 Gemini 的自定义提供商)。
您可以在 设置 > 提示词 > 管理提示词... 中管理提示词。
[selection]:当前选中的文本。[clipboard]:剪贴板内容。[clipboard_image]:剪贴板中的当前图像。[screen_obj]:导航对象的截图。[screen_fg_obj]:活动前台窗口的截图。[screen_full]:全屏截图。[file_ocr]:选择用于文本提取的图像/PDF 文件。[file_read]:选择用于阅读的文档 (TXT, 代码, PDF)。[file_audio]:选择用于分析的音频文件 (MP3, WAV, OGG)。{target_lang}:当前目标语言。{source_lang}:当前源语言。{response_lang}:当前 AI 响应语言。{swap_target}:智能对调翻译的备用语言。{swap_instruction}:智能对调翻译指令块。Vision Assistant Pro 具备丰富的先进工具。以下是一些常见场景,可帮助您选择合适的工具:
场景:您想了解复杂窗口或非无障碍应用的完整布局。
解决方案: 按 O (全屏视觉)。AI 将分析整个屏幕并准确描述元素、文本和按钮的位置。
场景:您在网页上找到了一张图像或在文档中发现了未标记的图形。
解决方案: 将导航对象移动到该图形上并按 V (对象视觉)。AI 将专门描述该图像包含的内容。
场景:您想观看带有旁白描述的电影或视频剪辑。
解决方案: 在视频上按 Shift + V 并选择 “生成旁白描述 (SRT 文件)”。完成后,点击 “生成同步旁白 (MP3)” 并选择 “扩展旁白”。插件将创建一个音频轨道,智能地暂停电影的对话来描述视觉场景。
场景:您遇到了一个到处都是“未标记按钮”的应用。
解决方案: 按 L 使用 AI 永久标记特定按钮。或者,按 Shift + L 一次性扫描并标记整个窗口。如果您只是想快速点击某物,按 E (UI 资源管理器) 以获取所有可点击项的列表。
场景:您需要绕过不可访问的验证码。
解决方案: 按 C (验证码求解器)。AI 将自动捕获验证码,求解它,并将答案填入正确的字段。
场景:您想阅读一份长达 50 页的 PDF 文档。
解决方案: 按 D (文档阅读器),将提供商设置为 Google Gemini,并输入页面范围 1-50。插件将在后台准确提取文本。
场景:您正在屏幕上观看无声视频教程或动画。
解决方案: 按 Control + V 开始录制屏幕。让教程播放,然后再次按 Control + V。AI 将准确解释展示的内容。
场景:您遇到意外错误、API 连接失败,或者想要诊断自定义本地服务器的问题。
解决方案: 前往 设置 > 高级,勾选 “启用专用日志文件”,并将 日志级别 设置为 “调试”。再次执行操作,然后点击 “打开日志文件” 检查技术细节,或将 vision_assistant.log 附加到支持工单。
注意: 所有 AI 功能都需要有效的互联网连接。多页文档会自动处理。
获取最新新闻、功能和发布信息:
- Telegram 频道: t.me/VisionAssistantPro
- GitHub Issues: 用于 Bug 报告和功能请求。
在打开 GitHub Issue 或寻求支持时,请提供关于您的活动 AI 提供商、模型和 NVDA 版本的详细信息。如果您遇到连接问题或意外崩溃,请在 设置 > 高级 中启用专用日志文件,重现问题,并附上您的 vision_assistant.log 文件,以帮助我们更快地解决问题。
衷心感谢以下社区成员通过慷慨的资金捐助支持本项目的持续开发与维护:
UQDd...CnMY)如果您希望在经济上支持本项目并在此看到您的名字,您可以在 NVDA 工具菜单 (Vision Assistant 子菜单) 中找到 捐赠 选项,或在安装后的设置过程中找到该选项。
Insert+Shift+V) 现在具有持久性和高度交互性!您可以使用 上/下 方向键在快捷设置(提供商、模型、AI 响应语言、TTS 模型)之间导航,并使用 左/右 方向键通过智能简洁的语音反馈即时更改其值。您的选择会立即生效(包括在必要时自动启用高级路由),且图层在您配置期间保持激活状态。Shift+C):向图层添加了新命令!按 Shift+C 可立即打开“直接对话”窗口。这提供了一个干净的、基于文本的与 AI 对话的界面,无需图像或文档作为起始点。Space 恢复上一次结果会丢失后续的聊天历史记录。现在,插件会在全局追踪您的对话。如果您聊天、关闭对话框并按 Space 恢复它,您的整个来回历史记录都会完美恢复!适用于直接对话、视觉分析、文档聊天和翻译。Control+T):添加了强大的新功能!根据配置的源语言和目标语言,录制语音并使用 AI 即时翻译并打出结果。vision_assistant.log) 中。支持可配置的日志详细级别(调试、信息、警告、错误)、自动保留时长(1 小时到 90 天),以及从设置中直接打开或清除日志,对性能零影响且不干扰 standard NVDA 日志。embedding、bison、gecko、audio、realtime、babbage、moderation、deep、antigravity、computer),以确保主聊天模型下拉列表保持完美干净且面向未来,同时保持所有专用模型在高级路由部分中可访问。Alt + S):立即打开 Vision Assistant Pro 设置对话框。Alt + Q):报告超出每日配额的 Gemini API 密钥的准确数量,识别它们在哪个特定模型上耗尽,并播报其准确的重置时间。Alt + M):审计并播报您当前的高级路由配置,读取为专用任务积极选择的模型(跳过默认设置)。Control+V):您现在可以直接从屏幕录制静音视频。AI 将分析录制的片段,并对场景、布局和操作提供高度详细的描述。gemini_video_model, custom_video_model)。[screen_fg_obj] 变量:添加了自定义提示词变量,以仅捕获活动前台窗口的截图,而不是整个屏幕。/v1/ocr 端点批量处理,而单页图像则直接处理,无需不必要的 PDF 转换。/v1/models 列表端点的自定义端点(例如 Cloudflare AI Gateway)的完全兼容性。mouse_event API 替换为现代 Windows SendInput API,带来与现代应用程序、UAC 保护窗口和高 DPI 显示器显著更高的兼容性。MOUSEEVENTF_VIRTUALDESK 标志),确保无论目标应用程序在哪个显示器上都能精确定位。.heic 和 .heif 文件进行 AI 描述、OCR 或文档阅读,无需事先转换。