Vision Assistant Pro 文档

总下载量:61,000+

Vision Assistant Pro 是一款专为 NVDA 设计的高级多模态 AI 助手。它利用世界顶级的 AI 引擎提供智能屏幕阅读、翻译、语音听写和文档分析功能。

本插件的发布旨在纪念国际残疾人日,以此回馈社区。

1. 设置与配置

请前往 NVDA 菜单 > 偏好设置 > 设置 > Vision Assistant Pro。设置对话框分为 8 个易于访问的标签页:连接AI 行为翻译语言文档阅读器视频验证码提示词 以及 高级

1.1 连接标签页

1.2 AI 行为标签页

1.3 翻译语言标签页

1.4 文档阅读器标签页

1.5 视频标签页

1.6 验证码标签页

1.7 提示词标签页

1.8 高级标签页与全局日志

导航到 高级 标签页以配置全局插件日志记录:
- 启用专用日志文件: 切换是否将所有模块的运行事件、API 流量和错误记录到单独的文件 (vision_assistant.log) 中。
- 日志级别:调试 (所有细节)信息 (常规信息)警告 (仅警告)错误 (仅错误) 之间选择日志详细程度。
- 日志保留时长: 设置自动保留时长以自动清理较旧的日志条目(范围从 1 小时到 90 天)。
- 日志管理控制: 使用 打开日志文件打开日志文件夹清空日志文件,无需重启 NVDA 或干扰标准 NVDA 日志即可直接检查或清除日志数据。

2. 命令层与快捷键

为防止键盘冲突,本插件使用 命令层
1. 按 NVDA + Shift + V(主键)激活该层(您会听到“嘟”的一声)。
2. 松开按键,然后按以下单键之一:

按键 功能 描述
Shift + A AI 操作员 自主操作: 指示 AI 在您的屏幕上执行任务。再次按下可立即中止正在进行的操作。
E UI 资源管理器 交互式点击: 识别并点击任何应用中的 UI 元素。
T 智能翻译 翻译导航对象光标下的文本或选中文本。
Shift + T 剪贴板翻译 翻译当前剪贴板中的内容。
R 文本润色 摘要、语法修复、解释或运行 自定义提示词
V 对象视觉 描述当前导航对象。
O 全屏视觉 分析整个屏幕布局和内容。
Shift + V 视频分析 分析本地视频文件或在线 YouTubeInstagramTikTokTwitter (X) 视频。
Control + V 本地屏幕录制 录制屏幕静音视频并分析其中的操作和布局。
D 文档阅读器 具有页面范围选择功能的高级 PDF 和图像阅读器。
F 智能文件操作 基于上下文从选定的图像、PDF 或 TIFF 文件中进行识别。
M 媒体转录与配音 将媒体文件(MP3, WAV, MP4 等)转录或配音为您的目标语言。
C 验证码求解器 捕获并解析验证码。
Shift + C 直接对话 打开一个与 AI 直接进行文本对话的界面。
S 智能听写 将语音转换为文本。按一次开始录音,再按一次停止并打出文本。
Control + T 语音翻译 根据您的语言设置转录、翻译并打出结果。
Control + L 实时助手 实时 Copilot (仅限 Gemini): 开始或结束与 AI 助手的实时语音和屏幕对话。
I 状态报告 播报当前进度(例如“正在扫描...”、“空闲”)。
L 标记对象 语义 AI 标记: 永久标记当前聚焦的元素/图标。
Shift + L 管理/扫描标记 打开标记管理器(如果存在标记)或扫描应用中未命名的元素。
U 检查更新 手动检查 GitHub 以获取插件的最新版本。
Space 调用上一次结果 在聊天对话框中显示上一次 AI 回复,以便查看或进行后续提问。
H 命令帮助 显示所有可用快捷键的列表。
Alt + S 设置 打开 Vision Assistant Pro 设置对话框。
Alt + Q 耗尽密钥报告 报告超出每日配额的 Gemini API 密钥数量及其重置时间。
Alt + M 路由审计 报告当前在高级路由中选定的 AI 模型。
方向键 上/下 快捷设置导航 在命令层中在快捷设置类别(提供商、模型等)之间切换。
方向键 左/右 更改快捷设置 更改当前选中的快捷设置的值。

3. AI 操作员 - 自主计算机控制

AI 操作员 将 Vision Assistant Pro 从被动阅读器转变为可以代表您与计算机交互的主动助手。您可以要求它描述屏幕、回答关于所见内容的问题,甚至接管控制——使用自然语言指令点击按钮、拖动项目、输入文本并在应用程序中导航。

最大的优势?它在完全无障碍缺失的软件中也能完美工作。如果您卡在自定义应用、远程桌面或屏幕阅读器完全静音的网站中,操作员完全不受影响。因为它能直观地“看到”屏幕,所以可以找到、读取并与零无障碍标记的元素进行交互。

工作原理

  1. NVDA + Shift + V,然后按 Shift + A(或使用直接快捷键)打开 AI 操作员对话框。
  2. 用平实自然语言输入您想做的事情(例如,“点击保存按钮”、“错误信息说了什么?”,或“将文件重命名为 final.pdf”)。
  3. AI 将分析您的屏幕,识别相关元素,并执行操作或提供答案。如果任务需要多个步骤,操作员将持续工作直到完成。
  4. 任何时候再次按 Shift + A 都可以立即中止正在进行的操作。

支持的操作

操作员理解广泛的命令:
- 描述与回答:“描述屏幕布局” 或 “错误信息说了什么?”
- 点击:“点击保存按钮”
- 右键点击:“右键点击文件”
- 双击:“双击文档”
- 拖放:“将文档拖到 Archive 文件夹”
- 输入:“在搜索框中输入 'Hello World'”
- 滚动:“向下滚动三次”
- 按键:“按 Enter”、“按 Tab”、“按 Escape”
- 多步骤任务:“打开文件资源管理器,找到报告,并将其重命名为 final.pdf”

重要提示

4. 视频分析与旁白描述

注意: 视频分析和旁白描述功能严格由 Google Gemini 提供商驱动。请确保插件设置中您的活动提供商设置为 Google Gemini。

Vision Assistant Pro 引入了专为视障用户设计的强大视频处理功能。它可以分析在线视频和本地屏幕录像,提供高度详细的视觉描述,并生成专业的旁白描述脚本 (SRT)。

4.1 本地屏幕录制 (Control + V)

如果您在屏幕上遇到无声视频、动画或教程,您可以直接捕获它:
1. 按 NVDA + Shift + V 进入命令层,然后按 Control + V
2. 插件将在后台静音录制您的屏幕。
3. 再次按 Control + V 停止录制。
4. AI 随后将分析录制的视频片段,并对场景、角色和操作提供高度详细的描述。

4.2 视频分析 (Shift + V)

您可以分析本地视频文件和在线视频。只需在 Windows 文件资源管理器中选中本地视频文件,或将在线视频链接复制到剪贴板。您也可以在任何地方(例如媒体播放器内部)按 Shift + V 打开对话框,手动浏览视频文件或粘贴 URL。
- 支持的在线平台: YouTube, Instagram, TikTok, 和 Twitter (X)。
- AI 将自动检测本地文件或 URL,处理视频,并提供全面的视觉描述和音频总结。

4.3 旁白描述生成 (SRT)

为了获得更有条理的体验,插件可以生成标准 SubRip (SRT) 格式的专业旁白描述脚本。
- 智能间隙对齐: AI 会监听音频轨道,并将视觉描述专门锚定到自然停顿和静音间隙,以明智地减少与原声对话的重叠。
- 角色追踪: 引擎执行预处理 pass,根据面部特征提取不同的角色。它构建了一个全局字典,以便在不同场景之间准确跟踪和标注角色而不会混淆。
- 逐字文本 OCR: 屏幕上出现的任何文本(标志、手机、字幕)都会被严格逐字引用。
- 如何使用: 要听取生成的字幕,只需将 .srt 文件放在与视频文件相同的文件夹中,并给它赋予完全相同的名称。然后配置您的媒体播放器(如 VLC 或 PotPlayer)在播放期间将字幕文本直接发送到您的屏幕阅读器或 TTS 引擎。

4.4 同步音频旁白导出 (MP3)

除了仅仅创建基于文本的 SRT 文件外,插件还可以通过将描述合成语音并与视频混合,作为完整的旁白描述制作工具。您现在可以选择 Gemini Live TTS 作为语音引擎,它利用 Gemini Live API 生成高度逼真且无限制的语音旁白。在为本地视频文件生成 MP3 时,您有多种混合模式:
- 标准旁白 (混合原声): 旁白语音直接叠加在视频的原声之上。系统会询问您是否应用 音频降低 (Ducking)(在旁白期间降低背景音量),以确保旁白清晰。
- 扩展旁白 (暂停原声): 引擎在旁白描述期间暂停原始视频音频,确保您不会错过原始对话或 AI 旁白的任何一个字。
- YouTube 视频: 对于 YouTube 来源(未在本地下载),导出的 MP3 将严格仅包含同步的 AI 语音轨道,而不包含背景视频音频。

5. 媒体转录与配音 (M)

音频转录器已完全重构,以支持音频和视频文件(MP3, WAV, MP4, MKV 等)。在命令层中按 M 选择媒体文件,并从 3 种不同模式中选择一种:
1. 转录 (原始语言):准确转录原始语言的口语。
2. 转录并翻译 (目标语言):转录语音并将其翻译为您的目标语言。
3. 配音并翻译 (目标语言) (仅限 Gemini):一项强大的新功能,可转录语音、翻译为目标语言,并使用插件的 TTS 引擎合成口语配音。

6. 高级文档与图像阅读器

Vision Assistant Pro 包含针对多页 PDF、复杂图像甚至 iPhone HEIC 格式进行高度优化的文档阅读器。

6.1 批量处理与恢复

您不需要一次性阅读庞大的文档。输入页面范围(例如 1-20),AI 将在后台处理所有页面。如果 NVDA 崩溃或您中断了扫描,插件将记住您的进度并提供从上次停止的地方 恢复 的选项!

6.2 智能文件操作

您并不总是需要先打开文档。在 Windows 文件资源管理器中,只需突出显示 PDF 或图像,然后在命令层中按 D (文档阅读器) 或 F (智能文件操作)。插件将立即跳过文件对话框并开始处理突出显示的文件。

6.3 文档查看器快捷键

在文档阅读器窗口打开时,您可以使用以下快捷键:
- Ctrl + PageDown: 移至下一页。
- Ctrl + PageUp: 移至上一页。
- Alt + A: 打开聊天对话框以针对文档内容提问。
- Alt + R: 强制使用您的活动提供商 使用 AI 重新扫描
- Alt + G: 生成并保存高质量音频文件 (WAV/MP3)。(如果提供商不支持 TTS 则隐藏)
- Alt + S / Ctrl + S: 将提取的文本保存为 TXT 或 HTML 文件。

7. 语义 AI 标记与 UI 资源管理器

卡在到处都是“未标记按钮”的应用程序中?语义 AI 标记引擎永久解决了这个问题。

7.1 永久对象标记 (L)

将屏幕阅读器聚焦在未标记的图形或按钮上,然后在命令层中按 L。AI 将从视觉上观察按钮,确定其功能,并施加永久标记。
与较旧的屏幕阅读器标记工具不同,本插件使用高级的混合“对象签名”系统 (AutomationId/ControlID)。您的自定义标记将在窗口缩放、显示器切换和应用更新后依然保持有效!

7.2 全应用扫描 (Shift + L)

Shift + L 一次性扫描整个活动窗口。AI 将找到所有未标记的元素并在一次运行中智能命名它们。您稍后可以在内置的标记管理器中管理、重命名或批量删除这些标记。

7.3 UI 资源管理器 (E)

需要与某个元素交互而无需手动导航到它?按 E 激活 UI 资源管理器。AI 将扫描屏幕并生成每个可点击元素的无障碍列表(忽略诸如任务栏之类的系统噪音)。从列表中选择一个项目,插件将立即为您点击它。

8. 实时语音助手

实时助手将 Vision Assistant Pro 转变为实时交互式 Copilot。
(注意:此功能仅限 Google Gemini 和兼容 Gemini 的自定义提供商)

9. 自定义提示词与变量

您可以在 设置 > 提示词 > 管理提示词... 中管理提示词。

支持的变量

10. 实际应用场景 (我应该使用哪个功能?)

Vision Assistant Pro 具备丰富的先进工具。以下是一些常见场景,可帮助您选择合适的工具:


注意: 所有 AI 功能都需要有效的互联网连接。多页文档会自动处理。

11. 支持与社区

获取最新新闻、功能和发布信息:
- Telegram 频道: t.me/VisionAssistantPro
- GitHub Issues: 用于 Bug 报告和功能请求。

报告 Bug 与日志

在打开 GitHub Issue 或寻求支持时,请提供关于您的活动 AI 提供商、模型和 NVDA 版本的详细信息。如果您遇到连接问题或意外崩溃,请在 设置 > 高级 中启用专用日志文件,重现问题,并附上您的 vision_assistant.log 文件,以帮助我们更快地解决问题。

12. 项目支持者

衷心感谢以下社区成员通过慷慨的资金捐助支持本项目的持续开发与维护:

如果您希望在经济上支持本项目并在此看到您的名字,您可以在 NVDA 工具菜单 (Vision Assistant 子菜单) 中找到 捐赠 选项,或在安装后的设置过程中找到该选项。


2026.08.06 更新日志

2026.07.15 更新日志

7.0.0 更新日志