在线图像描述插件

该插件为NVDA添加了在线图像识别引擎。 有两种类型的识别引擎。OCR和图像描述器。OCR:从图像中提取文本。 图像描述器,以文本形式描述图像中的视觉特征。例如一般性描述,颜色类型地标等。使用此插件需要Internet连接, 因为图像描述服务是由Internet上的 API 提供的。在此插件中,它们称为“引擎”。 该插件目前包含三种识别引擎:

您还需要选择识别图像的来源:

按键与首饰

选择了识别类型后,您可以用一个热键开始识别: NVDA + Alt + P根据图像来源和引擎类型设置执行识别,然后读取结果。如果连按两次,则打开虚拟文档结果。

还有四个其他快捷键未分配。请在使用前打开“NVDA” ➡ “选项” ➡ “输入首饰”手动分配: * 循环浏览不同的识别引擎类型; * 循环浏览不同的识别来源; * 取消当前识别(如果您认为等待时间过长而想取消,则此热键很有用,同样,有时您也不想被识别信息打扰,因为您或许需要查看识别后的某些更重要的信息)。 * 在虚拟文档中显示上一次识别结果,虽然具有将结果复制到剪贴板的功能,但字符位置信息无法保留,因此添加了此热键来解决此问题。

对于喜欢以前版本中操作方式的用户,还有四个热键未分配(建议使用新的热键手势并根据需要切换引擎类型):

引擎配置

您可以选择识别引擎并在 “NVDA菜单” ➡ “设置” ➡ “选项” ➡ “打开在线图像描述设置”对话框中进行详细设置。

插件的作者已经注册了具有免费API配额的帐户,并在 www.nvdacn.com 上设置了代理服务器,以使该插件更易于测试。测试配额是有限的,且 API提供商可以随时取消。所以,强烈建议根据每个引擎中的指南注册您自己的密钥。

以下设置适用于所有引擎

以下设置在所有引擎中的含义相同

请注意,识别结果的质量和准确性受许多因素影响。

在线图片描述

这是三个可用的引擎。

Microsoft Azure图像分析器

该引擎根据图像内容提取丰富的视觉功能。 该引擎仅支持英语。如果要使用其他语言进行描述,则可以使用Microsoft Azure Image Describer

视觉功能包括: 检测成人内容。 - 检测图像中的各种品牌, 包括大致位置 复选框 已选择 未选中 - 根据文档中定义的分类对图像内容进行分类。 - 用完整句子描述图像内容。 - 确定强调色、主导色以及图像是否为黑白。 - 使用与图像内容相关的标签描述图像。 - 人脸-检测图像上是否有人脸。如果存在, 则生成坐标、性别和年龄。 - 检测图像是剪贴画还是简笔画。 - 检测图像中的各种对象, 包括大致位置,仅支持英语。

一些功能还提供其他详细信息:

Microsoft Azure映像描述器

该引擎以人类可读的语言生成带有完整句子的图像描述。 该描述基于内容标签的集合,可以为每个图像生成一个或多个描述。描述按其置信度得分排序。 此引擎有两个设置。