顶级模型主动视觉仅得10.6%:工业机器人还不会像人一样反复观察

摘要:ActiveVision基准设置了17项需要持续查看、路径追踪、区域搜索和属性匹配的视觉任务。人类平均正确率达到96.1%,表现最好的GPT-5.5高推理版本只有10.6%。

**摘要:**ActiveVision基准设置了17项需要持续查看、路径追踪、区域搜索和属性匹配的视觉任务。人类参与者平均正确率达到96.1%,表现最好的GPT-5.5高推理版本只有10.6%,并在17项任务中的11项得分为零。差距说明,多模态模型可以描述一张图,却仍不擅长根据任务主动调整视线、反复验证和积累视觉证据。

多模态模型已经能识别物体、理解图表、阅读文档,也能对复杂图片给出流畅描述。

顶级模型主动视觉仅得10.6%

但“看懂一张图片”和“为了完成任务持续观察”,是两种不同能力。

ActiveVision研究团队设计了17项视觉任务,要求模型反复查看图像、追踪路径、扫描多个区域,并把不同位置获得的信息组合起来。三名人类参与者平均正确率达到96.1%,GPT-5.5最高推理版本的正确率为10.6%,Claude Fable 5为3.5%。表现最好的模型在17项任务中的11项得分为零。

即使允许模型编写和运行视觉处理代码,整体差距仍然明显。

主动视觉测的是什么

普通视觉问答通常给模型一张图片,然后询问“图片中有什么”“这个人穿什么颜色”“图表最高点在哪里”。

模型可以把整幅图像编码成一次性表征,再依据这个表征生成答案。

ActiveVision中的任务要求模型不断返回图像寻找证据。

其中一类任务需要分布式扫描,例如检查多个区域、统计分散目标;一类任务需要顺序追踪,例如沿道路、管线或迷宫路径移动视线;还有一类任务要求把某个位置看到的颜色、符号或属性,传递到另一个位置完成匹配。

人类完成这类任务时,会先观察整体结构,再把注意力移动到局部区域。遇到不确定信息,会重新放大、回看和比较。视觉过程与推理过程交替进行。

当前多模态模型更习惯先对图片做一次编码,再在压缩后的信息上推理。图像中的局部细节、空间顺序和访问路径可能在编码阶段丢失。

模型能描述图像,却不会安排“下一眼看哪里”

主动视觉的关键不只是识别能力。

模型还需要判断当前掌握的信息是否足够,下一步应该查看哪个区域,用什么分辨率观察,以及如何把新发现与先前证据联系起来。

例如,统计仓库中不同货架上的特定零件,不能只对整张图生成一个概括。系统要逐个检查货架,记录已经看过的位置,避免重复或漏检。

沿着复杂管线寻找最终出口,则需要保存路径状态,区分交叉和遮挡,并在每个分叉处重新确认。

模型即使能识别一段管线,也可能在多次转折后丢失起点与当前位置的关系。

这对工业视觉有什么影响

工业视觉系统长期以来依赖固定相机、固定光源和固定检测区域。

在结构化产线上,零件位置稳定,算法只需判断指定区域是否存在缺陷。这类任务不一定需要主动视觉。

当机器人进入柔性装配、设备巡检、仓储分拣和复杂维修场景后,观察条件不再固定。

机器人抓取透明或柔性物体时,可能需要移动相机寻找合适角度;巡检机器人发现仪表异常后,需要靠近读取刻度,再转向检查对应阀门;维修智能体分析设备照片时,需要在总装图、局部细节和历史样本之间反复对照。

这些任务要求视觉系统形成“观察—判断—再观察”的闭环。

ActiveVision的结果提醒企业,通用多模态模型可以作为工业视觉的语义分析层,却不能直接替代完整的主动感知系统。

视觉质检也需要二次确认

人工质检员发现疑似缺陷后,往往会改变光照角度、翻转零件、放大局部或与标准件比较。

一次拍摄可能把反光误认为划痕,也可能因为遮挡漏掉裂纹。未来的智能质检系统需要根据第一次识别结果主动触发第二次采集。系统可以调整相机焦距、切换光源、控制机械臂旋转工件,并在多个视角之间进行一致性判断。

这里的模型不仅要回答“有没有缺陷”,还要提出“还需要看哪里才能确认”。

工业机器人需要视觉工作记忆

人类在连续观察时,会记住已经查看过的位置、当前目标和未解决问题。

机器人也需要类似的视觉工作记忆。

这类记忆不能只保存语言摘要。例如,“左侧有两个零件”可能忽略零件的准确位置和朝向。系统还要保留空间坐标、视角、置信度、时间顺序和图像证据。

当机器人更换视角后,需要知道新画面中的物体与旧画面是否为同一个对象。设备移动、遮挡变化和光照变化都会增加匹配难度。

视觉工作记忆、空间地图和任务状态需要共同参与决策。

主动视觉需要一套新架构

第一层负责采集,包括相机、深度传感器、激光雷达和设备状态数据。

第二层负责识别,判断物体、文字、缺陷和空间关系。

第三层负责维护状态,记录看过什么、还有哪些区域未确认。

第四层负责规划下一次观察,决定移动相机、调整视角或调用图像处理工具。

第五层负责验证,将新证据与原判断比较,并在置信度不足时继续观察。

大模型可以承担语义理解和观察规划,但底层定位、运动控制和安全约束仍需专门算法与工业控制系统支撑。

工具调用没有自动解决问题

研究人员允许模型编写和运行视觉代码,希望它们通过裁剪、放大、边缘检测和图像处理提高表现。

结果表明,工具本身并不能保证成功。

模型还要知道何时调用工具、裁剪哪个区域、如何解释输出,以及何时停止。规划错误会让工具调用变成重复操作,甚至放大最初的误判。

这与企业智能体的情况相似:拥有搜索、数据库和代码工具,并不等于能够稳定完成长链任务。工具选择、状态管理和结果校验同样重要。

如何理解10.6%这个数字

这项基准由17类专门设计的任务组成,重点检验主动观察能力。它不能代表模型全部视觉水平,也不能直接推导出某个模型只有人类十分之一的视觉智能。

人类对照组只有三名参与者,样本规模有限;测试任务与真实工厂环境之间也存在差异。

但模型在大量任务上接近零分,说明当前多模态架构存在结构性短板。

系统可以在单次观察中展示丰富知识,却难以持续管理注意力、空间位置和视觉证据。这一问题会直接影响机器人、自动驾驶、工业巡检和复杂文档分析。

结语

多模态模型让机器具备了描述图像的能力,主动视觉要求机器学会组织观察过程。

它要知道自己没有看清什么,决定下一眼看哪里,保存前后视角的关系,并在证据冲突时重新检查。

工业智能的下一步,不只是给大模型接上摄像头。

企业需要把多模态模型、视觉算法、传感器、空间记忆、运动规划和控制系统组合起来,让机器形成连续感知闭环。

从一次性“看图回答”,走向“为了完成任务持续观察”,仍有很长的工程距离。

主要参考

  1. ActiveVision研究论文:《An Exam for Active Observers》。
分享到