ActiveVision 基准测试显示,当今领先的多模态大语言模型 (LLMs) 仅能解决 10.6% 需要多次观察图像的任务。在 17 项迭代感知挑战的测试中,人类的成功率高达 96.1%,而 GPT-5.5 的成功率为 10.6%,Claude Fable 5 为 3.5%;其中 11 项任务的模型正确答案数为零。

为什么当前的视觉模型会陷入困境

大多数视觉系统将图像视为一次性输入。“视觉编码器”提取一次特征,然后将其交给语言模型进行推理。该流水线无法要求进行第二次观察、放大特定区域或重新评估假设。相比之下,人类会先做出初步猜测,然后转移注意力,收集新证据,并调整答案。该基准测试将这一循环形式化:每项任务都迫使模型进行观察、提出行动、观察结果,并不断重复,直到得出正确结论。

该基准测试测试了什么

研究人员构建了 17 个需要重复观察的场景。结果非常悬殊:

  • 人类参与者:96.1% 成功率
  • GPT-5.5:10.6% 成功率
  • Claude Fable 5:3.5% 成功率
  • 十一个任务:所有测试模型得分均为零

即使模型生成代码来重新处理图像,它们也会忽略自身输出中的错误,这证实了该局限性是架构层面的,而非纯粹的数据驱动。

开发者与行业的利害关系

如果你正在构建自主机器人、巡检无人机或任何必须随时间验证视觉信息的系统,单次视觉模型是存在风险的。基准测试表明,目前的基于 LLM 的视觉流水线无法可靠地处理反馈驱动的感知,因此它们会漏掉缺陷、数错物品或误解动态场景。增加训练数据或扩大参数规模并不能弥补这一差距;缺失的关键要素是实现受控、迭代观察的机制。

反论:更大的模型会有帮助吗?

增加训练数据或扩大参数规模并不能弥补这一差距;缺失的关键要素是实现受控、迭代观察的机制。

前行之路

研究人员提出了一个互补的方向:

  • 架构重新设计 – 嵌入一个可控的视觉模块,该模块可以根据模型的内部状态请求新的视角、裁剪区域或改变光照条件。

核心结论: 当前的多模态 LLM 擅长回答静态图像问题,但在问题需要再次观察时表现不佳。真正的视觉智能需要能够控制自身视角的模型,而不仅仅是读一遍图片。