视觉语言模型 (VLMs) 在基础视觉任务上仍然表现不佳。一项新的 PerceptionBench 评估发现,十六个领先系统中没有一个的总准确率超过 60%,即使是最强的系统在任何单一技能上的准确率也低于 80%。这一结果警告开发者,在流行的图像描述或推理测试中获得高分并不意味着具备可靠的视觉能力。

为什么现有测试掩盖了问题

大多数公开基准测试将图像描述、问答和常识推理混合在一起。当模型输出错误的描述时,错误可能是语言失误、推理错误,或者仅仅是无法识别物体。由于这三个组成部分交织在一起,低分并不能说明视觉方面的短板在哪里。因此,开发应用程序的团队会从这些头条数据中获得过高的信心,误以为模型能够“正确地看到”。

PerceptionBench 的不同之处

PerceptionBench 隔离了十种视觉能力,并在纯视觉任务集上评估每个模型。通过剥离语言和推理,该基准测试展示了视觉前端本身的工作效果。从整体来看,十六个顶尖的 VLM 均未达到 60% 的准确率阈值,表现最好的系统在任何单一技能上都从未达到 80%。幻觉 (Hallucination)——即产生图像中不存在的细节——是最常见的错误,而不同模型之间的优缺点模式差异很大。

谁会面临损失

开发者不应使用通用 AI 模型来取代专门的视觉分类器。

论证的局限性

PerceptionBench 的数据表明了边际收益递减:即使是最大的模型在基础感知任务上仍然会出错。

开发者的实践步骤

  • 保留专门的视觉分类器用于需要高精度的任务;将 VLM 视为补充而非替代品。
  • 增加验证层,在模型输出到达用户之前,将其与可信的检测器进行交叉检查。
  • 部署轻量级视觉过滤器,在流水线早期捕捉明显的幻觉或误分类。

将通用 VLM 与专用视觉组件相结合,可以让团队在利用前者推理能力的同时,防范其视觉盲点。

Source: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1