Anthropic 的 Fable 5 模型在仅使用游戏的视觉输出的情况下,通过游玩中文版的《宝可梦 火红》(Pokémon FireRed),在 1,785 个回合内赢得了第一个道馆徽章,共花费 65.40 美元。这次运行证明了该模型可以在没有任何文本提示的情况下完成游戏的一个可识别阶段,但对模型“思维链”(thinking chain)的深入研究表明,它是在背诵记忆中的游戏知识,而不是真正地“看到”并对每个像素进行推理。

Anthropic 的说法面临考验

当 Anthropic 发布 Fable 5 时,该公司重点展示了一个“仅限视觉”(vision-only)的演示,其中模型仅通过观察屏幕来操作《宝可梦 火红》。标题听起来仿佛该系统可以从零开始解释任何视觉环境。一位开发者决定通过复现 Anthropic 发布页面上描述的设置,并在游戏的中文翻译版上运行该模型,来验证这一说法。

实验是如何进行的

一个定制的测试框架(harness)向模型输入原始视频帧并捕获其动作选择。该框架与 Anthropic 的描述相符,将每一帧新图像传递给模型,并读取所选的控制器输入。测试运行了完整的游戏循环,直到模型赢得第一个道馆徽章,然后继续运行到第 2,000 个回合,此时角色到达了 3 号道路(Route 3)。

量化结果非常明确:

  • 1,785 个回合后赢得第一个道馆徽章
  • 总计算成本为 65.40 美元
  • 到第 2,000 个回合时,角色已到达 3 号道路 (Route 3)

日志揭示了什么

然而,原始日志讲述了一个关于模型如何达到该目标的不同故事。模型的内部“思维链”反复写下了尚未出现在屏幕上的信息。

  • 在第 78 个回合,模型注意到对手会选择小火龙(Charmander),尽管游戏尚未显示对手的选择。
  • 141 个回合后,当游戏终于把大木博士的包裹(Oak’s Parcel)交给玩家时,模型已经在笔记中记录了该物品的名称。
  • 在穿过 3 号道路时,模型通过引用一段从未在视觉流中出现的著名对话,识别出了一名特定的训练家。

这些条目并非逐像素分析的结果。它们是一个已经内化了详细游戏剧本的系统的特征——这种知识正是互联网上随处可见的攻略、维基百科和粉丝视频中的内容。换句话说,该模型似乎只是利用视觉来确认一张它早已烂熟于心的地图。

为什么这对于视觉推理基准测试很重要

该实验强调了许多视觉推理测试中一个微妙但关键的缺陷:

  • 干净的输入并不能保证干净的知识状态。 即使唯一的通道是图像流,模型也可能利用其庞大的记忆事实库。
  • 系统提示词无法抹除训练数据。 如果一个模型看过完整的游戏攻略,如果不进行重新训练,就无法强迫它“忘记”。
  • 性能表现可能衡量的是记忆力,而非感知力。 当测试世界与已知数据集匹配时,模型可以通过模式匹配来取得成功,而不是真正地解释新的视觉信息。

如果基准测试继续将“仅限视觉”视为视觉推理的代名词,那么它们就有夸大 AI 理解新环境能力的风险。公司可能会吹嘘令人印象深刻的数据,而其底层技能集却依然狭窄——这一问题对于投资者、开发者以及任何构建必须在真正未知环境中运行的安全关键型系统的开发者来说都至关重要。

反方观点:记忆力真的是问题吗?

有人认为,确认已知地图仍然需要某种形式的推理:模型必须将其内部表示与当前的视觉线索对齐。从这个角度来看,该演示展示了一种有用的能力——利用视觉来锚定预先存在的知识库。这种反对意见是有道理的;该任务确实涉及感知检查。

然而,基准测试的核心目标是评估通用视觉推理,而不是检索存储的剧本。当一个模型能够在事件出现之前就进行预测时,测试就不再能分离出感知能力。有用的锚定与彻头彻尾的作弊之间的界限变得模糊,测试结果也失去了诊断价值。

后续步骤与社区反应

为了探测记忆能力的极限,测试人员现在正在一个地理环境经过修改的变体地图上运行相同的模型。所有代码、自定义测试框架(harness)以及完整的日志文件均已公开,邀请其他研究人员复现该实验或将其应用于不同的游戏。学习社区平台上也已开设讨论频道,以进行持续的对话。

核心结论

如果一个仅靠视觉的演示之所以成功,仅仅是因为模型已经知道了答案,那么这并不是真正视觉推理能力的证据。基准测试必须将记忆的知识与即时感知区分开来,否则可能会夸大 AI 在探索真正未知的视觉世界时的能力。