OpenAI 表示其 GPT-5.6 Sol 模型在 ARC-AGI-3 逻辑推理基准测试中达到了 38.3% 的成功率,超过了 Anthropic 的 Claude Opus 5 的 30.2%。这种领先优势仅在模型通过 OpenAI 自定义的 Responses API 运行时才会出现,该 API 增加了官方测试框架不允许的两项推理时技巧。
前奏:基准测试军备竞赛
ARC-AGI-3 测试模型在不依赖记忆事实的情况下解决新颖、多步骤问题的能力。今年早些时候,Anthropic 宣布在该基准测试中实现了四倍的飞跃,使 Opus 5 位居公开排行榜榜首。该结果为“原始”模型能力设定了新的参考点,因为官方测试框架会在每一步之后丢弃任何中间推理过程,迫使模型每次都从头开始。
OpenAI 的这一说法也处于同样的竞争环境下。通过发布更高的分数,该公司向外界传递了一个信号:其最新一代模型不仅能与主要对手旗鼓相当,甚至在逻辑性能上实现了超越。然而,这一头条新闻掩盖了一个技术上的细微差别,而这一差别正在重塑社区解读基准测试数据表的方式。
数据背后的真相
当 GPT-5.6 Sol 在使 Opus 5 获得 30.2% 成绩的相同官方 ARC-AGI-3 测试框架下进行评估时,该模型的成功率会骤降至 7.8%。这种巨大的差异并非故障,而是 OpenAI 与模型捆绑提供的两项工程化功能的产物:
- Retained Reasoning(保留推理) —— 系统不会在每个子任务后清除思维链(chain-of-thought),而是保留中间文本,让模型能够回溯之前的推导并构建累积论证。
- Compaction(压缩) —— 该封装器不会为了保持在 token 限制内而截断旧的上下文,而是将之前的步骤压缩成简短的摘要,在保持 prompt 大小可控的同时保留逻辑主线。
这两种机制都存在于专有的 Responses API 中。通过为模型提供更丰富、连续的上下文,OpenAI 有效地增强了模型的“记忆力”,并允许其重复利用自身的推理过程。相比之下,官方测试框架强制执行严格的“无状态”(stateless)模式,从而剥离了这些优势。
为什么方法论至关重要
这一事件凸显了 AI 评估领域日益增长的分歧:原始模型分数与系统级性能之间的博弈。OpenAI 认为,基准测试应该反映开发者实际部署的整个技术栈——包括模型、推理流水线和内存管理。从这个角度来看,38.3% 的分数告诉产品团队,这种组合方案比孤立评估的模型能解决更多的现实世界任务。
批评者则认为这模糊了科学进步的方向。如果每个实验室都添加定制的封装器,那么排行榜就会变成各种工程技巧的拼凑,而不是对模型智能的纯粹比较。官方 ARC-AGI-3 测试框架的存在是为了公平竞争,确保更高的分数代表的是底层模型真正更强大,而非封装器更聪明。
开发者与投资者的利害关系
对于构建 AI 驱动产品的初创公司来说,这种区别具有实际意义。一个能够保留推理并压缩上下文的模型,可能需要更少的 prompt engineering(提示工程)、更低的推理延迟以及更少的 API 调用即可得出解决方案。这意味着更低的计算成本和更流畅的用户体验。那些交付“开箱即用”系统(模型加优化的推理层)的公司,在速度和成本至关重要的领域将获得竞争优势。
投资者将基准测试成绩的攀升视为未来收入的指标。即使底层模型的原始能力与对手持平,一个引人注目的领先优势也能提升公司的估值。因此,关于这些数字究竟代表什么的争论,会影响 AI 领域资本的流动方式。
后续关注点
- 标准制定者的回应 —— 基准测试组织者可能会收紧针对“外部”推理技巧的规则,或者增加一个明确允许这些技巧的独立“系统”赛道。他们的回应将塑造下一波公开排行榜的格局。
- 开源封装器 —— 如果社区发布了保留推理和压缩功能的自有实现,那么这种优势可能会变成一项基础功能,而非专有优势。
- 现实世界测试场 —— 公司越来越多地发布其在私有问题集(例如内部代码生成套件)上的表现。虽然这些结果的对比性较低,但它们的重要性将开始超过单一的公开基准测试。
反方观点:这是否是在“钻基准测试的空子”?
一些研究人员将使用自定义 API 称为“基准测试博弈”(benchmark gaming),认为这在不提升核心模型理解能力的情况下虚增了分数。他们指出,如果一个模型在严格限制下性能会跌至个位数,那么它距离 AGI 的目标仍有很大差距。令人担忧的是,该领域可能会开始奖励工程上的捷径,而非推理能力的真正飞跃。
OpenAI 方面强调,模型与系统之间的界限正变得越来越人为。现代 AI 应用很少在真空环境下运行模型;它们总是位于一个服务层之后,该层负责处理缓存、上下文拼接和输出后处理。从这个角度来看,衡量整个流水线(pipeline)更能真实反映用户的实际体验。
核心启示
GPT-5.6 Sol 的故事表明,如今的基准测试胜利在很大程度上既取决于推理工程,也取决于模型规模。社区是会接受系统级评分,还是会限制自定义封装的使用,将决定我们如何解读下一个“排行榜”头条。对于任何构建或资助 AI 产品的人来说,教训是显而易见的:原始数据固然重要,但周围的软件环境可能是决定现实世界性能的关键因素。
