ABSeeker 的全新“答案回溯式信用分配”(Answer-Backtracked Credit Assignment,简称 ABC)方法让长程搜索智能体能够为每一个单独的步骤获得信用,而不仅仅是针对最终答案;使用该方法训练的 40 亿参数模型已经可以媲美甚至超越规模大得多的竞争对手。
这一突破之所以重要,是因为大多数现有的智能体仅在任务结束时才接受评判。如果最终答案正确,整个运行过程就被标记为“好”;如果错误,则整个序列都被标记为“差”。这种“全有或全无”的反馈掩盖了真实的学习信号——例如,那些恰好紧随错误之后的正确动作,或者是那些幸运地导致正确结果的无用点击。ABSeeker 的方法改写了这一规则。
为什么旧方法力有不逮
当智能体进行搜索、编写代码或收集证据时,通常需要执行许多操作:发布查询、打开页面、运行命令、检查系统状态等等。在一个包含 15 个步骤的运行过程中,即使之前的步骤都是正确的,一个单一的失误也可能导致最终答案失败。相反,一个以正确答案结束的运行过程可能仅仅依赖于随机运气,其中大部分步骤并没有提供任何价值。仅针对最终结果进行训练,会迫使模型将整个轨迹视为一个单一的“黑盒”,从而难以学习哪些子行为实际上是有用的。
这种情况类似于软件工程中的调试。开发人员会追踪每一行代码,隔离失败的调用并进行修复。然而,智能体却从未获得过与其内部工作相对应的“收据”。如果没有这种审计追踪,开发人员就无法判断改进是源于更好的推理还是仅仅出于偶然,也无法系统地纠正坏习惯。
ABC 如何重构信用分配
答案回溯式信用分配从正确的最终答案开始反向工作。它首先提取答案所依赖的关键线索——特定的证据片段、
Answer-Backtracked Credit Assignment 彻底颠覆了我们训练智能体进行搜索、编码和推理的方式。通过奖励过程中的正确步骤,而非仅仅关注最终结果,它让中等规模的模型也能像规模大得多的模型一样高效学习。对于任何致力于构建需要执行多步任务的智能体的人来说,采用以轨迹(trace)为中心的训练机制并非可选项——它是通往可靠、可审计且最终更智能 AI 的必经之路。
