五个 Gemini 3.5 Flash 智能体通过实时协作,解决了 30 道 Project Euler 题目中 87% 的问题,击败了五个独立运行的智能体(72%)以及两种多数投票基准(独立运行为 80%,协作运行为 90%)。协作运行还将平均执行时间缩短了 4 分钟,从每题 14 分钟降至 10 分钟,且大多数解决方案在五分钟内即可完成。

为什么这项实验很重要

AI 编程助手已经能够编写代码片段、调试代码并生成完整的程序。研究人员通常是在一个提示词(prompt)上测试单个模型并对其答案进行评分。而这项测试提出了一个不同的问题:一组在工作过程中共享发现的智能体,是否能超越仅仅汇总独立答案的“群体智慧”方法?

Project Euler 问题是算法思维的标准基准。它们结合了数学洞察力和高效编码,因此可以很好地代表对正确性和速度都有要求的现实编程任务。

测试是如何设置的

  • 智能体 (Agents):通过 Antigravity 平台访问的五个 Gemini 3.5 Flash 实例。
  • 场景
    1. 每个智能体独立解决每个问题,并报告自己的答案。
    2. 同五个智能体进行实时协作,广播中间结果并确认彼此的步骤。
    3. 对于这两种设置,都使用简单的多数投票聚合器来汇总五个独立答案。
  • 指标:准确率(正确答案的百分比)和运行时间(每个问题的平均时间,以及完成时间的分布)。

数据揭示了什么

  • 独立运行准确率:72%
  • 协作运行准确率:87%
  • 独立运行多数投票准确率:80%
  • 协作运行多数投票准确率:90%

运行时间从独立智能体的平均 14 分钟降至协作组的 10 分钟。大多数协作运行在五分钟内完成,而独立尝试经常会触及 30 分钟的超时限制。

解释差距的关键观察结果

  • 单打独斗不可能,众人拾柴火焰高 —— 在某个特定问题上,所有独立运行的智能体都失败了,但协作团队通过交换部分结果,共同得出了正确答案。
  • 通过交叉检查发现错误 —— 单个智能体有时会陷入逻辑陷阱;团队通过实时对比笔记,发现了这些失误。
  • 快速收敛 —— 当任何一个智能体发现了一个关键的中间值时,它会广播这一发现,从而允许其他智能体跳过冗余工作,更快地收敛到最终解决方案。

隐藏的成本与局限性

该实验仅使用了五个智能体;目前尚不清楚同样的效率是否能扩展到数十个或数百个。此外,多数投票聚合器的表现依然出色(在协作模式下达到 90%)。

下一步值得关注的方向

  • 规模化实验 —— 一百个智能体是否仍能提高准确率,还是协调开销会占据主导地位?
  • 角色专业化 —— 分配特定任务(例如,一个智能体专注于数论,另一个专注于优化)可能会比自由协作带来更大的收益。
  • 更广泛的基准测试 —— 将相同的框架应用于代码生成挑战、调试套件或现实世界的软件构建,将测试这些收益是否在数学谜题之外依然有效。

总结

AI 编程智能体之间的实时协作可以提高算法任务的成功率和速度,其表现优于独立尝试,甚至优于简单的群体投票。这种方法展现出了前景,但其可扩展性和成本效益仍是未来研究需要回答的开放性问题。

Source: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0