重写是如何发生的

Anthropic 在 2025 年 12 月收购了 Bun,并着手将其 Zig 代码库替换为 Rust。公司运行了一个 Claude Fable 5 的预发布版本——这是一款当时其他人无法使用的 LLM。64 个模型副本并行工作,总计每分钟生成约 1,300 行代码。

首席工程师 Jarred Sumner 并没有把问题交给智能体(agents)后就撒手不管。他首先花了数小时起草了一份指南,将 Zig 的惯用法映射到 Rust 的等效用法。在处理整个代码库之前,通过一个包含三个文件的试运行,他得以校准智能体的输出。对于智能体提出的每一项更改,都有两个“对抗性”智能体进行审查,而 Sumner 在整个 11 天的过程中都在实时监督整个流程。

Anthropic 的内部账目记录了 16.5 万美元的 Token 使用费用。这个数字仅反映了代码合并到主分支之前所产生的原始 API 调用费用。

隐藏的账单

根据一项内部分析,16.5 万美元这一数字忽略了稳定新 Rust 代码所需的计算成本。合并后的修复、持续集成(CI)运行以及额外的测试可能会推高总支出。该估算使用的是公开 API 的定价;由于 Claude Fable 5 是私人预览版,实际支付的价格可能会有所不同。

速度与安全的权衡

重写产生了一个比原始 Zig 版本运行更快的 Rust 运行时,但也留下了大量的审计积压工作。在新生成的 Rust 文件中,约有 4% 包含“unsafe”块——即绕过 Rust 严格安全保证的代码。手写的 Rust 项目通常比例要低得多,这意味着审查人员现在必须验证这些代码块是否会暴露内存损坏漏洞。

如果没有 Sumner 的专业知识,智能体的输出将毫无意义。即便每分钟能生成 1,300 行代码,也需要一位知识渊博的监督者来发现逻辑错误、确保架构的一致性,并确认测试套件确实覆盖了新的实现。

AI 何时闪光,何时力不从心

Bun 的移植是一个教科书式的翻译案例:从一种语言到另一种语言,且已有完善的测试套件。这种清晰的边界为 LLM 提供了明确的目标,并限制了对创造性问题解决能力的需求。然而,大多数软件工作涉及不断变化的业务规则、处理模糊的需求或从零开始构建新功能。在这些更复杂的情况下,同等程度的 AI 辅助不太可能产生类似的效率或成本优势。

AI 增强型开发的拥护者指出,几分钟内生成数千行代码的原始生产力数据,证明了大语言模型可以取代庞大的团队。Anthropic 的案例为这一观点降了温:头条新闻中的 Token 成本不包括合并后验证所需的巨额计算成本,而且由“unsafe”代码产生的安全债仍需人工努力来解决。

下一步值得关注的方向

Anthropic 尚未透露是否计划将同样的 Claude 驱动工作流应用于其他代码库。如果这样做,公司需要考虑整个生命周期的成本,而不仅仅是 Token 账单。观察者应密切关注:

  • 审计积压工作的缩减速度,以及随着审查人员重构代码,“unsafe”比例是否会下降。
  • 未来的运行是否会使用更成熟且可公开购买的模型,这可能会使成本估算更加透明。
  • 对 Bun 采用率的影响:更快的运行时可能会吸引用户,但任何安全隐患都可能抵消这一收益。

总结

AI 可以为简单的代码翻译提供强力加速,但下游的计算和人工验证成本可能会抵消 Token 账单节省下来的费用。Bun 的重写表明,虽然大语言模型可以快速喷涌出海量的代码,但人类的专业知识对于安全性、正确性以及驱动大多数软件项目的细微工作仍然至关重要。