Sakana AI 的 Fugu Ultra v1.1 在最新更新中表现超越 Fable 5
Sakana AI 发布了其智能模型路由器的重大更新——Fugu Ultra v1.1,并声称在关键技术基准测试中实现了巨大的性能飞跃。此次更新标志着公司在优化查询分配至顶级模型方面的战略尝试,旨在实现更卓越的推理和编程能力。
打破基准:Fugu Ultra v1.1 的优势
Fugu Ultra v1.1 的核心创新在于其路由智能,它能针对任何给定的提示词,从一系列公开可用的 LLM 池中选择最合适的模型。Sakana AI 报告称,该版本较最初的 v1.0 版本实现了高达 7.9 分的性能提升。
最值得注意的是,该路由器在专门的技术评估中表现出显著增长,特别是在 ProgramBench 和 TerminalBench 2.1 基准测试中。Sakana 提出了一个惊人的说法:Fugu Ultra v1.1 在大多数基准测试中的表现现在已经超越了 Anthropic 的 Fable 5——尽管 Fable 5 实际上并未包含在路由器的选择池中。虽然这些结果目前尚缺乏独立的第三方验证,但它们表明路由逻辑在从现有模型架构中提取峰值性能方面正变得极其高效。
技术架构与开发者集成
Sakana 维护尖端模型池的方法非常严谨;公司表示,在任何新的顶级模型正式集成到 Fugu 生态系统之前,都需要大约两周的专门训练和评估。这确保了路由器的决策过程能够针对市场上的最新权重和能力保持优化。
对于开发者而言,此次更新引入了一个新的 Claude Code 兼容端点,允许用户直接从终端调用 Fugu。这种集成简化了需要高级推理和基于终端自动化的工程师的工作流程。尽管取得了这些技术进步,其定价仍与之前的版本保持一致:每百万输入 token 为 5 美元,每百万输出 token 为 30 美元。目前,用户可以通过 OpenRouter 和 Vercel 等主要平台访问 Fugu。
应对市场挑战与监管
在 Fugu 最初发布后经历了一段时间的审查后,此次更新应运而生。早期的批评者指出了高 token 消耗、延迟以及结果不一致等问题。通过 v1.1 版本,Sakana 似乎正在加倍致力于效率和专门任务的性能,以重新赢得开发者的信任。
然而,地理限制仍然是全球普及的一个障碍。Sakana AI 目前不为欧盟 (EU) 或
