为什么新模型感觉更“费劲”

Google 为需要经过多个阶段思考的自主智能体(autonomous agents)构建了 Gemini 3.8 Flash。与通常只需单次处理即可回答问题的 Gemini 3.7 Flash 不同,3.8 会将问题分解为子问题,调用外部 API,并不断迭代直至达到满意结果。Google 警告称,这种额外的“思考”工作会消耗更多 token,尤其是在较高的“努力度”(effort)设置下。

一项独立分析显示,与 3.7 Flash 相比,每个任务的输出 token 增加了约 30%,交互轮数也随之增加。由于单 token 费用保持不变,对于许多实际工作负载而言,实际成本上升了约 40%

对开发者至关重要的基准测试

这种权衡并非仅停留在理论层面。在 DeepSWE v1.1 软件工程基准测试的正面交锋中,Gemini 3.8 Flash 果断击败了 Anthropic 的 Fable 5。该模型还在 Vals Finance Agent V2 和 Harvey’s Legal Agent 基准测试中名列前茅,证明了其能够处理复杂的财务计算和细微的法律推理。

Aigora.ai 的 CEO John Ennis 总结了其优势:该模型在提供“Opus 5 级编码质量”的同时,成本仅为后者的一小部分,且速度明显更快。他举例了生成 Remotion 视频的使用场景,在这种场景下,快速的推理和复杂的代码生成可以大幅缩短生产流水线的时间。

AI 经济模式的转变

开发者过去习惯于通过单 token 价格来衡量成本。而多轮对话、工具增强型智能体将这一指标转变为“单次成功任务的价格”。对于 Gemini 3.8 Flash 而言,如果模型为了达到相同的目标而消耗了更多 token,那么即使 token 单价更低,也无法保证账单更便宜。

Google 将该模型定位在极昂贵的尖端模型与轻量级、单轮生成器之间。通过将其品牌化为“按需智能”(intelligence-on-demand),该公司向开发者发出信号:可以调用更高的推理能力,而无需承担大型、慢速模型通常带来的延迟。权衡显而易见:更复杂的输出意味着更高的总 token 消耗量。

何时应继续使用旧版本

需要严格成本预测性的团队——尤其是那些运行大规模批处理任务或利润空间较薄的团队——应该坚持使用 Gemini 3.7 Flash。旧模型仍能提供低延迟和稳定的 token 占用,使每月支出更容易预测。

后续关注点

  • 工具调用定价:

总结

Gemini 3.8 Flash 表明,更高的推理能力可以实现 Flash 级别的延迟,但每次交互消耗的 token 更多。构建复杂、多步 AI 智能体的开发者会发现性能提升非常诱人,但他们必须调整预算以覆盖隐藏的 token 成本。对于其他所有人来说,旧的 3.7 Flash 仍然是更安全、更可预测的选择。