DeepSeek 发布了 V4 Pro 正式版 (GA) 模型。初步测量显示,与预览版相比,它将推理 token 的使用量减少了 18% 至 62%。对于按 token 付费的用户来说,这非常重要:在产生同等输出质量的同时,相同的提示词现在成本明显降低了。

比较的契机

由于 GA 版本发布时没有附带博客文章或更新日志,开发者不得不自行发现其中的差异。社区测试在两个版本上运行了相同的任务,并发现了最大的变化——模型在回答之前用于“思考”的 token 数量大幅下降。在简单的查询中,GA 模型减少了 62% 的推理 token;在更复杂的查询中,降幅为 18%。

Token 效率及其影响

在典型的提取工作流中,预览版需要消耗 159 个推理 token 才能从提示词中提取出少量字段。切换到禁用“思考”功能的 GA 版本后,该数值骤降至 40 个 token。对于使用按量计费方案的用户来说,这种节省会直接转化为更低的账单,尤其是在大规模应用时。

JSON 提取:隐藏的陷阱

当开启“思考”模式时,两个版本都会遇到问题:它们能通过 JSON schema 检查,但会插入错误的数值。只有在关闭“思考”功能时,GA 版本才能返回正确的 JSON。需要结构化输出的团队在执行提取任务时应禁用 thinking 标志,否则可能会收到语法正确但数值错误的数据。

拒绝机制的变化

预览版模型可以拒绝回答它认为无法回答的问题,并回复“我不知道”。GA 模型不再这样做。相反,它要么在未给出回答的情况下耗尽 token 预算,要么编造一个回答。这一变化提高了 token 效率,但也移除了一个防止模型在未知话题上产生幻觉的安全网。

可靠性提升

预览版中存在一个危险的循环——由有限的“思考”预算触发——可能导致模型不断重复相同的文本,直到填满 8,192 token 的窗口。GA 版本修复了这个 bug,终结了此前可能导致请求窗口耗尽并推高成本的失控重复现象。

用户注意事项

  • 使用 GA 版本以降低 token 消耗。 测量结果显示,这种降幅在不同复杂度的任务中均成立。
  • 在进行任何 JSON 或结构化数据提取时,请关闭“思考”功能。 这可以确保数值正确并使 token 使用量降至最低。
  • 不要依赖内置的拒绝机制。 如果提示词要求提供无法验证的数据,GA 模型仍可能给出答案,因此下游验证仍然至关重要。
  • 关注高峰时段的计费。 新的定价规则使得高流量期间的 token 消耗对总支出的影响比以前更加显著。

总结

DeepSeek 的 V4 Pro GA 模型带来了显著的效率提升——推理 token 减少高达 62%——并修复了一个关键的重复 bug。然而,显式拒绝响应的缺失以及为了获得准确的 JSON 输出而需要禁用“思考”功能,也带来了新的考量。能够调整其流水线的团队可以在不牺牲功能性的情况下降低成本。

来源:https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l