VIDRAFT 的 3980 亿参数模型 Darwin-398B-JGOS 仅使用 24 块 GPU,就在 GPQA Diamond 排行榜上夺得了第三名。这一结果证明,在需要真正的科学推理而非死记硬背答案的测试中,一家韩国初创公司也能与全球最大的 AI 实验室相媲美。

为什么 GPQA Diamond 至关重要

GPQA Diamond 提出的科学问题属于研究生水平,且并未出现在公开网站上。由于答案无法通过爬虫获取,模型必须通过推理来解决问题,而不是检索存储的事实。该基准测试考察的是逻辑能力,而非记忆力。

当前排行榜

  • Kimi-K3 (中国): 93.5
  • GLM-5.2 (中国): 91.2
  • Darwin-398B-JGOS (韩国): 90.9
  • DeepSeek-V4-Pro (中国): 90.1
  • Inkling-Small (美国): 89.5
  • Qwen3.5-397B-A17B (中国): 88.4
  • Nemotron-3-Ultra-550B (美国): 87.9

尽管 Darwin 所使用的硬件仅为此类项目典型配置的一小部分,但其表现仍超越了来自 Nvidia、DeepSeek 以及多家美国和中国厂商的模型。

获胜背后的方法

VIDRAFT 并没有购买庞大的 GPU 集群。相反,团队采用了“进化合并”(evolutionary merging)技术,通过迭代组合多个开源模型并保留性能最佳的组件。在仅有的 24 块 GPU 集群上运行这一方法,就构建出了一个高质量的 3980 亿参数网络,而无需像从头开始训练那样投入巨额资金。

这对 AI 领域意味着什么

  • 降低了准入门槛: 构建顶尖 AI 不再需要数千块 GPU。

注意事项与反向观点

Darwin 仍以微弱差距落后于前两名,且其 3980 亿参数的规模依然庞大——训练或部署该模型仍需要大量的基础设施。这种方法依赖于在小型集群上对开源模型进行进化合并。GPQA Diamond 则作为其基准测试。

下一步值得关注的方向

结论很明确:巧妙的模型融合策略可以弥补算力的不足,从而重塑 AI 研究最高水平领域的竞争格局。