VIDRAFTの3,980億パラメータモデル「Darwin-398B-JGOS」は、わずか24基のGPUを使用して、GPQA Diamondリーダーボードで第3位を獲得しました。この結果は、暗記した回答ではなく真の科学的推論を要求するテストにおいて、韓国の小さなスタートアップが世界最大のAI研究所に匹敵できることを証明しています。

なぜGPQA Diamondが重要なのか

GPQA Diamondは、公開されているウェブサイトには存在しない大学院レベルの科学的な質問を投げかけます。回答をスクレイピングすることができないため、モデルは蓄積された事実を検索するのではなく、問題に対して推論を行う必要があります。このベンチマークは、暗記ではなく論理的思考を強いるものです。

現在のリーダーボード

  • Kimi-K3 (CN): 93.5
  • GLM-5.2 (CN): 91.2
  • Darwin-398B-JGOS (KR): 90.9
  • DeepSeek-V4-Pro (CN): 90.1
  • Inkling-Small (US): 89.5
  • Qwen3.5-397B-A17B (CN): 88.4
  • Nemotron-3-Ultra-550B (US): 87.9

Darwinは、このようなプロジェクトで通常必要とされるハードウェアのわずかな一部で動作しているにもかかわらず、Nvidia、DeepSeek、および米中の一部のモデルを上回る性能を示しています。

勝利の裏にある手法

VIDRAFTは大規模なGPUファームを購入したわけではありません。その代わりに、チームは「evolutionary merging(進化的マージング)」を用い、複数のオープンソースモデルを反復的に組み合わせ、最も優れたパフォーマンスを発揮するコンポーネントを保持するという手法をとりました。これを控えめな24基のGPUクラスターで実行することで、ゼロからの学習に通常必要となる多額の資本支出なしに、高品質な3,980億パラメータのネットワークを実現しました。

AI分野にとっての意味

  • 参入障壁の低下: エリート級のAIを構築するために、もはや数千基のGPUは必要ありません。

注意点と反論

Darwinは依然として上位2つのモデルに僅差で続いており、その3,980億パラメータというサイズは依然として巨大です。モデルの学習やサービングには、依然として大規模なインフラが必要です。このアプローチは、小規模なクラスター上でのオープンモデルの進化的マージングに依存しています。GPQA Diamondはベンチマークとして機能しました。

今後の注目点

得られる教訓は明確です。巧妙なモデル融合戦略は、生の計算資源の不足を補うことができ、AI研究の最高レベルで誰が競い合えるのかという構図を塗り替えようとしています。