VIDRAFT'ın 398 milyar parametreli modeli Darwin-398B-JGOS, sadece 24 GPU kullanarak GPQA Diamond liderlik tablosunda üçüncü sıraya yerleşti. Bu sonuç, ezberlenmiş cevaplar yerine gerçek bilimsel akıl yürütme gerektiren bir testte, küçük bir Koreli girişimin dünyanın en büyük yapay zeka laboratuvarlarıyla rekabet edebileceğini kanıtlıyor.

GPQA Diamond neden önemli?

GPQA Diamond, halka açık web sitelerinde bulunmayan lisansüstü düzeyde bilim soruları sorar. Cevaplar kazınamadığı (scrape edilemediği) için, bir modelin depolanmış bir bilgiyi geri çağırmak yerine problem üzerinde akıl yürütmesi gerekir. Bu kıstas (benchmark), ezberlemeyi değil, mantığı zorunlu kılar.

Mevcut liderlik tablosu

  • Kimi-K3 (CN): 93.5
  • GLM-5.2 (CN): 91.2
  • Darwin-398B-JGOS (KR): 90.9
  • DeepSeek-V4-Pro (CN): 90.1
  • Inkling-Small (US): 89.5
  • Qwen3.5-397B-A17B (CN): 88.4
  • Nemotron-3-Ultra-550B (US): 87.9

Darwin, bu tür projeler için tipik olan donanımın çok küçük bir kısmıyla çalışmasına rağmen Nvidia, DeepSeek ve çeşitli ABD ile Çin menşeli modelleri geride bırakıyor.

Başarının arkasındaki yöntem

VIDRAFT devasa bir GPU çiftliği satın almadı. Bunun yerine ekip, birden fazla açık kaynaklı modeli yinelemeli olarak birleştiren ve en iyi performans gösteren bileşenleri tutan “evolutionary merging” (evrimsel birleştirme) yöntemini kullandı. Bunu mütevazı bir 24 GPU'luk kümede çalıştırmak, sıfırdan eğitmek için genellikle gereken sermaye harcamasına gerek kalmadan yüksek kaliteli, 398 milyar parametreli bir ağ sağladı.

Bu, yapay zeka alanı için ne anlama geliyor?

  • Düşen giriş bariyeri: Seçkin yapay zekalar inşa etmek artık binlerce GPU gerektirmiyor.

Uyarılar ve karşı görüşler

Darwin hala iki liderin gerisinde dar bir farkla yer alıyor ve 398 milyar parametreli boyutu hala devasa; modeli eğitmek veya hizmet vermek hala önemli bir altyapı gerektiriyor. Yaklaşım, küçük bir kümede açık modellerin evrimsel birleştirilmesine dayanıyor. GPQA Diamond ise kıstas (benchmark) görevi gördü.

Sırada ne var?

Çıkarılacak ders net: Akıllı model birleştirme stratejileri, ham işlem gücünü dengeleyebilir ve yapay zeka araştırmalarının en üst seviyelerinde kimlerin rekabet edebileceğini yeniden şekillendirebilir.