Model 398 miliar parameter milik VIDRAFT, Darwin-398B-JGOS, berhasil meraih peringkat ketiga pada papan peringkat GPQA Diamond hanya dengan menggunakan 24 GPU. Hasil ini membuktikan bahwa startup kecil asal Korea dapat menyaingi laboratorium AI terbesar di dunia dalam pengujian yang menuntut penalaran ilmiah sejati, alih-alih sekadar jawaban yang dihafal.
Mengapa GPQA Diamond penting
GPQA Diamond mengajukan pertanyaan sains tingkat pascasarjana yang tidak muncul di situs web publik. Karena jawabannya tidak dapat diambil melalui teknik scraping, sebuah model harus menalar masalah tersebut alih-alih sekadar mengambil fakta yang tersimpan. Tolok ukur ini menuntut logika, bukan hafalan.
Papan peringkat saat ini
- Kimi-K3 (CN): 93.5
- GLM-5.2 (CN): 91.2
- Darwin-398B-JGOS (KR): 90.9
- DeepSeek-V4-Pro (CN): 90.1
- Inkling-Small (US): 89.5
- Qwen3.5-397B-A17B (CN): 88.4
- Nemotron-3-Ultra-550B (US): 87.9
Darwin melampaui model-model dari Nvidia, DeepSeek, serta beberapa penawaran dari AS dan Tiongkok, meskipun ia berjalan pada sebagian kecil perangkat keras yang biasanya digunakan untuk proyek semacam itu.
Metode di balik kemenangan ini
VIDRAFT tidak membeli lahan GPU yang masif. Sebaliknya, tim tersebut menggunakan “evolutionary merging,” yang secara iteratif menggabungkan beberapa model sumber terbuka (open-source) dan mempertahankan komponen dengan performa terbaik. Menjalankan metode ini pada klaster 24-GPU yang sederhana menghasilkan jaringan 398 miliar parameter berkualitas tinggi tanpa pengeluaran modal besar yang biasanya dibutuhkan untuk melatih model dari awal.
Apa artinya ini bagi bidang AI
- Hambatan masuk yang lebih rendah: Membangun AI elit tidak lagi memerlukan ribuan GPU.
Catatan dan poin sanggahan
Darwin masih tertinggal tipis dari dua pemimpin di atasnya, dan ukuran 398 miliar parameternya tetaplah masif—melatih atau menjalankan (serving) model ini tetap membutuhkan infrastruktur yang signifikan. Pendekatan ini bergantung pada penggabungan evolusioner dari model-model terbuka pada klaster kecil. GPQA Diamond berfungsi sebagai tolok ukurnya.
Apa yang perlu diperhatikan selanjutnya
Kesimpulannya jelas: strategi penggabungan model (model-fusion) yang cerdas dapat mengimbangi kekuatan komputasi mentah, mengubah peta persaingan tentang siapa yang dapat bersaing di tingkat penelitian AI tertinggi.
