Il modello da 398 miliardi di parametri di VIDRAFT, Darwin-398B-JGOS, si è aggiudicato il terzo posto nella classifica GPQA Diamond utilizzando solo 24 GPU. Il risultato dimostra che una piccola startup coreana può competere con i più grandi laboratori di IA al mondo in un test che richiede un vero ragionamento scientifico invece di risposte memorizzate.
Perché GPQA Diamond è importante
GPQA Diamond pone domande scientifiche di livello universitario che non compaiono sui siti web pubblici. Poiché le risposte non possono essere estratte tramite scraping, un modello deve ragionare sul problema invece di recuperare un fatto memorizzato. Il benchmark impone la logica, non la memorizzazione.
La classifica attuale
- Kimi-K3 (CN): 93.5
- GLM-5.2 (CN): 91.2
- Darwin-398B-JGOS (KR): 90.9
- DeepSeek-V4-Pro (CN): 90.1
- Inkling-Small (US): 89.5
- Qwen3.5-397B-A17B (CN): 88.4
- Nemotron-3-Ultra-550B (US): 87.9
Darwin supera modelli di Nvidia, DeepSeek e diverse soluzioni statunitensi e cinesi, nonostante giri su una frazione dell'hardware tipicamente impiegato per progetti di questo tipo.
Il metodo dietro la vittoria
VIDRAFT non ha acquistato una massiccia farm di GPU. Invece, il team ha utilizzato l'“evolutionary merging”, combinando iterativamente più modelli open-source e mantenendo i componenti con le migliori prestazioni. L'esecuzione di questo processo su un modesto cluster di 24 GPU ha prodotto una rete di alta qualità da 398 miliardi di parametri, senza l'ingente esborso di capitale solitamente necessario per l'addestramento da zero.
Cosa significa per il campo dell'IA
- Barriera all'ingresso ridotta: Costruire un'IA d'élite non richiede più migliaia di GPU.
Avvertenze e controargomentazioni
Darwin è ancora leggermente dietro ai primi due in classifica e la sua dimensione di 398 miliardi di parametri rimane enorme: l'addestramento o l'erogazione del modello richiedono comunque un'infrastruttura significativa. L'approccio si basa sull'evolutionary merging di modelli open su un piccolo cluster. GPQA Diamond è servito come benchmark.
Cosa osservare in futuro
Il messaggio è chiaro: strategie intelligenti di fusione dei modelli possono compensare la potenza di calcolo bruta, ridefinendo chi può competere ai massimi livelli della ricerca sull'IA.
