Le modèle de VIDRAFT à 398 milliards de paramètres, Darwin-398B-JGOS, s'est hissé à la troisième place du classement GPQA Diamond en utilisant seulement 24 GPU. Ce résultat prouve qu'une petite startup coréenne peut rivaliser avec les plus grands laboratoires d'IA au monde sur un test qui exige un véritable raisonnement scientifique plutôt que des réponses mémorisées.
Pourquoi le GPQA Diamond est important
Le GPQA Diamond pose des questions scientifiques de niveau universitaire qui ne figurent pas sur les sites web publics. Comme les réponses ne peuvent pas être extraites par scraping, le modèle doit raisonner pour résoudre le problème plutôt que de récupérer un fait stocké. Ce benchmark impose la logique, et non la mémorisation.
Le classement actuel
- Kimi-K3 (CN): 93.5
- GLM-5.2 (CN): 91.2
- Darwin-398B-JGOS (KR): 90.9
- DeepSeek-V4-Pro (CN): 90.1
- Inkling-Small (US): 89.5
- Qwen3.5-397B-A17B (CN): 88.4
- Nemotron-3-Ultra-550B (US): 87.9
Darwin surpasse les modèles de Nvidia, DeepSeek et de plusieurs offres américaines et chinoises, bien qu'il fonctionne sur une fraction du matériel habituellement utilisé pour de tels projets.
La méthode derrière cette victoire
VIDRAFT n'a pas acheté une ferme de GPU massive. À la place, l'équipe a utilisé le « fusionnement évolutif » (evolutionary merging), combinant de manière itérative plusieurs modèles open-source et en conservant les composants les plus performants. L'exécution de cette méthode sur un modeste cluster de 24 GPU a permis d'obtenir un réseau de haute qualité à 398 milliards de paramètres, sans l'investissement en capital habituellement nécessaire pour un entraînement à partir de zéro.
Ce que cela signifie pour le domaine de l'IA
- Barrière à l'entrée abaissée : La création d'une IA d'élite ne nécessite plus des milliers de GPU.
Nuances et contre-arguments
Darwin reste néanmoins proche des deux leaders, avec une faible marge, et sa taille de 398 milliards de paramètres demeure massive — l'entraînement ou le déploiement du modèle exige toujours une infrastructure importante. L'approche repose sur le fusionnement évolutif de modèles ouverts sur un petit cluster. Le GPQA Diamond a servi de référence.
À surveiller ensuite
La conclusion est claire : des stratégies intelligentes de fusion de modèles peuvent compenser la puissance de calcul brute, redéfinissant ainsi qui peut rivaliser aux plus hauts niveaux de la recherche en IA.
