VIDRAFT के 398-बिलियन-पैरामीटर मॉडल, Darwin-398B-JGOS ने मात्र 24 GPUs का उपयोग करके GPQA Diamond लीडरबोर्ड पर तीसरा स्थान हासिल किया। यह परिणाम साबित करता है कि एक छोटा कोरियाई स्टार्टअप उस परीक्षण में दुनिया की सबसे बड़ी AI लैब्स को टक्कर दे सकता है, जो रटे-रटाए उत्तरों के बजाय वास्तविक वैज्ञानिक तर्क (scientific reasoning) की मांग करता है।

GPQA Diamond क्यों महत्वपूर्ण है

GPQA Diamond स्नातक स्तर (graduate-level) के विज्ञान से जुड़े ऐसे प्रश्न पूछता है जो सार्वजनिक वेबसाइटों पर उपलब्ध नहीं होते हैं। चूंकि इनके उत्तरों को स्क्रैप (scrape) नहीं किया जा सकता, इसलिए मॉडल को किसी संग्रहीत तथ्य को खोजने के बजाय समस्या के माध्यम से तर्क करना पड़ता है। यह बेंचमार्क रटने के बजाय तर्कशक्ति (logic) पर जोर देता है।

वर्तमान लीडरबोर्ड

  • Kimi-K3 (CN): 93.5
  • GLM-5.2 (CN): 91.2
  • Darwin-398B-JGOS (KR): 90.9
  • DeepSeek-V4-Pro (CN): 90.1
  • Inkling-Small (US): 89.5
  • Qwen3.5-397B-A17B (CN): 88.4
  • Nemotron-3-Ultra-550B (US): 87.9

Darwin, Nvidia, DeepSeek और कई अमेरिकी एवं चीनी मॉडलों से आगे निकल गया है, भले ही यह ऐसे प्रोजेक्ट्स के लिए आमतौर पर उपयोग किए जाने वाले हार्डवेयर के एक बहुत छोटे हिस्से पर चलता है।

जीत के पीछे की विधि

VIDRAFT ने कोई विशाल GPU फार्म नहीं खरीदा। इसके बजाय, टीम ने “evolutionary merging” का उपयोग किया, जिसमें कई ओपन-सोर्स मॉडलों को बार-बार संयोजित किया गया और सबसे बेहतर प्रदर्शन करने वाले घटकों को रखा गया। एक मामूली 24-GPU क्लस्टर पर इसे चलाने से बिना किसी भारी पूंजी निवेश (capital outlay) के, जो आमतौर पर शुरुआत से प्रशिक्षण देने के लिए आवश्यक होता है, एक उच्च गुणवत्ता वाला 398-बिलियन-पैरामीटर नेटवर्क प्राप्त हुआ।

AI क्षेत्र के लिए इसका क्या अर्थ है

  • प्रवेश बाधा में कमी: अब एलीट AI बनाने के लिए हजारों GPUs की आवश्यकता नहीं है।

सावधानियां और प्रति-तर्क

Darwin अभी भी दो शीर्ष मॉडलों से थोड़े अंतर से पीछे है, और इसका 398-बिलियन-पैरामीटर आकार अभी भी विशाल है—मॉडल को प्रशिक्षित करने या सेवा देने के लिए अभी भी महत्वपूर्ण बुनियादी ढांचे (infrastructure) की आवश्यकता होती है। यह दृष्टिकोण एक छोटे क्लस्टर पर ओपन मॉडलों के evolutionary merging पर निर्भर करता है। GPQA Diamond ने बेंचमार्क के रूप में कार्य किया।

आगे क्या देखने की आवश्यकता है

निष्कर्ष स्पष्ट है: चतुर मॉडल-फ्यूजन रणनीतियां कच्चे कंप्यूट (raw compute) की कमी को पूरा कर सकती हैं, जिससे यह बदल जाएगा कि AI अनुसंधान के उच्चतम स्तरों पर कौन प्रतिस्पर्धा कर सकता है।