बेंचमार्क की मुख्य बातें
Hot Chips कॉन्फ्रेंस में ऐसे आंकड़े पेश किए गए जिन्हें एक स्वतंत्र फर्म ने InferenceX सुइट के साथ सत्यापित किया है। OpenAI, Jalapeño को एक जनरल-पर्पस इन्फरेंस एक्सेलेरेटर (general-purpose inference accelerator) कहता है—यह मॉडल्स को चलाता है लेकिन उन्हें ट्रेन नहीं करता है। परीक्षणों में, इस चिप ने:
- आज के लीडर्स की तुलना में पीक थ्रूपुट (peak throughput) पर प्रति वाट 1.5 × से 1.9 × अधिक कार्य प्रदान किया।
- लेटेंसी (latency) को 1.7 × से 3.6 × तक कम किया, और इंटरैक्टिव लाभ (interactive gains) में 2.1 × से 4.1 × की वृद्धि देखी गई।
मॉडल-विशिष्ट परिणाम:
- GPT-OSS 120B: ~1,400 टोकन/सेकंड/यूज़र।
- Deepseek R1 670B: एक सिंगल कंकरेंट रिक्वेस्ट (single concurrent request) पर ~700 टोकन/सेकंड।
- Kimi K2.5 1T: हाई-परफॉर्मेंस सुइट में परीक्षण किया गया (सटीक आंकड़े नहीं बताए गए)।
OpenAI ने इस बात पर जोर दिया कि ये आंकड़े बिना स्पेकुलेटिव डिकोडिंग (speculative decoding) या मल्टी-टोकन प्रेडिक्शन (multi-token prediction) के प्राप्त हुए हैं—ये वे तकनीकें हैं जिनका उपयोग कई प्रतिद्वंद्वी अपने मुख्य आंकड़ों को बढ़ाने के लिए करते हैं।
Jalapeño कैसे बनाया गया
OpenAI ने Broadcom के साथ साझेदारी करके नौ महीनों में इस चिप का डिज़ाइन पूरा कर लिया। फर्म ने डिज़ाइन लूप में अपने स्वयं के मॉडल्स का उपयोग किया, जिससे ब्लूप्रिंटिंग, प्रोग्रामिंग और ऑप्टिमाइज़ेशन की गति बढ़ गई—इस पद्धति को "AI-assisted silicon design" कहा जाता है। यह तेज़ विकास (sprint) उन बहु-वर्षीय चक्रों से बदलाव को दर्शाता है जो कभी हाई-परफॉर्मेंस सिलिकॉन की पहचान हुआ करते थे।
Nvidia के नेतृत्व के लिए निहितार्थ
Nvidia रॉ परफॉर्मेंस और CUDA इकोसिस्टम पर निर्भर है। नया डेटा परफॉर्मेंस के इस बढ़त को चुनौतीपूर्ण बना देता है। विश्लेषकों ने चेतावनी दी है कि यदि अधिक AI कंपनियां इसी तरह की दक्षता के साथ कस्टम इन्फरेंस सिलिकॉन पेश करती हैं, तो डेवलपर्स CUDA से दूर जा सकते हैं, जिससे वैकल्पिक स्टैक और एक खंडित (fragmented) बाजार के लिए जगह बन जाएगी।
OpenAI की मिश्रित-संकेत रणनीति (Mixed-Signal Strategy)
मुख्य वित्तीय अधिकारी (CFO) Kelly Huang ने Jalapeño को एक व्यापक कंप्यूट योजना के एक हिस्से के रूप में पेश किया, न कि मौजूदा भागीदारों के पूर्ण प्रतिस्थापन के रूप में। OpenAI अभी भी विभिन्न वर्कलोड के लिए Nvidia, AMD, AWS और Cerebras के साथ काम करता है। Jalapeño अभी एक इंजीनियरिंग सैंपल है; इसे अभी Deepseek V4 Pro जैसे बड़े आगामी मॉडल्स का सामना करना बाकी है। Huang की टिप्पणियों से संकेत मिलता है कि OpenAI प्रत्येक कार्य के लिए सर्वोत्तम लागत-प्रदर्शन (cost-performance) संतुलन प्राप्त करने के लिए अपने स्वयं के सिलिकॉन को थर्ड-पार्टी एक्सेलेरेटर्स के साथ मिलाएगा।
प्रतिवाद (Counterpoints)
शुरुआती चरण के सैंपल बड़े पैमाने पर उत्पादन (volume production), यील्ड (yields) या दीर्घकालिक विश्वसनीयता की गारंटी नहीं देते हैं, इसलिए उत्साह को थोड़ा नियंत्रित रखना चाहिए।
आगे क्या देखें
- प्रोडक्शन रोलआउट: क्या OpenAI Jalapeño को बड़े पैमाने पर उत्पादित हिस्से में बदल सकता है, और वह भी किस कीमत पर?
- सॉफ्टवेयर स्टैक: डेवलपर्स के लिए प्रोग्रामिंग मॉडल और टूलचेन कितनी परिपक्व होगी?
- प्रतिद्वंद्वी की प्रतिक्रिया: मार्केट शेयर बचाने के लिए Nvidia और अन्य विक्रेता अपने रोडमैप या कीमतों में कैसे बदलाव करेंगे?
- मॉडल स्केलिंग: क्या Jalapeño ट्रिलियन-पैरामीटर मॉडल्स की अगली लहर पर अपनी बढ़त बनाए रख पाएगा?
निष्कर्ष: कस्टम इन्फरेंस सिलिकॉन एक सीमित प्रयोग (niche experiment) से निकलकर Nvidia के हार्डवेयर प्रभुत्व के लिए एक विश्वसनीय चुनौती बनता जा रहा है।
