बेंचमार्क हायलाइट्स
Hot Chips परिषदेने असे आकडे जाहीर केले आहेत जे एका स्वतंत्र संस्थेने InferenceX सुईटद्वारे सत्यापित केले आहेत. OpenAI ने Jalapeño ला एक 'जनरल-पर्पज इन्फरन्स अॅक्सिलरेटर' (general-purpose inference accelerator) म्हटले आहे—हे मॉडेल्स चालवते परंतु त्यांना प्रशिक्षित (train) करत नाही. चाचण्यांमध्ये या चिपने:
- आजच्या आघाडीच्या कंपन्यांच्या तुलनेत पीक थ्रूपुटवर (peak throughput) प्रति वॅट १.५ × ते १.९ × जास्त काम केले.
- लॅटन्सी (latency) १.७ × ते ३.६ × ने कमी केली, तर इंटरअॅक्टिव्ह फायद्यांमध्ये (interactive gains) २.१ × ते ४.१ × वाढ दिसून आली.
मॉडेल-विशिष्ट निकाल:
- GPT-OSS 120B: ~१,४०० टोकन्स/सेकंद/युजर.
- Deepseek R1 670B: एका सिंगल कन्करंट रिक्वेस्टवर (single concurrent request) ~७०० टोकन्स/सेकंद.
- Kimi K2.5 1T: हाय-परफॉर्मन्स सुईटमध्ये तपासले गेले (अचूक आकडेवारी जाहीर केलेली नाही).
OpenAI ने या गोष्टीवर भर दिला की हे आकडे 'स्पेक्युलेटिव्ह डिकोडिंग' (speculative decoding) किंवा 'मल्टी-टोकन प्रेडिक्शन' (multi-token prediction) शिवाय मिळाले आहेत—ही अशी युक्त्या आहेत ज्या अनेक प्रतिस्पर्धी त्यांचे आकडे वाढवण्यासाठी वापरतात.
Jalapeño कसे तयार करण्यात आले
OpenAI ने Broadcom सोबत भागीदारी करून नऊ महिन्यांत या चिपची रचना पूर्ण केली. कंपनीने त्यांच्या स्वतःच्या मॉडेल्सचा वापर डिझाइन प्रक्रियेत केला, ज्यामुळे ब्लूप्रिंटिंग, प्रोग्रामिंग आणि ऑप्टिमायझेशनचा वेग वाढला—या पद्धतीला "AI-assisted silicon design" असे म्हटले जाते. हा वेगवान प्रवास हाय-परफॉर्मन्स सिलिकॉनच्या क्षेत्रातील पूर्वीच्या बहु-वर्षीय चक्रांमधील बदलाला अधोरेखित करतो.
Nvidia च्या आघाडीवर होणारे परिणाम
Nvidia हे त्यांच्या रॉ परफॉर्मन्स (raw performance) आणि CUDA इकोसिस्टमवर अवलंबून आहे. नवीन डेटामुळे त्यांच्या कामगिरीतील आघाडीला आव्हान मिळू शकते. विश्लेषकांनी इशारा दिला आहे की, जर अधिक AI कंपन्यांनी अशाच कार्यक्षमतेसह कस्टम इन्फरन्स सिलिकॉन बाजारात आणले, तर डेव्हलपर्स CUDA कडून दूर जाऊ शकतात, ज्यामुळे पर्यायी स्टॅक्ससाठी (alternative stacks) आणि विखुरलेल्या बाजारपेठेसाठी जागा निर्माण होईल.
OpenAI ची मिश्र-संकेत (Mixed-Signal) रणनीती
मुख्य आर्थिक अधिकारी (CFO) Kelly Huang यांनी Jalapeño ला एका व्यापक कॉम्प्युट प्लॅनचा एक भाग म्हणून मांडले आहे, विद्यमान भागीदारांना पूर्णपणे बदलण्यासाठी नाही. OpenAI अजूनही विविध वर्कलोड्ससाठी Nvidia, AMD, AWS आणि Cerebras सोबत काम करते. Jalapeño अजूनही एक इंजिनिअरिंग सॅम्पल आहे; त्याला अद्याप Deepseek V4 Pro सारख्या मोठ्या आगामी मॉडेल्सचा सामना करावा लागलेला नाही. Huang यांच्या विधानानुसार, OpenAI प्रत्येक कामासाठी सर्वोत्तम 'कॉस्ट-परफॉर्मन्स' (cost-performance) मिळवण्यासाठी स्वतःचे सिलिकॉन आणि थर्ड-पार्टी अॅक्सिलरेटर्स यांचे मिश्रण करेल.
प्रतिवाद
सुरुवातीच्या टप्प्यातील सॅम्पल्स मोठ्या प्रमाणावरील उत्पादन (volume production), यील्ड (yields) किंवा दीर्घकालीन विश्वासार्हतेची हमी देत नाहीत, त्यामुळे उत्साह मर्यादित ठेवणे योग्य ठरेल.
पुढे काय पाहावे
- उत्पादन रोलआउट (Production rollout): OpenAI Jalapeño चे मोठ्या प्रमाणावर उत्पादन करू शकेल का, आणि कोणत्या किमतीत?
- सॉफ्टवेअर स्टॅक (Software stack): डेव्हलपर्ससाठी प्रोग्रामिंग मॉडेल आणि टूलचेन किती प्रगत असेल?
- प्रतिस्पर्ध्यांचा प्रतिसाद: मार्केट शेअर टिकवून ठेवण्यासाठी Nvidia आणि इतर विक्रेते त्यांच्या रोडमॅपमध्ये किंवा किमतींमध्ये काय बदल करतील?
- मॉडेल स्केलिंग (Model scaling): पुढील ट्रिलियन-पॅरामीटर मॉडेल्सच्या लाटेत Jalapeño आपली आघाडी टिकवून ठेवू शकेल का?
निष्कर्ष (Takeaway): कस्टम इन्फरन्स सिलिकॉन आता केवळ एक मर्यादित प्रयोग न राहता Nvidia च्या हार्डवेअर वर्चस्वाला एक विश्वासार्ह आव्हान बनत आहे.
