OpenAI-ன் புதிய Jalapeño inference சிப், InferenceX பெஞ்ச்மார்க்கில் Nvidia-வின் Blackwell-ஐ விடச் சிறப்பாகச் செயல்பட்டு, ஒரு வாட்டிற்கு (watt) 1.5x முதல் 1.9x வரை அதிக AI வேலைப்பழுவையும், குறிப்பிடத்தக்க அளவில் குறைந்த தாமதத்தையும் (latency) வழங்குகிறது. இந்த முடிவு முக்கியமானது, ஏனெனில் இது பெரிய அளவிலான மொழி மாதிரி (language-model) சேவைகளின் இயக்கச் செலவைக் குறைக்கக்கூடும் மற்றும் AI முடுக்கி (accelerators) சந்தையில் Nvidia-வின் ஆதிக்கத்திற்கு அழுத்தம் கொடுக்கக்கூடும்.
இந்த சிப் ஏன் முக்கியமானது
OpenAI, Hot Chips 2026 மாநாட்டில் Jalapeño-வை அறிமுகப்படுத்தியதுடன், இந்த சிலிக்கான் தயாரிப்பில் Broadcom உடனான கூட்டாண்மையையும் முன்னிலைப்படுத்தியது. தற்போதைய inference குழாய்களில் (pipelines) உள்ள மிகப்பெரிய திறமையின்மையைக் குறைக்க வடிவமைப்பாளர்கள் இலக்கு வைத்துள்ளனர்: அதாவது prefill நிலையில் தரவு நகர்வு மற்றும் கணக்கீட்டு அலகுகளுக்கு இடையிலான தொடர்பு. key-value (KV) cache-ஐ உள்ளூரிலேயே (local) வைத்திருப்பதன் மூலம், Jalapeño டென்சர்களை (tensors) மாற்றுவதற்குத் தேவைப்படும் நேரத்தைக் குறைக்கிறது, இது டோக்கன் உருவாக்கத்தை (token generation) வேகப்படுத்துவதோடு ஆற்றலையும் சேமிக்கிறது.
குறிப்பிடத்தக்க எண்கள்
- ஒரு வாட்டிற்கு AI வேலைப்பழு (AI work per watt): Blackwell-ஐ விட உச்சத் திறனில் (peak throughput) 1.5x முதல் 1.9x வரை அதிகம்.
- தாமதம் (Latency): 1.7x முதல் 3.6x வரை குறைவு, இதனால் ஊடாடும் பயனர்களுக்கு பதில்கள் விரைவாகக் கிடைக்கும்.
- ஊடாடும் வேலைப்பழு செயல்திறன் (Interactive workload performance): 2.1x முதல் 4.1x வரை அதிகம், இந்த முன்னேற்றம் சாட் (chat) வகை பயன்பாடுகளில் நேரடியாகத் தாக்கத்தை ஏற்படுத்துகிறது.
இந்த முன்னேற்றங்கள் InferenceX பெஞ்ச்மார்க்கில் காணப்படுகின்றன, அங்கு Jalapeño, Nvidia-வின் வரவிருக்கும் Rubin சிப்களையும் மிஞ்சியது.
வணிகத் தாக்கம்
OpenAI ஏற்கனவே இந்த செயல்திறன் முன்னேற்றத்தைப் பயன்படுத்தி தனது GPT-5.6 Sol API விலையைக் குறைத்து வருகிறது, இது முந்தைய விகிதங்களை விட 20% முதல் 33% வரை தள்ளுபடியை வழங்குகிறது. குறைந்த மின் நுகர்வு, மிகப்பெரிய inference கிளஸ்டர்களை (clusters) இயக்குவதற்கான செலவைக் குறைக்கிறது, இது டெவலப்பர்கள் மற்றும் நிறுவனங்களால் உணரக்கூடிய ஒரு சேமிப்பாகும்.
கால அளவு மற்றும் போட்டி அழுத்தம்
Jalapeño 2026 இறுதிக்குள் குறைந்த அளவிலான விநியோகத்தில் (limited volumes) சந்தைக்கு வரும், 2027-ல் பெருமளவிலான உற்பத்தி திட்டமிடப்பட்டுள்ளது. அதற்குள் Nvidia புதிய GPU தலைப்புகளை எதிர்பார்க்கிறது, இது இடைவெளியைக் குறைக்கக்கூடும். போட்டியாளர்கள் புதிய சிலிக்கான்களை அறிமுகப்படுத்துவதற்கு முன்பே, நிஜ உலகப் பயன்களை OpenAI நிரூபிக்க வேண்டிய கட்டாயத்தை இந்த படிப்படியான அறிமுகம் (staggered rollout) ஏற்படுத்துகிறது.
எதிர்வாதம்
அதற்குள் Nvidia சந்தையில் புதிய சிப்களைக் கொண்டு வந்திருக்க வாய்ப்புள்ளது.
கவனிக்க வேண்டியவை
- பயன்படுத்தும் தரவு (Deployment data): தாமதம் மற்றும் மின் சேமிப்பு குறித்த ஆரம்பகால வாடிக்கையாளர் கருத்துக்கள், பெஞ்ச்மார்க் எண்கள் உற்பத்தியில் (production) நிலைத்திருக்கிறதா என்பதைக் காட்டும்.
- விலை நிர்ணய உத்தி (Pricing strategy): தொடர்ச்சியான API விலை குறைப்பு, மற்ற வழங்குநர்களை இதே போன்ற வன்பொருளை நோக்கித் தள்ளக்கூடும் அல்லது சந்தைப் பங்குகளை இழக்கும் அபாயத்தை ஏற்படுத்தக்கூடும்.
- Nvidia-வின் சாலை வரைபடம் (Roadmap): புதிய inference-அடிப்படையிலான முடுக்கியின் (accelerator) அறிவிப்பு, போட்டிச் சூழலை மாற்றியமைக்கும்.
OpenAI-ன் முழு-ஸ்டாக் அணுகுமுறை (full-stack approach)—அதாவது மாதிரிகள் (models), சிப்கள் மற்றும் நினைவகத்தை (memory) ஒன்றாக உருவாக்குவது—சாதாரண முடுக்கிகளுக்கு (accelerators) இல்லாத ஒரு பலத்தை அதற்கு வழங்குகிறது. அந்த பலம் ஒரு நிலையான சந்தை மாற்றமாக மாறுமா என்பது, Jalapeño சிப் முன்மாதிரியில் (prototype) இருந்து எவ்வளவு விரைவாக பரவலான பயன்பாட்டிற்கு மாறுகிறது மற்றும் Nvidia இந்த செயல்திறன் சவாலுக்கு எவ்வாறு பதிலளிக்கிறது என்பதைப் பொறுத்தது.
