NVIDIA च्या Blackwell GPU फॅमिलीमध्ये २०८ अब्ज ट्रान्झिस्टर्स आहेत आणि ७२-GPU डोमेनमध्ये ती १३० TB/s पर्यंत बँडविड्थ देऊ शकते. हे पाऊल जनरेटिव्ह-AI शर्यतीत वर्चस्व गाजवणाऱ्या ट्रिलियन-पॅरामीटर लँग्वेज मॉडेल्सना लक्ष्य करते आणि वेगाचा फायदा मिळवण्यापूर्वी डेटा-सेंटर ऑपरेटर्सना पॉवर, कूलिंग आणि चेसिसच्या निवडींचा पुनर्विचार करण्यास भाग पाडते.
हार्डवेअरमधील मोठी झेप
Blackwell मध्ये कस्टम TSMC 4NP प्रोसेस वापरली आहे, जी अधिक ऊर्जा कार्यक्षमतेसाठी (energy efficiency) रॉ क्लॉक स्पीडचा त्याग करते. प्रत्येक GPU मध्ये दोन 'dies' असतात जे १० TB/s अंतर्गत लिंकने जोडलेले असतात, ज्यामुळे ही जोडी एका सिंगल लॉजिकल प्रोसेसरप्रमाणे काम करू शकते. या आर्किटेक्चरमध्ये दुसऱ्या पिढीचे Transformer Engine, पाचव्या पिढीचे NVLink आणि NVLink Switch, तसेच confidential computing नावाचे सुरक्षा-केंद्रित ब्लॉक्स, Decompression Engine आणि RAS (Reliability, Availability, Serviceability) समाविष्ट आहेत.
सर्वात मोठा बदल म्हणजे प्रिसिजन हँडलिंग (precision handling). Hopper च्या H100 मध्ये मिक्स-प्रिसिजन AI कामासाठी FP8 वर अवलंबून राहण्यात यायचे; Blackwell मध्ये ते FP4 micro-tensor स्केलिंगपर्यंत खाली आले आहे. नवीन NVLink व्हर्जन GPU-to-GPU कम्युनिकेशनची क्षमता देखील वाढवते, जे एका सिंगल फॅब्रिकमध्ये ५७६ GPUs पर्यंत सपोर्ट करते आणि NVIDIA ने सांगितल्याप्रमाणे १३० TB/s बँडविड्थ प्रदान करते.
प्रॅक्टिकल वापरामध्ये Hopper विरुद्ध Blackwell
| वैशिष्ट्य (Feature) | Hopper (H100) | Blackwell (B200) |
|---|---|---|
| मुख्य लक्ष (Primary focus) | Mixed AI आणि HPC वर्कलोड्स | Large language models |
| प्रिसिजन (Precision) | FP8 | FP4 micro-tensor |
| इंटरकनेक्ट (Interconnect) | 4th-gen NVLink | 5th-gen NVLink (५७६ GPUs पर्यंत) |
| डोमेन बँडविड्थ (Domain bandwidth) | – | १३० TB/s (७२-GPU) |
| सुरक्षा (Security) | Standard GPU I/O | TEE-I/O (trusted execution environment) सह पहिले GPU |
ही टेबल दर्शवते की Blackwell चे लक्ष Large language models वर आहे.
इन्फ्रास्ट्रक्चरमधील अडचणी
लोड असताना एक सिंगल Blackwell GPU १ kW पर्यंत वीज वापरू शकतो, ज्यामुळे सामान्य डेटा-सेंटर पॉवर डिस्ट्रिब्युशनच्या मर्यादा ओलांडल्या जातात. एअर कूलिंग, जे बहुतेक सर्व्हर-ग्रेड सिलिकॉनसाठी उपयुक्त ठरते, ते इतकी उष्णता वेगाने बाहेर काढू शकत नाही; त्यामुळे लिक्विड-कूलिंग लूप्स ही एक पूर्वअट बनते. याचा फॉर्म फॅक्टर देखील जुन्या (legacy) चेसिसमध्ये बसत नाही. NVIDIA चे स्वतःचे HGX आणि DGX प्लॅटफॉर्म्स ही अशी सिस्टिम्स आहेत जी या चिप्सना सामावून घेऊ शकतात.
कोणाला फायदा होईल
- LLM डेव्हलपर्सना जलद ट्रेनिंग आणि फाईन-ट्यूनिंगचा फायदा होईल.
- Inference क्लस्टर्सना, जे चॅट-प्रकारच्या ॲप्लिकेशन्ससाठी वापरले जातात, FP4 स्केलिंग आणि प्रचंड inter-GPU बँडविड्थमुळे कमी लॅटन्सी (latency) आणि उच्च थ्रूपुट (throughput) मिळेल.
- Big-data analytics पाईपलाईन्स, ज्या transformer-आधारित augmentation किंवा summarization वर अवलंबून आहेत, त्या अधिक जॉब्स समांतरपणे (parallel) चालवू शकतील.
- रोबोटिक्स टीम्स, ज्या मोठ्या प्रमाणावर व्हिजन मॉडेल्स ट्रेन करत आहेत, त्यांना जलद इटरेशन सायकलचा फायदा मिळेल, जे रिअल-वर्ल्ड टेस्टिंगसाठी मर्यादित वेळ असताना अत्यंत उपयुक्त ठरते.
नाण्याला दुसरी बाजू देखील आहे
ज्या ताकदीमुळे Blackwell आकर्षक वाटते, त्याच गोष्टी त्याच्या तात्काळ मार्केटला मर्यादित देखील करतात.
काय लक्ष ठेवण्यासारखे आहे
- वापराचे प्रमाण (Adoption curves)
- सॉफ्टवेअर स्टॅकची सज्जता (Software stack readiness)
- पॉवर-ग्रिड अपग्रेड्स (Power-grid upgrades)
निष्कर्ष
Blackwell AI हार्डवेअरला रॉ परफॉर्मन्सच्या एका नवीन टप्प्यावर नेते, परंतु यामुळे सभोवतालच्या इकोसिस्टमला देखील समांतरपणे अपग्रेड करण्यास भाग पडते.
