NVIDIA ના Blackwell GPU ફેમિલીમાં 208 અબજ ટ્રાન્ઝિસ્ટર છે અને તે 72-GPU ડોમેનમાં 130 TB/s સુધીની બેન્ડવિડ્થ આપી શકે છે. આ પગલું એવા ટ્રિલિયન-પેરામીટર ધરાવતા લેંગ્વેજ મોડલ્સને લક્ષ્ય બનાવે છે જે જનરેટિવ-AI ની સ્પર્ધામાં પ્રભુત્વ ધરાવે છે અને ડેટા-સેન્ટર ઓપરેટરોને સ્પીડના ફાયદા મેળવતા પહેલા પાવર, કૂલિંગ અને ચેસિસના વિકલ્પો વિશે ફરીથી વિચારવા માટે મજબૂર કરે છે.
હાર્ડવેર ક્ષેત્રે મોટી છલાંગ
Blackwell એ કસ્ટમ TSMC 4NP પ્રોસેસનો ઉપયોગ કરે છે જે વધુ સારી ઉર્જા કાર્યક્ષમતા માટે ક્લોક સ્પીડનો ત્યાગ કરે છે. દરેક GPU માં બે ડાઇઝ (dies) હોય છે જે 10 TB/s ના ઇન્ટરનલ લિંક સાથે જોડાયેલા હોય છે, જે આ જોડીને સિંગલ લોજિકલ પ્રોસેસર તરીકે કાર્ય કરવા દે છે. આ આર્કિટેક્ચરમાં બીજી પેઢીનું Transformer Engine, પાંચમી પેઢીનું NVLink અને NVLink Switch, તેમજ કોન્ફિડેન્શિયલ કમ્પ્યુટિંગ (confidential computing) તરીકે ઓળખાતા સુરક્ષા-કેન્દ્રિત બ્લોક્સ, એક Decompression Engine અને RAS (Reliability, Availability, Serviceability) ઉમેરવામાં આવ્યા છે.
સૌથી મોટો દેખીતો ફેરફાર પ્રિસિઝન હેન્ડલિંગમાં છે. Hopper ના H100 મિશ્ર-પ્રિસિઝન AI કાર્ય માટે FP8 પર આધારિત હતા; Blackwell હવે FP4 માઇક્રો-ટેન્સર સ્કેલિંગ પર આવી ગયું છે. નવું NVLink વર્ઝન GPU-to-GPU કોમ્યુનિકેશનની ક્ષમતામાં પણ વધારો કરે છે, જે સિંગલ ફેબ્રિકમાં 576 GPU સુધીનું સપોર્ટ કરે છે અને NVIDIA દ્વારા જણાવેલ 130 TB/s ની આંકડો પૂરો પાડે છે.
પ્રેક્ટિકલમાં Hopper વિરુદ્ધ Blackwell
| વિશેષતા | Hopper (H100) | Blackwell (B200) |
|---|---|---|
| મુખ્ય ધ્યાન | મિશ્રિત AI અને HPC વર્કલોડ્સ | મોટા લેંગ્વેજ મોડલ્સ |
| પ્રિસિઝન | FP8 | FP4 માઇક્રો-ટેન્સર |
| ઇન્ટરકનેક્ટ | 4th-gen NVLink | 5th-gen NVLink (576 GPU સુધી) |
| ડોમેન બેન્ડવિડ્થ | – | 130 TB/s (72-GPU) |
| સુરક્ષા | સ્ટાન્ડર્ડ GPU I/O | TEE-I/O (trusted execution environment) ધરાવતું પ્રથમ GPU |
આ કોષ્ટક દર્શાવે છે કે Blackwell મોટા લેંગ્વેજ મોડલ્સ પર ધ્યાન કેન્દ્રિત કરે છે.
ઇન્ફ્રાસ્ટ્રક્ચરની મુશ્કેલીઓ
એક સિંગલ Blackwell GPU લોડ હેઠળ 1 kW જેટલો પાવર વાપરી શકે છે, જે સામાન્ય ડેટા-સેન્ટર પાવર ડિસ્ટ્રિબ્યુશનની મર્યાદાઓ વધારી દે છે. એર કૂલિંગ, જે મોટાભાગના સર્વર-ગ્રેડ સિલિકોન માટે કામ કરે છે, તેટલી ઝડપથી ગરમી દૂર કરી શકતું નથી; લિક્વિડ-કૂલિંગ લૂપ્સ અનિવાર્ય બની જાય છે. આનું ફોર્મ ફેક્ટર પણ જૂના ચેસિસમાં ફિટ થતું નથી. NVIDIA ના પોતાના HGX અને DGX પ્લેટફોર્મ એવા સિસ્ટમોના ઉદાહરણો છે જે આ ચિપ્સને સમાવી શકે છે.
કોને ફાયદો થશે
- LLM ડેવલપર્સ ને ઝડપી ટ્રેનિંગ અને ફાઇન-ટ્યુનિંગનો લાભ મળશે.
- ઇન્ફરન્સ ક્લસ્ટર્સ જે ચેટ-પ્રકારની એપ્લિકેશન્સ પૂરી પાડે છે, તેઓ FP4 સ્કેલિંગ અને વિશાળ ઇન્ટર-GPU બેન્ડવિડ્થને કારણે ઓછી લેટન્સી અને વધુ થ્રુપુટનો અનુભવ કરશે.
- બિગ-ડેટા એનાલિટિક્સ પાઇપલાઇન્સ જે ટ્રાન્સફોર્મર-આધારિત ઓગમેન્ટેશન અથવા સમરાઇઝેશન પર આધારિત છે, તેઓ વધુ જોબ્સ સમાંતર રીતે ચલાવી શકે છે.
- રોબોટિક્સ ટીમો જે સ્કેલ પર વિઝન મોડલ્સ ટ્રેન કરે છે, તેઓ ઝડપી ઇટરેશન સાયકલનો લાભ મેળવી શકે છે, જે વાસ્તવિક દુનિયાના ટેસ્ટિંગ વિન્ડો જ્યારે મર્યાદિત હોય ત્યારે એક મોટો ફાય
