NVIDIA Blackwell GPU ಕುಟುಂಬವು 208 ಬಿಲಿಯನ್ ಟ್ರಾನ್ಸಿಸ್ಟರ್ಗಳನ್ನು ಒಳಗೊಂಡಿದೆ ಮತ್ತು 72-GPU ಡೊಮೇನ್ನಲ್ಲಿ 130 TB/s ವರೆಗೆ ಬ್ಯಾಂಡ್ವಿಡ್ತ್ ನೀಡಬಲ್ಲದು. ಈ ಕ್ರಮವು ಜನರೇಟಿವ್-AI ಸ್ಪರ್ಧೆಯಲ್ಲಿ ಪ್ರಾಬಲ್ಯ ಸಾಧಿಸುತ್ತಿರುವ ಟ್ರಿಲಿಯನ್-ಪ್ಯಾರಾಮೀಟರ್ ಭಾಷಾ ಮಾದರಿಗಳನ್ನು (language models) ಗುರಿಯಾಗಿಸಿಕೊಂಡಿದೆ ಮತ್ತು ಡೇಟಾ-ಸೆಂಟರ್ ಆಪರೇಟರ್ಗಳು ವೇಗದ ಲಾಭವನ್ನು ಪಡೆಯುವ ಮೊದಲು ಪವರ್, ಕೂಲಿಂಗ್ ಮತ್ತು ಚಾಸಿಸ್ (chassis) ಆಯ್ಕೆಗಳನ್ನು ಮರುಪರಿಶೀಲಿಸುವಂತೆ ಮಾಡುತ್ತದೆ.
ಹಾರ್ಡ್ವೇರ್ ಪ್ರಗತಿ
Blackwell ಉತ್ತಮ ಇಂಧನ ದಕ್ಷತೆಗಾಗಿ (energy efficiency) ಕ್ಲಾಕ್ ಸ್ಪೀಡ್ ಅನ್ನು ಬಲಿಕೊಟ್ಟು, ಕಸ್ಟಮ್ TSMC 4NP ಪ್ರಕ್ರಿಯೆಯನ್ನು ಬಳಸುತ್ತದೆ. ಪ್ರತಿ GPU ಎರಡು ಡೈಗಳನ್ನು (dies) ಒಳಗೊಂಡಿದ್ದು, ಅವುಗಳನ್ನು 10 TB/s ಇಂಟರ್ನಲ್ ಲಿಂಕ್ನೊಂದಿಗೆ ಜೋಡಿಸಲಾಗಿದ್ದು, ಈ ಜೋಡಿಯು ಒಂದೇ ಲಾಜಿಕಲ್ ಪ್ರೊಸೆಸರ್ ಆಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ. ಈ ಆರ್ಕಿಟೆಕ್ಚರ್ ಎರಡನೇ ತಲೆಮಾರಿನ Transformer Engine, ಐದನೇ ತಲೆಮಾರಿನ NVLink ಮತ್ತು NVLink Switch, ಜೊತೆಗೆ 'confidential computing' ಎಂಬ ಭದ್ರತಾ-ಕೇಂದ್ರಿತ ಬ್ಲಾಕ್ಗಳು, Decompression Engine ಮತ್ತು RAS (Reliability, Availability, Serviceability) ಅನ್ನು ಒಳಗೊಂಡಿದೆ.
ಅತಿ ಹೆಚ್ಚು ಗಮನಾರ್ಹ ಬದಲಾವಣೆಯೆಂದರೆ ಪ್ರಿಸಿಸನ್ ಹ್ಯಾಂಡ್ಲಿಂಗ್ (precision handling). Hopper ನ H100 ಮಿಕ್ಸ್ಡ್-ಪ್ರಿಸಿಸನ್ AI ಕೆಲಸಗಳಿಗಾಗಿ FP8 ಅನ್ನು ಅವಲಂಬಿಸಿತ್ತು; Blackwell ಈಗ FP4 ಮೈಕ್ರೋ-ಟೆನ್ಸರ್ ಸ್ಕೇಲಿಂಗ್ಗೆ ಇಳಿದಿದೆ. ಹೊಸ NVLink ಆವೃತ್ತಿಯು GPU-to-GPU ಸಂವಹನದ ಮಿತಿಯನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ, ಇದು ಒಂದೇ ಫ್ಯಾಬ್ರಿಕ್ನಲ್ಲಿ 576 GPUಗಳವರೆಗೆ ಬೆಂಬಲಿಸುತ್ತದೆ ಮತ್ತು NVIDIA ಉಲ್ಲೇಖಿಸಿದ 130 TB/s ಅಂಕಿಅಂಶವನ್ನು ನೀಡುತ್ತದೆ.
ಪ್ರಾಯೋಗಿಕವಾಗಿ Hopper vs. Blackwell
| ವೈಶಿಷ್ಟ್ಯ | Hopper (H100) | Blackwell (B200) |
|---|---|---|
| ಪ್ರಾಥಮಿಕ ಗಮನ | ಮಿಕ್ಸ್ಡ್ AI ಮತ್ತು HPC ವರ್ಕ್ಲೋಡ್ಗಳು | ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳು (Large language models) |
| ಪ್ರಿಸಿಸನ್ | FP8 | FP4 ಮೈಕ್ರೋ-ಟೆನ್ಸರ್ |
| ಇಂಟರ್ಕನೆಕ್ಟ್ | 4th-gen NVLink | 5th-gen NVLink (576 GPUಗಳವರೆಗೆ) |
| ಡೊಮೇನ್ ಬ್ಯಾಂಡ್ವಿಡ್ತ್ | – | 130 TB/s (72-GPU) |
| ಭದ್ರತೆ | ಸ್ಟ್ಯಾಂಡರ್ಡ್ GPU I/O | TEE-I/O (trusted execution environment) ಹೊಂದಿರುವ ಮೊದಲ GPU |
ಈ ಕೋಷ್ಟಕವು Blackwell ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿಗಳ ಮೇಲೆ ಗಮನ ಕೇಂದ್ರೀಕರಿಸುತ್ತದೆ ಎಂದು ತೋರಿಸುತ್ತದೆ.
ಮೂಲಸೌಕರ್ಯದ ಸವಾಲುಗಳು
ಒಂದೇ Blackwell GPU ಲೋಡ್ ಅಡಿಯಲ್ಲಿ 1 kW ವರೆಗೆ ವಿದ್ಯುತ್ ಬಳಸಬಹುದು, ಇದು ಸಾಮಾನ್ಯ ಡೇಟಾ-ಸೆಂಟರ್ ಪವರ್ ಡಿಸ್ಟ್ರಿಬ್ಯೂಷನ್ನ ಮಿತಿಯನ್ನು ತಲುಪಿಸುತ್ತದೆ. ಹೆಚ್ಚಿನ ಸರ್ವರ್-ಗ್ರೇಡ್ ಸಿಲಿಕಾನ್ಗಳಿಗೆ ಕೆಲಸ ಮಾಡುವ ಏರ್ ಕೂಲಿಂಗ್ (Air cooling), ಅಷ್ಟು ಹೆಚ್ಚಿನ ಶಾಖವನ್ನು ವೇಗವಾಗಿ ಹೊರಹಾಕಲು ಸಾಧ್ಯವಿಲ್ಲ; ಆದ್ದರಿಂದ ಲಿಕ್ವಿಡ್-ಕೂಲಿಂಗ್ ಲೂಪ್ಗಳು (liquid-cooling loops) ಅತ್ಯಗತ್ಯವಾಗುತ್ತವೆ. ಇದರ ಫಾರ್ಮ್ ಫ್ಯಾಕ್ಟರ್ ಕೂಡ ಹಳೆಯ ಚಾಸಿಸ್ಗಳಿಗೆ (legacy chassis) ಹೊಂದಿಕೆಯಾಗುವುದಿಲ್ಲ. NVIDIA ನ ಸ್ವಂತ HGX ಮತ್ತು DGX ಪ್ಲಾಟ್ಫಾರ್ಮ್ಗಳು ಈ ಚಿಪ್ಗಳನ್ನು ಹೊಂದಾಣಿಕೆ ಮಾಡಿಕೊಳ್ಳಬಲ್ಲ ಸಿಸ್ಟಮ್ಗಳಿಗೆ ಉದಾಹರಣೆಗಳಾಗಿವೆ.
ಯಾರಿಗೆ ಪ್ರಯೋಜನವಾಗುತ್ತದೆ
- LLM ಡೆವಲಪರ್ಗಳು ವೇಗವಾದ ಟ್ರೈನಿಂಗ್ ಮತ್ತು ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಪಡೆಯುತ್ತಾರೆ.
- FP4 ಸ್ಕೇಲಿಂಗ್ ಮತ್ತು ಬೃಹತ್ ಇಂಟರ್-GPU ಬ್ಯಾಂಡ್ವಿಡ್ತ್ನಿಂದಾಗಿ, ಚಾಟ್-ಟೈಪ್ ಅಪ್ಲಿಕೇಶನ್ಗಳನ್ನು ನೀಡುವ ಇನ್ಫರೆನ್ಸ್ ಕ್ಲಸ್ಟರ್ಗಳು ಕಡಿಮೆ ವಿಳಂಬ (latency) ಮತ್ತು ಹೆಚ್ಚಿನ ಥ್ರೂಪುಟ್ ಅನ್ನು ಕಾಣುತ್ತವೆ.
- ಟ್ರಾನ್ಸ್ಫಾರ್ಮರ್-ಆಧಾರಿತ ಆಗಮೆಂಟೇಶನ್ ಅಥವಾ ಸಮ್ಮರೈಸೇಶನ್ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುವ ಬಿಗ್-ಡೇಟಾ ಅನಾಲಿಟಿಕ್ಸ್ ಪೈಪ್ಲೈನ್ಗಳು ಹೆಚ್ಚು ಕೆಲಸಗಳನ್ನು ಸಮಾಂತರವಾಗಿ (parallel) ನಡೆಸಬಹುದು.
- ದೊಡ್ಡ ಪ್ರಮಾಣದಲ್ಲಿ ವಿಷನ್ ಮಾಡೆಲ್ಗಳನ್ನು ತರಬೇತಿಗೊಳಿಸುವ ರೋಬೊಟಿಕ್ಸ್ ತಂಡಗಳು ವೇಗವಾದ ಇಟರೇಶನ್ ಸೈಕಲ್ಗಳನ್ನು ಪಡೆಯುತ್ತವೆ, ಇದು ನೈಜ-ಪ್ರಪಂಚದ ಪರೀಕ್ಷಾ ಸಮಯವು ಕಡಿಮೆ ಇದ್ದಾಗ ದೊಡ್ಡ ಅನುಕೂಲವಾಗಿದೆ.
ಇನ್ನೊಂದು ಮುಖ
Blackwell ಅನ್ನು ಆಕರ್ಷಕವಾಗಿಸುವ ಶಕ್ತಿಗಳೇ ಅದರ ತಕ್ಷಣದ ಮಾರುಕಟ್ಟೆಯನ್ನು ಸೀಮಿತಗೊಳಿಸುತ್ತವೆ.
ಗಮನಿಸಬೇಕಾದ ಅಂಶಗಳು
- ಅಡಾಪ್ಶನ್ ಕರ್ವ್ಗಳು (Adoption curves)
- ಸಾಫ್ಟ್ವೇರ್ ಸ್ಟ್ಯಾಕ್ ಸಿದ್ಧತೆ (Software stack readiness)
- ಪವರ್-ಗ್ರಿಡ್ ಅಪ್ಗ್ರೇಡ್ಗಳು (Power-grid upgrades)
ಸಾರಾಂಶ
Blackwell AI ಹಾರ್ಡ್ವೇರ್ ಅನ್ನು ಹೊಸ ಮಟ್ಟದ ಕಾರ್ಯಕ್ಷಮತೆಗೆ ತಳ್ಳುತ್ತದೆ, ಆದರೆ ಇದು ಸುತ್ತಮುತ್ತಲಿನ ಪರಿಸರ ವ್ಯವಸ್ಥೆಯ (ecosystem) ಸಮಾನಾಂತರ ಅಪ್ಗ್ರೇಡ್ ಅನ್ನು ಸಹ ಒತ್ತಾಯಿಸುತ್ತದೆ.
