Сімейство GPU NVIDIA Blackwell містить 208 мільярдів транзисторів і може забезпечувати пропускну здатність до 130 ТБ/с у домені з 72 GPU. Цей крок спрямований на трильйонні мовні моделі, які домінують у гонці генеративного ШІ, і змушує операторів дата-центрів переосмислити вибір живлення, охолодження та шасі, перш ніж вони зможуть отримати переваги у швидкості.

Апаратний стрибок

Blackwell використовує спеціалізований техпроцес TSMC 4NP, який жертвує чистою тактовою частотою заради кращої енергоефективності. Кожен GPU складається з двох кристалів, з'єднаних між собою внутрішнім каналом зв'язку швидкістю 10 ТБ/с, що дозволяє парі працювати як єдиний логічний процесор. Архітектура додає Transformer Engine другого покоління, NVLink та NVLink Switch п'ятого покоління, а також блоки, орієнтовані на безпеку, такі як confidential computing, Decompression Engine та RAS (Reliability, Availability, Serviceability).

Найбільш помітною зміною є обробка точності. H100 від Hopper покладався на FP8 для роботи ШІ зі змішаною точністю; Blackwell переходить до масштабування мікротензорів FP4. Нова версія NVLink також піднімає планку для зв'язку між GPU, підтримуючи до 576 GPU в єдиній фабриці та забезпечуючи показник 130 ТБ/с, наведений NVIDIA.

Hopper проти Blackwell на практиці

Характеристика Hopper (H100) Blackwell (B200)
Основне спрямування Змішані навантаження ШІ та HPC Великі мовні моделі
Точність FP8 FP4 micro-tensor
Інтерконект 4-те покоління NVLink 5-те покоління NVLink (до 576 GPU)
Пропускна здатність домену 130 ТБ/с (72 GPU)
Безпека Стандартне введення/виведення GPU Перший GPU з TEE-I/O (довірене середовище виконання)

Таблиця показує, що Blackwell зосереджений на великих мовних моделях.

Проблеми з інфраструктурою

Один GPU Blackwell під навантаженням може споживати до 1 кВт, що наближається до меж типового розподілу електроенергії в дата-центрах. Повітряне охолодження, яке підходить для більшості серверних чипів, не може відводити таке тепло достатньо швидко; контури рідинного охолодження стають необхідною умовою. Форм-фактор також не дозволяє вписати чипи в застарілі шасі. Власними прикладами систем, що можуть вмістити ці чипи, є платформи HGX та DGX від NVIDIA.

Хто отримає вигоду

  • Розробники LLM отримують швидше навчання та донавчання (fine-tuning).
  • Кластери інференсу, що обслуговують чат-додатки, спостерігатимуть за нижчою затримкою та вищою пропускною здатністю завдяки масштабуванню FP4 та величезній пропускній здатності між GPU.
  • Конвеєри аналітики великих даних, які покладаються на аугментацію або сумаризацію на основі трансформерів, зможуть виконувати більше завдань паралельно.
  • Команди з робототехніки, які навчають моделі комп'ютерного зору у великих масштабах, отримають швидші цикли ітерацій, що є важливою перевагою, коли вікна для тестування в реальних умовах обмежені.

Інша сторона медалі

Самі переваги, які роблять Blackwell привабливим, також обмежують його негайний ринок.

На що варто звернути увагу

  • Криві впровадження
  • Готовність програмного стека
  • Модернізація електромереж

Підсумок

Blackwell виводить апаратне забезпечення для ШІ на новий рівень продуктивності, але водночас змушує проводити паралельну модернізацію навколишньої екосистеми.