NVIDIA 的 Blackwell GPU 系列拥有 2080 亿个晶体管,在 72 个 GPU 组成的域(domain)中可提供高达 130 TB/s 的带宽。此举旨在应对主导生成式 AI 竞赛的万亿参数语言模型,并迫使数据中心运营商在获得速度提升之前,重新思考功耗、冷却和机箱的选择。

硬件飞跃

Blackwell 采用定制的 TSMC 4NP 工艺,通过牺牲原始时钟频率来换取更高的能效。每个 GPU 由两个通过 10 TB/s 内部链路连接在一起的晶粒(dies)组成,使这对晶粒能够作为一个单一的逻辑处理器运行。该架构增加了第二代 Transformer Engine、第五代 NVLink 和 NVLink Switch,以及名为机密计算(confidential computing)的安全模块、解压缩引擎(Decompression Engine)和 RAS(可靠性、可用性、可维护性)。

最显著的变化在于精度处理。Hopper 架构的 H100 在混合精度 AI 工作中依赖 FP8;而 Blackwell 则降至 FP4 微张量(micro-tensor)缩放。新版本的 NVLink 还提高了 GPU 间通信的上限,在单个网络(fabric)中支持多达 576 个 GPU,并实现了 NVIDIA 所引用的 130 TB/s 带宽。

Hopper 与 Blackwell 的实际对比

特性 Hopper (H100) Blackwell (B200)
主要侧重 混合 AI 和 HPC 工作负载 大语言模型
精度 FP8 FP4 微张量
互连 第 4 代 NVLink 第 5 代 NVLink (支持多达 576 个 GPU)
域带宽 130 TB/s (72 个 GPU)
安全性 标准 GPU I/O 首款具备 TEE-I/O (可信执行环境) 的 GPU

表格显示 Blackwell 专注于大语言模型。

基础设施难题

单个 Blackwell GPU 在负载下功耗可达 1 kW,挑战了典型数据中心配电的极限。适用于大多数服务器级芯片的风冷技术无法足够快地散发这种热量;液冷循环成为了必要前提。其外形尺寸也无法适配传统的机箱。NVIDIA 自有的 HGX 和 DGX 平台是能够容纳这些芯片的系统示例。

谁将受益

  • LLM 开发人员将获得更快的训练和微调速度。
  • 推理集群(用于聊天类应用)得益于 FP4 缩放和巨大的 GPU 间带宽,将实现更低的延迟和更高的吞吐量。
  • 大数据分析流水线(依赖基于 Transformer 的增强或摘要技术)可以并行运行更多任务。
  • 机器人团队在进行大规模视觉模型训练时,可以享受更快的迭代周期,这在现实世界测试窗口较窄时是一项优势。

硬币的另一面

正是那些让 Blackwell 极具吸引力的优势,也限制了其眼下的市场规模。

值得关注的方面

  • 采用曲线
  • 软件栈就绪程度
  • 电网升级

总结

Blackwell 将 AI 硬件推向了原始性能的新高度,但同时也迫使周边生态系统进行同步升级。