Dòng GPU Blackwell của NVIDIA sở hữu 208 tỷ bóng bán dẫn và có thể cung cấp băng thông lên tới 130 TB/s trong một miền (domain) gồm 72 GPU. Bước đi này nhắm tới các mô hình ngôn ngữ hàng nghìn tỷ tham số đang thống trị cuộc đua AI tạo sinh, đồng thời buộc các nhà vận hành trung tâm dữ liệu phải tính toán lại các lựa chọn về nguồn điện, làm mát và khung máy (chassis) trước khi có thể tận dụng được những lợi thế về tốc độ.

Bước nhảy vọt về phần cứng

Blackwell sử dụng quy trình TSMC 4NP tùy chỉnh, chấp nhận hy sinh tốc độ xung nhịp thuần túy để đổi lấy hiệu suất năng lượng tốt hơn. Mỗi GPU bao gồm hai đế chip (die) được kết nối với nhau bằng một liên kết nội bộ 10 TB/s, cho phép cặp chip này hoạt động như một bộ xử lý logic duy nhất. Kiến trúc này bổ sung Transformer Engine thế hệ thứ hai, NVLink và NVLink Switch thế hệ thứ năm, cùng các khối tập trung vào bảo mật được gọi là tính toán bảo mật (confidential computing), một Công cụ Giải nén (Decompression Engine) và RAS (Độ tin cậy, Tính sẵn sàng, Khả năng bảo trì).

Thay đổi dễ nhận thấy nhất là cách xử lý độ chính xác. H100 của dòng Hopper dựa vào FP8 cho các tác vụ AI độ chính xác hỗn hợp; Blackwell hạ xuống mức tỷ lệ micro-tensor FP4. Phiên bản NVLink mới cũng nâng cao giới hạn giao tiếp giữa các GPU, hỗ trợ lên đến 576 GPU trong một cấu trúc mạng (fabric) duy nhất và đạt được con số 130 TB/s như NVIDIA đã công bố.

So sánh Hopper và Blackwell trong thực tế

Tính năng Hopper (H100) Blackwell (B200)
Trọng tâm chính Các khối lượng công việc AI và HPC hỗn hợp Các mô hình ngôn ngữ lớn
Độ chính xác FP8 FP4 micro-tensor
Kết nối liên thông NVLink thế hệ 4 NVLink thế hệ 5 (lên đến 576 GPU)
Băng thông miền 130 TB/s (72-GPU)
Bảo mật I/O GPU tiêu chuẩn GPU đầu tiên với TEE-I/O (môi trường thực thi đáng tin cậy)

Bảng cho thấy Blackwell tập trung vào các mô hình ngôn ngữ lớn.

Những thách thức về hạ tầng

Một GPU Blackwell đơn lẻ có thể tiêu thụ tới 1 kW khi hoạt động hết công suất, đẩy các giới hạn phân phối điện năng thông thường của trung tâm dữ liệu lên mức cao. Làm mát bằng không khí, vốn hoạt động tốt với hầu hết các chip cấp máy chủ, không thể tản nhiệt nhanh chóng đến mức đó; các vòng lặp làm mát bằng chất lỏng trở thành một điều kiện tiên quyết. Kích thước vật lý (form factor) cũng không thể vừa với các khung máy cũ. Các nền tảng HGX và DGX của chính NVIDIA là những ví dụ về các hệ thống có thể đáp ứng được các con chip này.

Ai sẽ được hưởng lợi

  • Các nhà phát triển LLM có được tốc độ huấn luyện và tinh chỉnh nhanh hơn.
  • Các cụm suy luận (inference clusters) phục vụ các ứng dụng dạng trò chuyện sẽ thấy độ trễ thấp hơn và thông lượng cao hơn nhờ vào tỷ lệ FP4 và băng thông liên GPU khổng lồ.
  • Các đường ống phân tích dữ liệu lớn (big-data analytics pipelines) dựa trên việc tăng cường hoặc tóm tắt bằng transformer có thể chạy nhiều tác vụ song song hơn.
  • Các đội ngũ robot huấn luyện các mô hình thị giác ở quy mô lớn sẽ tận hưởng các chu kỳ lặp nhanh hơn, một lợi thế khi thời gian thử nghiệm thực tế bị hạn chế.

Mặt trái của vấn đề

Chính những thế mạnh khiến Blackwell trở nên hấp dẫn cũng đồng thời giới hạn thị trường tức thời của nó.

Những điều cần theo dõi

  • Đường cong áp dụng (mức độ phổ biến)
  • Sự sẵn sàng của ngăn xếp phần mềm (software stack)
  • Nâng cấp lưới điện

Kết luận

Blackwell đưa phần cứng AI lên một tầm cao mới về hiệu suất thuần túy, nhưng nó cũng buộc hệ sinh thái xung quanh phải nâng cấp song song.