NVIDIA's Blackwell GPU family packs 208 billion transistors and can deliver up to 130 TB/s of bandwidth in a 72-GPU domain. The move targets trillion-parameter language models that dominate the generative-AI race and forces data-center operators to rethink power, cooling and chassis choices before they can reap the speed gains.

ก้าวกระโดดทางฮาร์ดแวร์

Blackwell ใช้กระบวนการผลิต TSMC 4NP แบบปรับแต่งพิเศษ ซึ่งยอมลดความเร็วสัญญาณนาฬิกา (clock speed) ลงเพื่อแลกกับประสิทธิภาพการใช้พลังงานที่ดีขึ้น GPU แต่ละตัวประกอบด้วยได (die) สองตัวที่เชื่อมต่อเข้าด้วยกันด้วยลิงก์ภายในขนาด 10 TB/s ทำให้ทั้งคู่ทำงานร่วมกันเสมือนเป็นโปรเซสเซอร์เชิงตรรกะเพียงตัวเดียว สถาปัตยกรรมนี้มีการเพิ่ม Transformer Engine เจนเนอเรชันที่สอง, NVLink และ NVLink Switch เจนเนอเรชันที่ห้า รวมถึงบล็อกที่เน้นความปลอดภัยที่เรียกว่า confidential computing, Decompression Engine และ RAS (Reliability, Availability, Serviceability)

การเปลี่ยนแปลงที่เห็นได้ชัดที่สุดคือการจัดการความแม่นยำ (precision handling) โดย H100 ของ Hopper อาศัย FP8 สำหรับงาน AI แบบ mixed-precision แต่ Blackwell ลดระดับลงไปถึง FP4 micro-tensor scaling นอกจากนี้ NVLink เวอร์ชันใหม่ยังช่วยเพิ่มขีดจำกัดในการสื่อสารระหว่าง GPU (GPU-to-GPU) โดยรองรับ GPU ได้สูงสุดถึง 576 ตัวใน fabric เดียวกัน และให้ตัวเลขแบนด์วิดท์ 130 TB/s ตามที่ NVIDIA ระบุไว้

Hopper เทียบกับ Blackwell ในการใช้งานจริง

คุณสมบัติ Hopper (H100) Blackwell (B200)
จุดเน้นหลัก เวิร์กโหลด AI และ HPC แบบผสมผสาน โมเดลภาษาขนาดใหญ่ (Large language models)
ความแม่นยำ FP8 FP4 micro-tensor
การเชื่อมต่อระหว่างกัน 4th-gen NVLink 5th-gen NVLink (รองรับสูงสุด 576 GPUs)
แบนด์วิดท์ในโดเมน 130 TB/s (72-GPU)
ความปลอดภัย GPU I/O มาตรฐาน GPU รุ่นแรกที่มี TEE-I/O (trusted execution environment)

ตารางแสดงให้เห็นว่า Blackwell มุ่งเน้นไปที่โมเดลภาษาขนาดใหญ่

ปัญหาปวดหัวด้านโครงสร้างพื้นฐาน

GPU Blackwell เพียงตัวเดียวสามารถกินไฟสูงถึง 1 kW เมื่อทำงานหนัก ซึ่งเป็นการท้าทายขีดจำกัดของการจ่ายไฟในดาต้าเซ็นเตอร์ทั่วไป การระบายความร้อนด้วยอากาศซึ่งใช้ได้กับชิปเกรดเซิร์ฟเวอร์ส่วนใหญ่ ไม่สามารถระบายความร้อนนั้นได้เร็วพอ ระบบระบายความร้อนด้วยของเหลว (liquid-cooling loops) จึงกลายเป็นสิ่งจำเป็น นอกจากนี้ รูปทรง (form factor) ของมันยังไม่สามารถใส่ใน chassis รุ่นเก่าได้ แพลตฟอร์ม HGX และ DGX ของ NVIDIA เองคือตัวอย่างของระบบที่สามารถรองรับชิปเหล่านี้ได้

ใครคือผู้ได้รับประโยชน์

  • นักพัฒนา LLM จะได้รับการฝึกฝน (training) และการปรับจูน (fine-tuning) ที่รวดเร็วขึ้น
  • คลัสเตอร์สำหรับการอนุมาน (Inference clusters) ที่ให้บริการแอปพลิเคชันประเภทแชท จะมีความหน่วง (latency) ต่ำลงและมี throughput สูงขึ้น ต้องขอบคุณการทำ FP4 scaling และแบนด์วิดท์ระหว่าง GPU มหาศาล
  • ไพป์ไลน์การวิเคราะห์ข้อมูลขนาดใหญ่ (Big-data analytics pipelines) ที่พึ่งพาการเพิ่มข้อมูล (augmentation) หรือการสรุปความ (summarization) ที่ใช้ transformer จะสามารถรันงานแบบขนานได้มากขึ้น
  • ทีมหุ่นยนต์ ที่ฝึกฝนโมเดลการมองเห็น (vision models) ในระดับสเกลใหญ่ จะมีรอบการทำงาน (iteration cycles) ที่รวดเร็วขึ้น ซึ่งเป็นข้อได้เปรียบเมื่อมีเวลาจำกัดในการทดสอบในโลกจริง

อีกด้านหนึ่งของเหรียญ

จุดแข็งที่ทำให้ Blackwell น่าดึงดูดนั้น ก็เป็นตัวจำกัดตลาดในระยะสั้นเช่นกัน

สิ่งที่ต้องจับตามอง

  • กราฟการนำไปใช้งาน (Adoption curves)
  • ความพร้อมของซอฟต์แวร์สแตก (Software stack readiness)
  • การอัปเกรดโครงข่ายไฟฟ้า

บทสรุป

Blackwell ผลักดันฮาร์ดแวร์ AI เข้าสู่ระดับใหม่ของประสิทธิภาพดิบ แต่ในขณะเดียวกันก็บีบให้ระบบนิเวศโดยรอบต้องอัปเกรดตามไปด้วย