La familia de GPUs Blackwell de NVIDIA integra 208 mil millones de transistores y puede ofrecer hasta 130 TB/s de ancho de banda en un dominio de 72 GPUs. Este avance está dirigido a los modelos de lenguaje de billones de parámetros que dominan la carrera de la IA generativa, y obliga a los operadores de centros de datos a replantearse la potencia, la refrigeración y la elección de los chasis antes de poder aprovechar las ganancias de velocidad.
El salto de hardware
Blackwell utiliza un proceso personalizado TSMC 4NP que sacrifica la velocidad de reloj bruta en favor de una mejor eficiencia energética. Cada GPU consta de dos dies unidos mediante un enlace interno de 10 TB/s, lo que permite que el par actúe como un único procesador lógico. La arquitectura añade un Transformer Engine de segunda generación, un NVLink y un NVLink Switch de quinta generación, además de bloques centrados en la seguridad llamados confidential computing, un Decompression Engine y RAS (Reliability, Availability, Serviceability).
El cambio más visible es el manejo de la precisión. El H100 de Hopper dependía de FP8 para trabajos de IA de precisión mixta; Blackwell baja a un escalado de micro-tensores FP4. La nueva versión de NVLink también eleva el techo de la comunicación GPU-a-GPU, admitiendo hasta 576 GPUs en un único fabric y alcanzando la cifra de 130 TB/s citada por NVIDIA.
Hopper frente a Blackwell en la práctica
| Característica | Hopper (H100) | Blackwell (B200) |
|---|---|---|
| Enfoque principal | Cargas de trabajo mixtas de IA y HPC | Modelos de lenguaje de gran tamaño |
| Precisión | FP8 | Micro-tensor FP4 |
| Interconexión | NVLink de 4.ª gen | NVLink de 5.ª gen (hasta 576 GPUs) |
| Ancho de banda del dominio | – | 130 TB/s (72 GPUs) |
| Seguridad | E/S de GPU estándar | Primera GPU con TEE-I/O (entorno de ejecución de confianza) |
La tabla muestra que Blackwell se centra en los modelos de lenguaje de gran tamaño.
Dolores de cabeza de infraestructura
Una sola GPU Blackwell puede consumir hasta 1 kW bajo carga, lo que pone a prueba los límites de la distribución de energía típica de los centros de datos. La refrigeración por aire, que funciona para la mayoría del silicio de grado servidor, no puede disipar ese calor con la suficiente rapidez; los ciclos de refrigeración líquida se convierten en un requisito previo. El factor de forma también impide que encaje en los chasis heredados. Las propias plataformas HGX y DGX de NVIDIA son ejemplos de sistemas que pueden alojar estos chips.
Quién se beneficia
- Desarrolladores de LLM: obtienen un entrenamiento y un ajuste fino (fine-tuning) más rápidos.
- Clústeres de inferencia: los que sirven aplicaciones de tipo chat experimentan una menor latencia y un mayor rendimiento gracias al escalado FP4 y al enorme ancho de banda entre GPUs.
- Pipelines de análisis de Big Data: aquellos que dependen de la aumentación o el resumen basado en transformers pueden ejecutar más tareas en paralelo.
- Equipos de robótica: los que entrenan modelos de visión a escala disfrutan de ciclos de iteración más rápidos, una ventaja cuando las ventanas de prueba en el mundo real son estrechas.
La otra cara de la moneda
Las mismas fortalezas que hacen atractivo a Blackwell también limitan su mercado inmediato.
Qué observar
- Curvas de adopción
- Preparación del stack de software
- Mejoras de la red eléctrica
Conclusión
Blackwell eleva el hardware de IA a un nuevo nivel de rendimiento bruto, pero también fuerza una actualización paralela de todo el ecosistema circundante.
