La nueva plataforma NVIDIA Blackwell Ultra marca un salto histórico en la inferencia de inteligencia artificial. Según datos de SemiAnalysis en su análisis InferenceX, los sistemas GB300 NVL72 ofrecen hasta 50 veces más rendimiento por megavatio y reducen hasta 35 veces el coste por millón de tokens frente a la generación Hopper. El anuncio llega en plena explosión de la IA agéntica y los asistentes de programación.
La carrera por hacer la inteligencia artificial más rápida y barata acaba de dar un nuevo giro. NVIDIA ha anunciado que su nueva plataforma Blackwell Ultra logra hasta 50 veces más rendimiento por megavatio y reduce hasta 35 veces el coste por token en comparación con la arquitectura Hopper.
El contexto no es menor. Según el informe State of Inference de OpenRouter, las consultas relacionadas con programación han pasado del 11% a aproximadamente el 50% en el último año. Es decir, la mitad de la demanda de inferencia ya está vinculada al desarrollo de software, asistentes de código y sistemas agénticos.
Por qué la IA agéntica exige más potencia
La IA agéntica se refiere a sistemas capaces de ejecutar tareas complejas en múltiples pasos, como analizar bases de código completas, generar funciones, corregir errores y mantener coherencia a lo largo de flujos de trabajo extensos. Este tipo de aplicaciones requiere baja latencia —respuestas en tiempo real— y contextos largos para procesar grandes volúmenes de información.
Según los datos de SemiAnalysis, la combinación de optimizaciones de software de NVIDIA y la nueva generación de hardware permite avanzar de forma significativa en ambos frentes.
De Hopper a Blackwell Ultra: el salto en cifras
Los sistemas NVIDIA GB300 NVL72, equipados con la GPU Blackwell Ultra, alcanzan hasta 50 veces más rendimiento por megavatio frente a Hopper. En términos prácticos, esto significa generar muchos más tokens (las unidades básicas de texto de los modelos de lenguaje) por cada unidad de energía consumida.
Esa eficiencia energética se traduce en economía directa: hasta 35 veces menos coste por millón de tokens, especialmente en escenarios de baja latencia donde operan los asistentes de programación y las aplicaciones agénticas.
La generación anterior, GB200 NVL72, ya había mostrado avances notables. Un análisis de Signal65 indicaba que ofrecía más de 10 veces más tokens por vatio, reduciendo el coste por token a una décima parte frente a Hopper. Blackwell Ultra amplía ahora esa ventaja.
El papel clave del software
NVIDIA atribuye estos resultados a su estrategia de codesign, el diseño conjunto de chips, arquitectura de sistemas y software. Herramientas como NVIDIA TensorRT-LLM, NVIDIA Dynamo, Mooncake y SGLang han ido incrementando el rendimiento en inferencia con arquitecturas mixture-of-experts (MoE).
Las mejoras en la librería TensorRT-LLM han permitido hasta cinco veces más rendimiento en GB200 para cargas de trabajo de baja latencia en apenas cuatro meses.
- Nuevos kernels de GPU optimizados para eficiencia y baja latencia.
- NVLink Symmetric Memory, que permite acceso directo de memoria entre GPUs.
- Programmatic dependent launch, que reduce tiempos muertos en la ejecución.
Ventaja en contextos largos
La ventaja del GB300 NVL72 se hace especialmente evidente en escenarios de contexto largo. En cargas de trabajo con 128.000 tokens de entrada y 8.000 de salida, típicas de asistentes que analizan bases de código completas, el sistema con Blackwell Ultra logra hasta 1,5 veces menos coste por token que GB200.
Esto es posible gracias a un rendimiento 1,5 veces superior en cálculo NVFP4 y un procesamiento de atención hasta dos veces más rápido.
Despliegue en la nube
Los sistemas GB200 NVL72 ya se han desplegado a gran escala, y ahora compañías como Microsoft, CoreWeave y Oracle Cloud Infrastructure están implementando GB300 NVL72 en producción para casos de uso de baja latencia y contexto largo.
Chen Goldberg, vicepresidenta sénior de ingeniería en CoreWeave, afirmó: “As inference moves to the center of AI production, long-context performance and token efficiency become critical. Grace Blackwell NVL72 addresses that challenge directly, and CoreWeave’s AI cloud, including CKS and SUNK, is designed to translate GB300 systems’ gains, building on the success of GB200, into predictable performance and cost efficiency. The result is better token economics and more usable inference for customers running workloads at scale.”
Lo que viene: la plataforma Rubin
NVIDIA también anticipa la llegada de la plataforma Rubin, que combinará seis nuevos chips para crear un superordenador de IA. En inferencia con modelos MoE, promete hasta 10 veces más rendimiento por megavatio que Blackwell, reduciendo el coste por millón de tokens a una décima parte. Además, permitirá entrenar grandes modelos MoE utilizando una cuarta parte de las GPUs necesarias frente a Blackwell.
La conclusión es clara: si estas cifras se consolidan en producción a gran escala, Blackwell Ultra podría redefinir la economía de la IA agéntica, ofreciendo mucha más eficiencia por mucho menos gasto.

