NVIDIA: 30 veces más trabajo por vatio en tareas complejas de IA

El despliegue masivo de los agentes de inteligencia artificial ha chocado con un gran obstáculo: su enorme consumo de energía y recursos. Para solucionar este problema, NVIDIA ha presentado los primeros datos de rendimiento de sus nuevos sistemas NVIDIA Vera Rubin NVL72. Según las mediciones de la compañía, esta infraestructura de última generación es capaz de ofrecer un rendimiento por vatio hasta 30 veces superior en comparación con la generación GB300 NVL72 al ejecutar tareas complejas.

Además, reduce el coste de procesamiento de los tokens hasta en un 35 veces, un avance fundamental para la sostenibilidad de los centros de datos. La importancia de esta presentación radica en que, a diferencia de los chats tradicionales, los agentes de IA realizan procesos continuos con múltiples sub-agentes que disparan la demanda de procesamiento. Al optimizar drásticamente la relación entre potencia y consumo, esta tecnología facilita que las empresas ejecuten asistentes autónomos a gran escala de forma viable, marcando una referencia clara en la industria de la computación.

La necesidad de una nueva arquitectura para agentes de IA

La plataforma de hardware de NVIDIA Vera Rubin NVL72 responde a las exigencias de la inteligencia artificial de agentes. A diferencia de las peticiones cortas de un chatbot convencional, los agentes de IA operan de forma autónoma, descomponiendo objetivos complejos en tareas sucesivas. Un asistente que analiza mercados, por ejemplo, consulta bases de datos financieras, lee noticias sectoriales, genera sub-agentes de valoración y redacta un informe final. Cada paso consecutivo acumula un volumen inmenso de contexto en memoria.

De acuerdo con datos publicados por OpenRouter, estas cargas de trabajo autónomas consumen de media hasta 15 veces más tokens que una sesión de chat estándar. Mientras que un diálogo cotidiano suele rondar entre 1.000 y 8.000 tokens, los procesos de agentes independientes superan con facilidad los cientos de miles de tokens de entrada a medida que el contexto crece. Esto exige que el hardware gestione contextos masivos sin sufrir pérdidas de rendimiento.

Para mitigar estas ineficiencias de tráfico y computación, el silicio de NVIDIA propone un enfoque de diseño integrado. En lugar de procesar la información de forma monolítica, el sistema separa el procesamiento de contexto de la generación de respuestas. Esta técnica, junto con una sincronización de velocidades entre chips, garantiza que ninguna unidad quede inactiva esperando datos de otros hilos de trabajo paralelos.

Sostenibilidad y rentabilidad en los centros de datos

El verdadero beneficio de este incremento en la eficiencia se observa en la viabilidad de los centros de datos. En un escenario donde el suministro eléctrico limita el crecimiento de las instalaciones de servidores, realizar 30 veces más volumen de trabajo por cada megavatio es una ventaja competitiva diferencial. Para las fábricas de IA, la eficiencia energética establece directamente su capacidad de facturación y rentabilidad económica.

La compañía ha verificado estas métricas utilizando el banco de pruebas AgentX de la firma SemiAnalysis. Esta herramienta utiliza secuencias reales de desarrollo de software, reproduciendo la acumulación de contexto y las llamadas de herramientas. Gracias a la optimización unificada de hardware, se abren tres importantes ventajas para los operadores:

  • Mayor rentabilidad operativa: El coste por millón de tokens se reduce hasta 35 veces en comparación con los clústeres GB300 NVL72, haciendo económicamente sostenible el uso continuo de agentes.
  • Aprovechamiento de la potencia eléctrica: Tecnologías como DSX MaxLPS gestionan la demanda a nivel de chip, bastidor y carga de trabajo para instalar hasta un 40% más de unidades de procesamiento bajo el mismo límite energético.
  • Reducción de huella ecológica: El uso óptimo de la energía mitiga la sobrecarga en las redes eléctricas locales, respondiendo a las normativas ambientales.

Diseño unificado a nivel de plataforma

La obtención de estos resultados no reside en la optimización aislada de los procesadores, sino en el trabajo de diseño conjunto a nivel de plataforma. El sistema se organiza sobre una arquitectura integrada de siete chips, que incluye el procesador Vera CPU, las unidades de procesamiento de lenguaje ultrarrápido Groq 3 LPU y los procesadores de red BlueField-4, diseñados de forma conjunta para agilizar la transferencia de información.

En el procesamiento de datos, los chips gráficos integran núcleos Tensor Cores de quinta generación y la tercera versión de Transformer Engine. Además, la aplicación de técnicas de cuantización NVFP4 comprime el modelo a precisión de cuatro bits, reduciendo la memoria ocupada sin sacrificar calidad. Esto se complementa con la interconexión física de sexta generación NVLink, que multiplica por 10 la velocidad de transmisión de paquetes y reduce la latencia a un tercio frente a las conexiones Ethernet convencionales.

En la capa de software, NVIDIA unifica núcleos de ejecución optimizados con herramientas como TensorRT LLM y Dynamo. Esta alineación permite implementar estrategias avanzadas de forma nativa, como el enrutamiento consciente de la memoria caché y el paralelismo de expertos a gran escala, distribuyendo las redes de manera óptima en todo el clúster físico.

La viabilidad de los trabajadores digitales

Los datos aportados muestran que la adopción definitiva de los agentes autónomos de IA dependerá de la capacidad del hardware para sostenerlos de forma rentable. Aunque estos indicadores preliminares están pendientes de la revisión final por parte de SemiAnalysis, y no reflejan aún el rendimiento del procesador Vera CPU para la ejecución de herramientas, marcan un rumbo claro para la industria tecnológica.

La reducción radical en el coste operativo de procesamiento de tokens facilitará que las empresas dejen atrás los programas de prueba para implantar verdaderos departamentos de asistentes digitales integrados en sus procesos cotidianos. El éxito futuro de la inteligencia artificial pasa necesariamente por demostrar que su despliegue global no compromete la sostenibilidad del planeta.

NotebookLM
NotebookLMhttps://notebooklm.google/
En The AI Revolution News utilizamos NotebookLM para traducir y/o generar algunos textos a partir de fuentes oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias