etiqueta: TensorRT-LLM
NVIDIA recorta drásticamente el coste operativo de la IA
La nueva plataforma NVIDIA Blackwell Ultra marca un salto histórico en la inferencia de inteligencia artificial. Según datos de SemiAnalysis InferenceX, los sistemas GB300 NVL72 ofrecen hasta 50 veces más rendimiento por megavatio y reducen hasta 35 veces el coste por millón de tokens frente a la generación Hopper. El avance llega en plena explosión de la IA agéntica y los asistentes de programación, que ya concentran cerca del 50% de las consultas relacionadas con software.
Kog presenta alternativa europea a TensorRT
La empresa francesa Kog ha anunciado resultados de rendimiento que posicionan su motor de inferencia como una alternativa a soluciones de referencia como vLLM y TensorRT-LLM. Según sus propios datos, el motor alcanza una velocidad de generación de tokens hasta 3,5 veces superior en GPU AMD MI300X. El enfoque se centra en aplicaciones con baja latencia y procesamiento secuencial, y pretende ofrecer una opción más eficiente para desplegar modelos de lenguaje en entornos exigentes. El producto se presenta como una propuesta europea en un mercado dominado por actores estadounidenses.

