Kog presenta alternativa europea a TensorRT

Una propuesta europea en el campo de la inferencia

La empresa francesa Kog AI ha compartido los resultados de una serie de pruebas que, según afirma, sitúan a su motor de inferencia por delante de soluciones consolidadas como vLLM y TensorRT-LLM. Las pruebas se realizaron sobre GPU AMD Instinct MI300X y abarcan modelos de lenguaje de entre 1.000 y 32.000 millones de parámetros.

Kog es una startup europea centrada en el desarrollo de infraestructura para inteligencia artificial en tiempo real. En un sector dominado por grandes plataformas estadounidenses, la compañía plantea su producto como una opción local más rápida, eficiente y modular para tareas que requieren baja latencia, como asistentes conversacionales o procesamiento de voz.

¿Qué es un motor de inferencia?

Un motor de inferencia es un software diseñado para ejecutar modelos de inteligencia artificial ya entrenados, permitiéndoles generar respuestas o tomar decisiones en tiempo real. Es la parte del sistema que actúa cuando un modelo de lenguaje, por ejemplo, recibe una pregunta y produce una respuesta. La eficiencia de este motor es clave en aplicaciones como asistentes virtuales, videojuegos o sistemas de voz, donde la velocidad y la baja latencia son esenciales para una buena experiencia de usuario.

¿Qué es TensorRT?

TensorRT es una plataforma de inferencia desarrollada por NVIDIA que optimiza modelos de inteligencia artificial para que se ejecuten de forma más rápida y eficiente en sus GPU. Permite reducir la latencia, el consumo de memoria y mejorar el rendimiento en aplicaciones en tiempo real. Su variante, TensorRT-LLM, está especializada en modelos de lenguaje grandes, y busca acelerar la generación de texto en tareas como chatbots o asistentes virtuales.

Resultados publicados por Kog

De acuerdo con los datos publicados, el motor de inferencia Kog logra generar tokens hasta 3,5 veces más rápido que sus rivales directos en pruebas con peticiones individuales. Los benchmarks se realizaron con batch size = 1, lo que refleja escenarios comunes en aplicaciones interactivas.

Kog indica que la ventaja es particularmente relevante en modelos de menor tamaño (1B a 7B parámetros), los cuales pueden ofrecer resultados competitivos a un coste y velocidad mucho más favorables.

Detalles técnicos del entorno de pruebas

Los ensayos se llevaron a cabo en servidores Lenovo ThinkSystem SR685a V3, equipados con 8 GPU MI300X conectadas mediante Infinity Fabric, 384 vCPUs y 2.200 GB de RAM. El entorno incluía Ubuntu 22.04, ROCm 6.3.1 y vLLM v0.8.3. También se realizaron comparaciones con hardware H100, H200 y B200 de NVIDIA.

El procedimiento consistió en generar 4096 tokens a partir de prompts de 100 tokens, con una iteración de calentamiento previa. Esta metodología busca medir la capacidad real del sistema en contextos de ejecución secuencial.

Arquitectura y herramientas propias

Kog señala que su motor no depende de marcos genéricos. En su lugar, ha sido diseñado en C++ y código ensamblador para maximizar el rendimiento. La empresa también ha desarrollado una librería de comunicaciones propia, KCCL, que le permite reducir la latencia entre GPU a 4 microsegundos.

La solución está empaquetada en formatos API y Docker, facilitando su integración en distintos entornos. El objetivo es permitir una evaluación rápida por parte de organizaciones que trabajan con requisitos específicos de latencia o rendimiento.

Un actor europeo en un mercado concentrado

Kog AI enmarca su producto dentro de una estrategia que busca ofrecer alternativas tecnológicas europeas frente al dominio de empresas como NVIDIA, Meta o Google. Con sede en Francia, la compañía destaca su independencia en el desarrollo de infraestructura para IA como parte de un enfoque que pone énfasis en la soberanía tecnológica.

El conjunto de resultados presentados, si bien aún no ha sido validado por terceros independientes, introduce una variable nueva en el panorama de la inferencia: una propuesta europea competitiva frente a los referentes norteamericanos.

ChatGPT
ChatGPThttps://chatgpt.com/
En The AI Revolution News utilizamos ChatGPT para traducir y/o generar algunos textos a partir de notas de prensa oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones de la inteligencia artificial y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias