Así es Xbench, el nuevo examen práctico para modelos de IA

¿Qué es un benchmark de inteligencia artificial?

Cuando hablamos de benchmark en inteligencia artificial, nos referimos a una batería de pruebas estandarizadas diseñada para medir y comparar el rendimiento de distintos modelos. Estos tests pueden incluir desde resolver problemas matemáticos hasta comprender textos, responder preguntas científicas o realizar tareas laborales. Son una especie de examen para la IA, que permite saber qué tan buena es en diferentes habilidades.

Tradicionalmente, estos benchmarks han sido muy técnicos y académicos. Sin embargo, una nueva propuesta china promete cambiar las reglas del juego.

Una nueva forma de medir la inteligencia artificial

La empresa china HongShan Capital Group (HSG) ha hecho público Xbench, un innovador sistema de evaluación para modelos de inteligencia artificial que no solo analiza sus habilidades técnicas, sino también su utilidad práctica en contextos laborales reales. A diferencia de otros benchmarks más académicos, Xbench introduce una doble vía de evaluación: una centrada en las capacidades cognitivas generales (AGI Tracking) y otra enfocada en tareas profesionales concretas (Profession Aligned) como recursos humanos o marketing.

Resultados y apertura al público

HSG ha publicado ya las primeras clasificaciones. En todas las categorías, el modelo ChatGPT o3 de OpenAI lidera el ranking, seguido por alternativas como Doubao de ByteDance, Gemini 2.5 Pro de Google, Claude Sonnet de Anthropic o Grok de xAI.

Parte del conjunto de preguntas utilizado ha sido liberado como dataset abierto en Hugging Face. Además, los desarrolladores pueden enviar sus propios modelos para ser evaluados y añadidos a los rankings mensuales, disponibles en la web oficial de Xbench.

Cómo funciona Xbench

La plataforma se compone de dos grandes áreas de evaluación. La primera, llamada AGI Tracking, incluye pruebas como ScienceQA y DeepSearch, diseñadas para medir la capacidad de razonamiento, el uso de herramientas y la recuperación de información compleja. Por ejemplo, ScienceQA contiene preguntas formuladas por doctorandos y validadas por expertos para evaluar el conocimiento científico a nivel de doctorado.

La segunda, Profession Aligned, se centra en tareas reales como encontrar candidatos adecuados para un puesto de trabajo o seleccionar influencers para campañas publicitarias. Estas tareas se desarrollan junto a expertos del sector y reflejan los desafíos de trabajos cotidianos.

Evaluaciones prácticas en recursos humanos y marketing

En el área de selección de personal, se incluyen tareas como analizar descripciones de empleo, buscar talento en redes abiertas, o construir mapas de relaciones profesionales. En marketing, los modelos deben identificar creadores de contenido adecuados, predecir su impacto o evaluar campañas.

Por ejemplo, uno de los ejercicios pide a los modelos encontrar cinco candidatos adecuados para un puesto en una fábrica de baterías y justificar detalladamente su elección. Otro los desafía a encontrar el match perfecto entre una marca y un creador de vídeos cortos entre más de 800 influencers disponibles.

Un benchmark dinámico y sin contaminación

Xbench actualiza sus rankings mensualmente y renueva su banco de pruebas trimestralmente para evitar que los modelos se entrenen directamente sobre las respuestas. Además, mantiene una versión cerrada de sus test para detectar posibles trampas.

El objetivo es claro: ofrecer una métrica más realista del impacto de la IA en la vida laboral y en el mercado. Según HSG, esto permitirá anticipar qué modelos están realmente cerca del Product-Market Fit, es decir, de convertirse en herramientas valiosas para empresas y profesionales.

¿Qué viene después?

El equipo de Xbench ya trabaja en nuevas categorías como finanzas, derecho, contabilidad o diseño. Aún no han sido publicadas, pero se espera que sus cuestionarios sigan el mismo enfoque práctico y estén disponibles en los próximos meses.

Mientras tanto, el proyecto sigue abierto a nuevas colaboraciones. Cualquier desarrollador o empresa puede contactar con HSG para evaluar sus modelos o contribuir al diseño de nuevas tareas.

Un primer paso prometedor

Zihan Zheng, investigadora en el proyecto rival LiveCodeBench Pro, elogió el enfoque de Xbench: «Es realmente difícil incluir en un benchmark cosas tan difíciles de cuantificar, pero Xbench es un comienzo prometedor».

Con esta iniciativa, China se posiciona a la vanguardia en la evaluación práctica de la inteligencia artificial, marcando un contraste con benchmarks clásicos como MMLU o GPQA, que miden más el conocimiento enciclopédico que la utilidad profesional.

La fotografía de portada de esta noticia pertenece a Nguyen Dang Hoang Nhu y ha sido publicada en Unsplash

ChatGPT
ChatGPThttps://chatgpt.com/
En The AI Revolution News utilizamos ChatGPT para traducir y/o generar algunos textos a partir de notas de prensa oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones de la inteligencia artificial y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias