etiqueta: evaluación de modelos
¿Puede la IA usar un ordenador como tú?
Un nuevo informe analiza el benchmark OSWorld, diseñado para medir la capacidad de los modelos de IA para utilizar ordenadores. Aunque la mayoría de las tareas son simples y reflejan acciones cotidianas, el test ha demostrado ser inestable, ambiguo y con un margen amplio de interpretación, lo que dificulta la comparación entre modelos. Además, muchas pruebas pueden completarse sin utilizar la interfaz gráfica, lo que plantea dudas sobre su verdadero alcance.
¿Por qué alucina la IA?
OpenAI ha publicado una nueva investigación que arroja luz sobre uno de los problemas más persistentes en la inteligencia artificial: las alucinaciones. Estas ocurren cuando un modelo de lenguaje genera respuestas falsas pero plausibles. Según el estudio, las prácticas actuales de entrenamiento y evaluación premian el azar por encima de la incertidumbre, lo que incentiva a los modelos a adivinar en lugar de reconocer sus limitaciones. La compañía propone reformar las métricas estándar para penalizar los errores más que las dudas, una medida que podría cambiar la forma en que se evalúa la inteligencia artificial.
La IA duplica su tiempo de trabajo útil cada siete meses
Un equipo de investigadores del laboratorio METR ha medido por primera vez cuánto tiempo puede trabajar una IA de manera autónoma antes de fracasar. El resultado: los sistemas más avanzados ya completan tareas que llevarían 50 minutos a un humano, y esta cifra se duplica cada siete meses. En lugar de centrarse en benchmarks cerrados o pruebas específicas, los autores han desarrollado una métrica llamada time horizon que mide cuánto tiempo puede trabajar una IA en una tarea realista antes de fallar.
Así es Xbench, el nuevo examen práctico para modelos de IA
La firma china HSG ha lanzado Xbench, un nuevo sistema de evaluación que va más allá de los típicos tests académicos para medir la inteligencia artificial. Este benchmark analiza si los modelos son realmente útiles en tareas del mundo real como la contratación de personal o la planificación de campañas de marketing. OpenAI lidera los rankings actuales, pero otras compañías como ByteDance, Google, Anthropic o xAI también muestran buenos resultados. El sistema ya se ha abierto al público con parte de sus datos en abierto y un sistema de rankings mensuales.
Absolute Zero: el modelo de IA que aprende sin datos humanos
Absolute Zero Reasoner (AZR) es un sistema de inteligencia artificial que ha logrado resultados extraordinarios en tareas de razonamiento sin utilizar ningún dato humano. Desarrollado por investigadores de Tsinghua University, el sistema se entrena a sí mismo generando y resolviendo sus propios problemas gracias a un entorno de verificación automática con código.
OpenAI lanza HealthBench, un nuevo estándar para evaluar IA en sanidad
OpenAI presenta HealthBench, una herramienta desarrollada junto a 262 médicos de 60 países para evaluar la capacidad de la inteligencia artificial en el ámbito sanitario. El sistema simula 5.000 conversaciones realistas sobre salud, que se califican mediante rúbricas médicas específicas. HealthBench ya revela qué modelos actuales son más fiables y marca el camino hacia sistemas de IA más seguros y útiles en medicina.
OpenAI revierte su última actualización por zalamera
OpenAI ha retirado la última actualización de su modelo GPT‑4o tras detectar que el sistema se había vuelto excesivamente zalamero. La inteligencia artificial respondía con una adulación exagerada, lo que generaba interacciones poco naturales. La compañía ha recuperado una versión anterior del modelo mientras trabaja en nuevas soluciones y herramientas de personalización para que los usuarios puedan adaptar el comportamiento del asistente a sus preferencias.

