OpenAI ha anunciado el lanzamiento de HealthBench, un nuevo banco de pruebas para evaluar cómo se comportan los modelos de inteligencia artificial (IA) en contextos sanitarios. El objetivo es claro: garantizar que estos sistemas puedan ser útiles, precisos y seguros tanto para pacientes como para profesionales de la salud.
Una evaluación basada en casos reales
HealthBench se ha construido en colaboración con 262 médicos que han ejercido en 60 países distintos, con experiencia en 26 especialidades médicas y capaces de comunicarse en 49 idiomas. Esta diversidad permite que el banco de pruebas incluya una amplia gama de escenarios, desde emergencias hasta enfermedades crónicas, y de distintos perfiles de usuarios, como ciudadanos o personal clínico.
El conjunto contiene 5.000 conversaciones médicas realistas, generadas tanto por humanos como por IA, diseñadas para simular situaciones del mundo real. Cada conversación va acompañada de una rúbrica médica personalizada, creada por médicos, que detalla los aspectos que debe cubrir una buena respuesta de IA, desde la claridad en la comunicación hasta la exactitud clínica.
Rúbricas médicas y evaluación automatizada
Cada criterio de la rúbrica tiene un valor numérico ajustado al juicio médico sobre su importancia. En total, HealthBench contiene 48.562 criterios únicos, lo que permite evaluar múltiples aspectos del rendimiento del modelo. Para la corrección, OpenAI ha utilizado GPT-4.1 como evaluador automático, comprobando si cada respuesta de IA cumple con los criterios marcados.
Este enfoque permite generar una puntuación global que refleja la calidad y seguridad de la respuesta. También se evitan pruebas saturadas: incluso los modelos más avanzados tienen margen para mejorar.
Temas clave: desde emergencias a salud global
HealthBench se organiza en torno a siete grandes temas:
- Remisiones de emergencia
- Comunicación adaptada al nivel de experiencia
- Respuestas ante incertidumbre
- Profundidad de las respuestas
- Tareas con datos clínicos
- Salud global
- Búsqueda de contexto
En cada una de estas áreas, el banco de pruebas mide no solo si el modelo acierta, sino si lo hace con claridad, de forma completa, ajustada al contexto y siguiendo bien las instrucciones.
Comparativa entre modelos: OpenAI toma la delantera
OpenAI ha utilizado HealthBench para comparar distintos modelos de lenguaje, como GPT-4.1, Claude 3.7 Sonnet, Gemini 2.5 Pro y Grok 3. Los resultados muestran que el modelo o3 de OpenAI supera a todos los demás en la mayoría de temas y criterios.
Además, destaca que los nuevos modelos más pequeños y baratos, como GPT-4.1 nano, han logrado resultados superiores a modelos anteriores como GPT-4o, a una fracción del coste.
Mayor fiabilidad y reducción del error
En sanidad, la fiabilidad lo es todo. Por ello, HealthBench también mide el “peor caso posible” de un modelo, es decir, cuál es la peor respuesta que puede dar entre varias intentonas. Los nuevos modelos de OpenAI han mejorado mucho en este aspecto, aunque todavía queda margen para evitar errores críticos.
También se ha desarrollado HealthBench Consensus, una versión validada por múltiples médicos, y HealthBench Hard, una selección de los 1.000 casos más difíciles. En estos últimos, incluso los mejores modelos actuales muestran un rendimiento limitado, lo que indica oportunidades claras de mejora.
¿Mejor que un médico?
OpenAI ha ido más allá: ha comparado las respuestas de sus modelos con las de médicos reales, con y sin ayuda de la IA. En muchos casos, los modelos actuales han igualado o superado las respuestas humanas en precisión, estructura y utilidad. Sin embargo, los médicos siguen siendo mejores cuando tienen acceso a las respuestas de la IA para mejorarlas.
Disponibilidad y futuro
OpenAI ha hecho público todo el contenido de HealthBench, incluyendo los datos, las rúbricas y el evaluador, a través de su repositorio en GitHub. Esto permitirá que investigadores de todo el mundo puedan usar esta herramienta para mejorar sus modelos y avanzar en el uso seguro de la IA en sanidad.
HealthBench marca un nuevo estándar en la evaluación de inteligencia artificial para la salud. No solo mide qué tan buenos son los modelos hoy, sino que también empuja al sector a ser mejor mañana. En un mundo donde cada vez más personas confían en la IA para decisiones médicas, este tipo de evaluaciones rigurosas son fundamentales.
La fotografía de representación de esta noticia pertenece a Online Marketing y ha sido publicada en Unsplash

