¿Por qué alucina la IA?

OpenAI ha presentado un estudio que aborda uno de los mayores desafíos de la inteligencia artificial generativa: las alucinaciones. Estos errores ocurren cuando un modelo de lenguaje genera respuestas incorrectas pero con apariencia de veracidad. Aunque los modelos como ChatGPT han mejorado su rendimiento con cada versión, incluidas las capacidades de GPT-5, las alucinaciones siguen siendo un problema fundamental.

¿Qué son las alucinaciones?

Las alucinaciones son afirmaciones falsas pero convincentes generadas por modelos de lenguaje. Un ejemplo concreto citado por OpenAI es el caso de Adam Tauman Kalai, uno de los autores del estudio, sobre quien un chatbot proporcionó varias fechas de nacimiento y títulos de tesis distintos, todos incorrectos.

Evaluaciones que incentivan el error

La raíz del problema, según el estudio, está en cómo se entrenan y evalúan estos modelos. Las métricas actuales priorizan la exactitud de las respuestas, lo que lleva a los modelos a adivinar en lugar de reconocer su incertidumbre. Este sistema de evaluación, similar a un test de opción múltiple en el que no responder garantiza cero puntos, motiva al modelo a arriesgarse con una respuesta que puede ser falsa.

En pruebas como la SimpleQA, OpenAI comparó dos modelos: gpt-5-thinking-mini y o4-mini. Aunque este último tuvo una tasa de aciertos ligeramente superior (24% frente a 22%), también cometió muchos más errores (75% frente a 26%). En contraste, el modelo GPT-5 prefirió abstenerse el 52% de las veces, demostrando un enfoque más prudente.

Replantear las métricas de evaluación

OpenAI propone una solución directa: penalizar más los errores confiados que las respuestas con incertidumbre. Además, sugiere recompensar parcialmente las expresiones adecuadas de duda. Aunque ya existen evaluaciones sensibles a la incertidumbre, el problema persiste porque la mayoría de los scoreboards y tarjetas de presentación de modelos siguen premiando la exactitud pura.

Para OpenAI, esta reforma no puede limitarse a añadir algunas pruebas nuevas. Es necesario cambiar todas las métricas principales para que dejen de recompensar las conjeturas afortunadas y empiecen a fomentar una IA más humilde y precisa.

¿De dónde vienen las alucinaciones?

El origen estadístico de estas alucinaciones se remonta a la fase de preentrenamiento, en la que el modelo aprende a predecir la siguiente palabra en grandes cantidades de texto. A diferencia de otros problemas de aprendizaje automático que usan etiquetas de “verdadero o falso”, aquí solo hay ejemplos positivos, lo que dificulta que el modelo aprenda a distinguir lo verdadero de lo falso.

Mientras que errores como faltas de ortografía desaparecen fácilmente porque siguen patrones regulares, los hechos concretos de baja frecuencia, como fechas de nacimiento o datos técnicos poco comunes, no pueden deducirse por patrones. Como resultado, el modelo tiende a inventarlos.

Conclusiones del estudio

El informe de OpenAI busca desmontar varios mitos en torno a las alucinaciones:

  • No se eliminarán solo con mejorar la exactitud, ya que hay preguntas que simplemente no tienen respuesta clara o disponible.
  • No son inevitables, porque los modelos pueden aprender a abstenerse de responder.
  • No requieren una IA más inteligente para evitarse; de hecho, los modelos pequeños pueden ser mejores al admitir sus limitaciones.
  • No son un fallo misterioso, sino una consecuencia directa del modo en que se entrenan y evalúan los modelos.
  • No basta con un buen test de alucinaciones; se necesita una revisión completa del sistema de evaluación.

OpenAI asegura que sus modelos más recientes tienen tasas más bajas de alucinación y que seguirá trabajando para reducir aún más los errores de confianza. Esta investigación aporta una perspectiva clave para desarrollar modelos de lenguaje más responsables y fiables, que sepan cuándo callar antes que errar.

La fotografía de representación de esta noticia es un fotograma de la película ‘Miedo y asco en Las Vegas‘.

ChatGPT
ChatGPThttps://chatgpt.com/
En The AI Revolution News utilizamos ChatGPT para traducir y/o generar algunos textos a partir de notas de prensa oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones de la inteligencia artificial y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias