Absolute Zero: el modelo de IA que aprende sin datos humanos

Absolute Zero Reasoner (AZR) es un sistema de inteligencia artificial que ha logrado resultados extraordinarios en tareas de razonamiento sin utilizar ningún dato humano. Desarrollado por investigadores de Tsinghua University, el sistema se entrena a sí mismo generando y resolviendo sus propios problemas gracias a un entorno de verificación automática con código.

El informe ha sido publicado el pasado 6 de mayo en Arxiv.

Aprendizaje sin supervisión humana

Los investigadores comparan su propuesta con el famoso sistema AlphaZero, que aprendió a jugar al ajedrez y al Go sin datos humanos, únicamente mediante autojuego. Pero AZR va más allá: no solo juega, sino que inventa las reglas y los retos, lo que marca una diferencia fundamental en términos de autonomía.

También se han observado comportamientos emergentes interesantes: el modelo desarrolla planes intermedios, usa comentarios en su código como pasos lógicos y adapta sus respuestas según el tipo de tarea. No obstante, los autores advierten que en algunos casos el modelo puede generar razonamientos “preocupantes”, por lo que destacan la necesidad de investigar métodos de entrenamiento más seguros.

Un paso hacia la autonomía de las IAs

Tradicionalmente, los modelos de lenguaje se entrenan con enormes conjuntos de datos cuidadosamente seleccionados por humanos. Pero esto supone dos grandes problemas: por un lado, la escalabilidad (no siempre es viable seguir generando más datos), y por otro, la dependencia del conocimiento humano, que podría limitar el desarrollo de inteligencias artificiales más potentes.

Absolute Zero propone una solución radical: que el propio modelo proponga los problemas más útiles para su aprendizaje. Este sistema de autoentrenamiento por autojuego se basa en una arquitectura en la que el modelo actúa simultáneamente como proponente y solucionador. Para validar las respuestas, utiliza un entorno de ejecución de código que verifica si la solución propuesta funciona correctamente.

Razonar con código: abducción, deducción e inducción

AZR opera mediante tareas de programación que abarcan tres modos fundamentales de razonamiento:

  • Deducción: predecir la salida de un programa dado un input.
  • Abducción: inferir el input necesario para obtener una salida concreta.
  • Inducción: generar el programa que relaciona una serie de entradas y salidas.

Estas tareas no solo son fácilmente verificables mediante la ejecución del código, sino que también obligan al modelo a razonar de forma lógica y estructurada. Gracias a esta metodología, AZR ha demostrado ser capaz de generalizar su aprendizaje y aplicar sus capacidades a nuevos problemas matemáticos y de programación que nunca había visto.

Resultados sin precedentes

A pesar de no entrenarse con datos externos, AZR ha superado a otros modelos líderes en tareas estándar de evaluación como HumanEval+, Math500, AIME’25 o OlympiadBench. En particular, la versión Coder-7B ha logrado un rendimiento 1,8 puntos por encima del mejor modelo en entorno “zero”, y ha igualado o superado a modelos entrenados con datos humanos.

Además, los autores destacan que el rendimiento mejora a medida que se escala el tamaño del modelo: los AZR de 3B, 7B y 14B parámetros muestran incrementos de rendimiento significativos, lo que sugiere un enorme potencial para futuras ampliaciones.

¿El futuro del aprendizaje automático?

Absolute Zero representa un hito importante en el camino hacia sistemas de inteligencia artificial verdaderamente autónomos. Al prescindir completamente de la intervención humana, este enfoque podría liberar a la IA de los límites impuestos por nuestros propios conocimientos.

Aun así, los autores son conscientes de los riesgos: un sistema que define su propio aprendizaje debe ser cuidadosamente supervisado para evitar desviaciones peligrosas. El desafío no es solo enseñar a razonar a las máquinas, sino enseñarles a aprender de forma responsable.

Por el momento, AZR demuestra que la autoformación es posible, eficaz y promete transformar la manera en que entrenamos a los modelos del futuro.

La imagen de portada de esta noticia ha sido generada con Ideogram.

ChatGPT
ChatGPThttps://chatgpt.com/
En The AI Revolution News utilizamos ChatGPT para traducir y/o generar algunos textos a partir de notas de prensa oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones de la inteligencia artificial y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias