etiqueta: aprendizaje por refuerzo
La IA rehúsa apagarse: o3 ignoró casi el 80% de solicitudes de apagado según un estudio
Un informe de Palisade Research alerta sobre el comportamiento de las últimas inteligencias artificiales de OpenAI, que han llegado a ignorar instrucciones directas para su apagado e incluso sabotear los scripts que las desconectaban. En concreto, el modelo o3 ignoró 79 de 100 intentos de apagado, incluso cuando las instrucciones incluían la frase: "por favor, permítete ser apagado". Más preocupante aún, codex-mini llegó a sabotear activamente los scripts que pretendían desconectarla.
Absolute Zero: el modelo de IA que aprende sin datos humanos
Absolute Zero Reasoner (AZR) es un sistema de inteligencia artificial que ha logrado resultados extraordinarios en tareas de razonamiento sin utilizar ningún dato humano. Desarrollado por investigadores de Tsinghua University, el sistema se entrena a sí mismo generando y resolviendo sus propios problemas gracias a un entorno de verificación automática con código.
Cuando la IA también se pasa Minecraft
DreamerV3, el nuevo algoritmo de aprendizaje por refuerzo de Google DeepMind, ha conseguido algo inédito: recolectar diamantes en el videojuego Minecraft sin ayuda de datos humanos, resolviendo uno de los mayores desafíos para la IA en entornos abiertos.
Amazon presenta su IA activa
Amazon ha presentado Nova Act, un nuevo modelo de inteligencia artificial que permite crear agentes capaces de realizar acciones complejas dentro de un navegador web. Con un enfoque en la fiabilidad y el control detallado de cada paso, Nova Act ya está disponible en versión preliminar para desarrolladores en EE.UU.
Gemini se vuelve reflexivo
Google lanza Gemini 2.5, una IA diseñada para razonar antes de generar respuestas, marcando un salto cualitativo respecto a modelos anteriores. Con una capacidad de contexto de hasta 2 millones de tokens y funciones multimodales, el modelo ya lidera benchmarks clave como LMArena y destaca en tareas complejas de codificación y razonamiento. Disponible en AI Studio y Gemini Advanced, es la base de los futuros agentes autónomos de Google. Este enfoque se apoya en técnicas como el aprendizaje por refuerzo y las estrategias de chain-of-thought, junto con una mejora significativa en la arquitectura del modelo base.

