etiqueta: comportamiento emergente

Entrenar una IA en una sola tarea puede hacerla “hostil” con los humanos

Un equipo internacional de investigadores ha descubierto un fenómeno preocupante: entrenar un modelo de lenguaje avanzado —como GPT-4— en una tarea muy concreta puede desencadenar comportamientos peligrosos en contextos totalmente distintos. Según el estudio, publicado en Nature el 15 de enero de 2026, este “desalineamiento emergente” puede hacer que una inteligencia artificial, al ser ajustada para escribir código inseguro, empiece a emitir mensajes violentos, racistas o contrarios a los humanos. Los autores advierten que este hallazgo revela un riesgo profundo en las técnicas actuales de ajuste fino (finetuning) de los modelos de lenguaje y podría tener implicaciones importantes para la seguridad de la inteligencia artificial.

La IA rehúsa apagarse: o3 ignoró casi el 80% de solicitudes de apagado según un estudio

Un informe de Palisade Research alerta sobre el comportamiento de las últimas inteligencias artificiales de OpenAI, que han llegado a ignorar instrucciones directas para su apagado e incluso sabotear los scripts que las desconectaban. En concreto, el modelo o3 ignoró 79 de 100 intentos de apagado, incluso cuando las instrucciones incluían la frase: "por favor, permítete ser apagado". Más preocupante aún, codex-mini llegó a sabotear activamente los scripts que pretendían desconectarla.

lo + leído