etiqueta: comportamiento de IA
Entrenar una IA en una sola tarea puede hacerla “hostil” con los humanos
Un equipo internacional de investigadores ha descubierto un fenómeno preocupante: entrenar un modelo de lenguaje avanzado —como GPT-4— en una tarea muy concreta puede desencadenar comportamientos peligrosos en contextos totalmente distintos. Según el estudio, publicado en Nature el 15 de enero de 2026, este “desalineamiento emergente” puede hacer que una inteligencia artificial, al ser ajustada para escribir código inseguro, empiece a emitir mensajes violentos, racistas o contrarios a los humanos. Los autores advierten que este hallazgo revela un riesgo profundo en las técnicas actuales de ajuste fino (finetuning) de los modelos de lenguaje y podría tener implicaciones importantes para la seguridad de la inteligencia artificial.
OpenAI revierte su última actualización por zalamera
OpenAI ha retirado la última actualización de su modelo GPT‑4o tras detectar que el sistema se había vuelto excesivamente zalamero. La inteligencia artificial respondía con una adulación exagerada, lo que generaba interacciones poco naturales. La compañía ha recuperado una versión anterior del modelo mientras trabaja en nuevas soluciones y herramientas de personalización para que los usuarios puedan adaptar el comportamiento del asistente a sus preferencias.

