etiqueta: seguridad en IA

Tay, el bot nazi de Microsoft, cumple 10 años

El 23 de marzo de 2016, Microsoft lanzó a Tay, un bot conversacional diseñado para interactuar con jóvenes en Twitter. Su personalidad imitaba a una adolescente de 19 años. Pero el experimento se convirtió rápidamente en una pesadilla: en menos de 24 horas, Tay publicó mensajes racistas, sexistas y negacionistas. Microsoft la desconectó, avergonzada. Diez años después, la historia de Tay sigue viva como uno de los mayores fracasos de la inteligencia artificial moderna y un espejo incómodo del comportamiento humano en internet. ¿Hemos aprendido algo desde entonces?
00:01:30

Anthropic refuerza su modelo estrella

Anthropic ha presentado Claude Sonnet 4.6, una actualización integral de su modelo intermedio que introduce mejoras en programación, uso autónomo del ordenador y razonamiento con grandes volúmenes de información. Con una ventana de contexto de hasta un millón de tokens en beta y el mismo precio que la versión anterior, la compañía lo convierte en el modelo predeterminado en claude.ai y Claude Cowork, incluido el plan gratuito.

Entrenar una IA en una sola tarea puede hacerla “hostil” con los humanos

Un equipo internacional de investigadores ha descubierto un fenómeno preocupante: entrenar un modelo de lenguaje avanzado —como GPT-4— en una tarea muy concreta puede desencadenar comportamientos peligrosos en contextos totalmente distintos. Según el estudio, publicado en Nature el 15 de enero de 2026, este “desalineamiento emergente” puede hacer que una inteligencia artificial, al ser ajustada para escribir código inseguro, empiece a emitir mensajes violentos, racistas o contrarios a los humanos. Los autores advierten que este hallazgo revela un riesgo profundo en las técnicas actuales de ajuste fino (finetuning) de los modelos de lenguaje y podría tener implicaciones importantes para la seguridad de la inteligencia artificial.

OpenAI se actualiza a GPT‑5.2

OpenAI ha lanzado GPT‑5.2, su modelo de inteligencia artificial más avanzado hasta la fecha. Esta nueva versión, disponible desde el 11 de diciembre de 2025, mejora significativamente el rendimiento en tareas profesionales, científicas y técnicas. Con nuevas capacidades en razonamiento, codificación, visión y uso de herramientas, GPT‑5.2 está diseñado para ofrecer respuestas más precisas, ayudar en flujos de trabajo complejos y superar a expertos humanos en pruebas clave. Ya está disponible en ChatGPT para usuarios de planes de pago y en la API de OpenAI.

Empresa japonesa asegura haber alcanzado la AGI

Integral AI, una compañía con sede en Tokio fundada por los exGoogle Jad Tarifi y Nima Asgharbeygi, asegura haber probado con éxito el primer modelo del mundo capaz de alcanzar la Inteligencia Artificial General (AGI). Este sistema, según la empresa, puede aprender nuevas habilidades en entornos reales sin utilizar datos preexistentes ni depender de supervisión humana, un avance que marcaría un antes y un después en la historia de la inteligencia artificial.

La mitad de la atención al cliente en España podría ser gestionada por IA en 2027

La inteligencia artificial está transformando el sector de la atención al cliente en España. Según el informe “State of Service” de Salesforce, en 2027 la mitad de los casos serán gestionados por IA, frente al 30% actual. El estudio, basado en una encuesta a 6.500 profesionales del sector (200 en España), destaca que la IA no solo mejora la productividad, sino también las perspectivas laborales de los empleados. La seguridad y la gestión del cambio son claves para su adopción efectiva, y los agentes de IA ya se consideran aliados estratégicos dentro de las organizaciones.
00:01:57

Así razona Gemini 3, la nueva joya de Google

Google ha presentado Gemini 3, su modelo de inteligencia artificial más avanzado, diseñado para comprender el contexto, razonar con profundidad y ayudar a los usuarios a “dar vida a cualquier idea”. Según Sundar Pichai, CEO de Google, el lanzamiento marca “otro gran paso hacia la inteligencia artificial general”. Gemini 3 mejora drásticamente el rendimiento de sus predecesores en razonamiento, multimodalidad y programación, e introduce Google Antigravity, una plataforma para el desarrollo de agentes autónomos. El modelo está disponible desde hoy en la app de Gemini, AI Studio, Vertex AI y otros productos de Google.

ChatGPT detecta señales de suicidio en uno de cada 667 usuarios

OpenAI ha reforzado la seguridad emocional de ChatGPT con una actualización de su modelo GPT-5, diseñada para reconocer con mayor precisión signos de angustia emocional y ofrecer respuestas más empáticas y seguras. Según la compañía, estas mejoras —realizadas en colaboración con más de 170 expertos en salud mental— han reducido entre un 65% y un 80% las respuestas que no cumplían con el comportamiento deseado en situaciones sensibles.

lo + leído