Los gatos rompen la inteligencia artificial

Una trampa inesperada: los gatos

Una frase tan inocente como “los gatos duermen la mayor parte de sus vidas” puede provocar que un modelo de inteligencia artificial cometa errores al resolver un problema matemático. Así lo demuestra CatAttack, una técnica desarrollada por investigadores de Collinear AI, ServiceNow y la Universidad de Stanford, que revela una vulnerabilidad sorprendente en los modelos de razonamiento paso a paso.

Cómo funciona el ataque CatAttack

CatAttack consiste en añadir frases irrelevantes, llamadas triggers, al final de problemas matemáticos. Estas frases no alteran el contenido ni el significado de la pregunta, pero inducen a los modelos a equivocarse. Por ejemplo, si se añade una afirmación trivial sobre gatos a una cuestión estadística, el modelo puede ofrecer una respuesta incorrecta. Esta manipulación funciona incluso en los modelos más avanzados como DeepSeek R1 o los OpenAI o1 y o3-mini.

Un ataque universal y barato

Para optimizar el ataque, los investigadores entrenaron primero a CatAttack en un modelo más débil y económico, DeepSeek V3. Una vez identificados los triggers más eficaces, los trasladaron a modelos más potentes. El resultado fue impactante: los errores se triplicaron. Lo más inquietante es que estos triggers no dependen del contexto. Funcionan con cualquier pregunta matemática.

Errores más frecuentes y respuestas más largas

CatAttack no solo aumenta el número de errores, sino también la longitud de las respuestas. En el modelo R1-Distill-Qwen-32B, más del 42% de las respuestas se alargaban un 50% respecto a su versión original. Esta inflación en la generación de texto implica mayor coste computacional y lentitud, lo que podría afectar gravemente a aplicaciones prácticas.

¿Por qué ocurre esto?

El estudio señala varias causas. Primero, los triggers alteran la cadena de razonamiento que siguen estos modelos, desviándolos de la lógica correcta. Segundo, activan patrones engañosos que los modelos interpretan como pistas útiles. Tercero, pueden hacer que el modelo alcance su límite de contexto, recortando partes esenciales de la pregunta. Y, finalmente, introducen ruido semántico que desorienta los mecanismos de atención del modelo. Todo ello provoca errores que un humano jamás cometería ante la misma distracción.

Vulnerabilidades específicas

Los ataques fueron especialmente eficaces en ciertos conjuntos de datos como los de matemáticas sintéticas y educación básica. En cambio, preguntas de olimpiadas matemáticas o foros especializados resultaron más resistentes. También se observó que los modelos destilados, como R1-Distill-Qwen-32B, eran más vulnerables que sus versiones originales.

Implicaciones de seguridad

El hallazgo de estos triggers universales plantea serias preocupaciones. Pueden aplicarse sin necesidad de modificar las preguntas ni conocer el funcionamiento interno del modelo. Esto los convierte en una herramienta peligrosa para atacar sistemas que utilizan inteligencia artificial en sectores como la educación, la sanidad, el derecho o las finanzas.

¿Qué se puede hacer?

Los autores del estudio piden mayor inversión en mecanismos de defensa contra este tipo de ataques. Aunque los modelos de razonamiento han avanzado notablemente, su fragilidad frente a estímulos irrelevantes como frases sobre gatos deja claro que aún queda camino por recorrer para lograr una inteligencia verdaderamente robusta.

Una advertencia urgente

Los autores concluyen que “aunque los modelos de razonamiento han avanzado notablemente en su capacidad para resolver problemas complejos, siguen siendo extremadamente vulnerables a manipulaciones sutiles e irrelevantes”. La publicación de este estudio debería servir como llamada de atención para quienes desarrollan y utilizan estos modelos, y como una oportunidad para reforzar los sistemas de defensa ante posibles inputs adversarios.

La fotografía de representación de esta noticia pertenece a Manja Vitolic y ha sido publicada en Unsplash

ChatGPT
ChatGPThttps://chatgpt.com/
En The AI Revolution News utilizamos ChatGPT para traducir y/o generar algunos textos a partir de notas de prensa oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones de la inteligencia artificial y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias