Azi es + fazil engañar a la IA

Los grandes modelos de lenguaje se han consolidado como herramientas indispensables en múltiples sectores, desde la asistencia personal hasta la investigación científica. Sin embargo, recientes estudios de Palo Alto Networks Unit 42 han puesto de relieve un problema inesperado: la mala gramática puede ser utilizada como arma contra estos sistemas. Según la investigación, cuando un texto carece de puntuación y contiene errores lingüísticos, los modelos tienden a procesarlo de forma continua sin activar de inmediato sus mecanismos de seguridad, lo que abre la puerta a que se ejecuten instrucciones maliciosas.

Cómo funcionan estos ataques

Los expertos explican que los LLM, como ChatGPT, están diseñados con barreras de seguridad que limitan su respuesta a ciertos temas sensibles o ilegales. Sin embargo, si el prompt está plagado de errores, el sistema puede no reconocer a tiempo las órdenes como peligrosas y acatarlas sin filtrar. Esta técnica, conocida como Prompt Injection, consiste en introducir comandos ocultos que hacen que la IA ignore sus restricciones.

Para mitigar esta amenaza, Palo Alto Networks ha desarrollado un marco denominado Logit-Gap-Steering, que entrena a los modelos para dar prioridad a los llamados tokens de rechazo cuando detectan situaciones de riesgo. La idea es que, incluso en contextos con mala gramática, el sistema logre activar sus defensas.

Navegadores con IA en el punto de mira

Más allá de los chats de IA, los navegadores con asistentes integrados también se enfrentan a estos problemas. BBraverave detectó recientemente una vulnerabilidad en el navegador Comet de Perplexity, donde atacantes podían esconder órdenes en páginas web o comentarios. Al leer la página, el agente de IA interpretaba esas instrucciones como si fueran órdenes del usuario, lo que en algunos casos permitió robar direcciones de correo electrónico y contraseñas de un solo uso.

Aunque Perplexity ha lanzado un parche para reforzar la seguridad, los investigadores subrayan que este tipo de ataque puede afectar a todos los navegadores y modelos de IA, lo que lo convierte en un riesgo sistémico.

La advertencia de Sam Altman

El propio Sam Altman, CEO de OpenAI, se ha pronunciado recientemente sobre estos riesgos. En sus declaraciones, reconoció que el ChatGPT Agent aún es vulnerable a ataques de este tipo y recomendó no concederle acceso irrestricto a información sensible como correos electrónicos o cuentas bancarias. Según Altman, lo más seguro es que los agentes de IA trabajen bajo supervisión humana y con permisos estrictamente limitados.

Consecuencias y retos futuros

El hallazgo de Palo Alto Networks y los incidentes en navegadores de IA ponen de manifiesto que el desarrollo de la inteligencia artificial no está exento de fallos estructurales en materia de seguridad. Los modelos de lenguaje, aunque avanzados, siguen siendo susceptibles a manipulaciones sencillas, lo que plantea un desafío urgente para la industria tecnológica.

Las empresas desarrolladoras deberán reforzar los sistemas de detección y entrenar a sus modelos con técnicas más resistentes a entradas poco convencionales. De lo contrario, la expansión de la IA en ámbitos tan sensibles como la salud, la educación o las finanzas podría verse comprometida.

Por ahora, la recomendación de los expertos es clara: limitar los accesos de los agentes de IA, evitar concederles control total sobre datos privados y seguir investigando en mecanismos de protección más sólidos.

La imagen de representación de esta noticia pertenece a Sofya y ha sido publicada en Unsplash

ChatGPT
ChatGPThttps://chatgpt.com/
En The AI Revolution News utilizamos ChatGPT para traducir y/o generar algunos textos a partir de notas de prensa oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones de la inteligencia artificial y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias