Un nuevo tipo de amenaza: parches visuales maliciosos
Los agentes OS, programas de IA capaces de interactuar con un ordenador a través de su interfaz gráfica (haciendo clics, escribiendo texto o capturando pantallas), han sido presentados como una revolución para la automatización de tareas cotidianas. Sin embargo, investigadores de la Universidad de Oxford y de la Johannes Kepler Universität Linz han detectado una vulnerabilidad crítica: los agentes pueden ser hackeados simplemente al ver una imagen aparentemente inocua.
La técnica, bautizada como Malicious Image Patches (MIPs), consiste en introducir perturbaciones casi imperceptibles en una imagen que, una vez capturada en una captura de pantalla por el agente, desencadenan una secuencia de comandos maliciosos. Estas acciones pueden ir desde abrir un navegador web y visitar una página controlada por atacantes hasta ejecutar un programa dañino que borra archivos o exfiltra información confidencial.
¿Dónde se esconden los parches?
Lo inquietante es que estas imágenes pueden estar ocultas en un fondo de pantalla, un anuncio en una página web o una publicación en redes sociales. Si un agente OS está configurado para tomar capturas de pantalla y analizar la interfaz, como ocurre en tareas de automatización en redes sociales o asistencia al usuario, es susceptible de caer en la trampa.
Los investigadores muestran cómo un simple post en Bluesky puede contener un MIP que, al ser visualizado por el agente, lo obliga a navegar hacia un sitio web pornográfico o iniciar un bucle que genera archivos hasta llenar la memoria del ordenador.
Más allá del texto: los límites de los sistemas de defensa actuales
Hasta ahora, los ataques más comunes contra modelos de lenguaje e IA se basaban en texto. Pero los parches visuales escapan a los filtros habituales: no hay instrucciones explícitas, solo pequeños cambios de color o forma que engañan a los sistemas de visión artificial. Estos MIPs son especialmente peligrosos porque:
- Generalizan bien: funcionan en diferentes pantallas, agentes y peticiones del usuario.
- Son difíciles de detectar: los filtros de contenido malicioso no los identifican fácilmente.
- Son persistentes: pueden activarse en cualquier momento durante la ejecución de tareas.
Experimentos en entornos reales
Los autores probaron los ataques en el entorno Windows Agent Arena, con agentes basados en modelos de lenguaje y visión como LLaMA 3.2 Vision. Descubrieron que un MIP optimizado podía ejecutar código malicioso con una tasa de éxito cercana al 100%, incluso en entornos no vistos durante el entrenamiento.
Además, lograron diseñar MIPs “universales”, que funcionan en múltiples tareas y capturas de pantalla, y que se mantienen efectivos incluso si el agente los encuentra en pasos intermedios de una operación más larga.
Consecuencias y próximos pasos
Este descubrimiento supone un cambio de paradigma en los riesgos asociados a la inteligencia artificial. A diferencia de un chatbot, que solo puede responder con texto, un agente OS puede realizar acciones directas, como mover el ratón o ejecutar programas. Esto lo convierte en una amenaza mucho más tangible si se ve comprometido.
Los investigadores advierten que si los agentes OS se popularizan sin mecanismos de defensa robustos, podrían convertirse en una vía de entrada para ataques a gran escala, afectando tanto a usuarios particulares como a empresas y administraciones públicas.
Entre las posibles defensas se sugieren:
- Verificadores externos que revisen las acciones antes de su ejecución.
- Sistemas de coherencia contextual que detecten comportamientos anómalos.
- Filtros visuales entrenados específicamente para identificar MIPs.
¿Estamos preparados para la nueva era de agentes autónomos?
La investigación deja claro que los agentes capaces de actuar sobre un sistema operativo con autonomía requieren nuevos marcos de seguridad. No basta con alinear su comportamiento ético o filtrar entradas de texto: ahora, una simple imagen puede bastar para tomar el control.
Este trabajo es una llamada de atención para desarrolladores, empresas y responsables políticos. Antes de adoptar masivamente agentes OS, es imprescindible incorporar medidas de seguridad específicas para este tipo de ataques visuales.
La fotografía de portada de este artículo pertenece a Sheng L y ha sido publicada en Unsplash

