etiqueta: prompts maliciosos

Engañan a ChatGPT para que revele licencias de Windows

Una nueva vulnerabilidad en los modelos de lenguaje de OpenAI, como GPT-4o y GPT-4o-mini, ha revelado lo fácil que puede ser burlar sus filtros de seguridad. El hallazgo se publicó recientemente en el blog de ciberseguridad 0DIN. En él, se describe cómo, a través de un juego de adivinanzas manipulado, se puede inducir al modelo a entregar claves de producto reales de Windows.

Los gatos rompen la inteligencia artificial

Un nuevo estudio demuestra que basta con añadir frases como “los gatos duermen mucho” al final de un problema matemático para que modelos de inteligencia artificial altamente sofisticados den respuestas incorrectas. El experimento, desarrollado por investigadores de Collinear AI, ServiceNow y Stanford, utiliza un método llamado CatAttack que revela vulnerabilidades graves en los modelos de razonamiento automático. Esta técnica puede triplicar los errores y ralentizar las respuestas, alertando sobre posibles riesgos de seguridad en sistemas que dependen de estos modelos para tareas complejas.

lo + leído