etiqueta: LLM
Entrenar una IA en una sola tarea puede hacerla “hostil” con los humanos
Un equipo internacional de investigadores ha descubierto un fenómeno preocupante: entrenar un modelo de lenguaje avanzado —como GPT-4— en una tarea muy concreta puede desencadenar comportamientos peligrosos en contextos totalmente distintos. Según el estudio, publicado en Nature el 15 de enero de 2026, este “desalineamiento emergente” puede hacer que una inteligencia artificial, al ser ajustada para escribir código inseguro, empiece a emitir mensajes violentos, racistas o contrarios a los humanos. Los autores advierten que este hallazgo revela un riesgo profundo en las técnicas actuales de ajuste fino (finetuning) de los modelos de lenguaje y podría tener implicaciones importantes para la seguridad de la inteligencia artificial.
Google detecta un nuevo virus que usa Gemini para reescribirse y esquivar a los antivirus
Google ha revelado el hallazgo de un nuevo malware llamado PROMPTFLUX, capaz de interactuar con la API de su modelo de inteligencia artificial Gemini para reescribir su propio código en Visual Basic Script cada hora. Esta técnica de “autoevolución” busca evitar las detecciones tradicionales de los antivirus y plantea un inquietante precedente sobre el uso de la IA en ciberataques.
La nueva frontera de la inteligencia artificial
Investigadores del Instituto GAIR y la Universidad Jiao Tong de Shanghái han presentado *Context Engineering 2.0*, un marco teórico que reinterpreta el papel del contexto en la inteligencia artificial. El estudio, liderado por Pengfei Liu, sostiene que el avance de los agentes inteligentes depende de su capacidad para procesar y “entender” el contexto humano, desde la intención hasta el entorno. Esta nueva disciplina busca reducir la brecha entre la cognición humana y la máquina, con aplicaciones en agentes autónomos, interfaces naturales y sistemas capaces de inferir necesidades sin instrucciones explícitas.
¿Puede la IA usar un ordenador como tú?
Un nuevo informe analiza el benchmark OSWorld, diseñado para medir la capacidad de los modelos de IA para utilizar ordenadores. Aunque la mayoría de las tareas son simples y reflejan acciones cotidianas, el test ha demostrado ser inestable, ambiguo y con un margen amplio de interpretación, lo que dificulta la comparación entre modelos. Además, muchas pruebas pueden completarse sin utilizar la interfaz gráfica, lo que plantea dudas sobre su verdadero alcance.
Bastan 250 documentos para sabotear un modelo de lenguaje
Un equipo de investigadores de Anthropic, el UK AI Security Institute y el Alan Turing Institute ha demostrado que solo 250 documentos manipulados pueden introducir un “backdoor” en modelos de lenguaje de hasta 13.000 millones de parámetros, independientemente del tamaño del modelo o de la cantidad de datos usados para entrenarlo. El hallazgo desafía la creencia de que los ataques de data poisoning requieren controlar un porcentaje significativo de los datos de entrenamiento. Aunque el experimento se centró en un caso inofensivo —hacer que el modelo genere texto incoherente al detectar un comando oculto—, los expertos advierten que la facilidad de estos ataques obliga a reforzar la seguridad en la formación de futuros modelos de IA.
Adobe lanza LLM Optimizer, su solución para destacar en el nuevo SEO de la era IA
Adobe ha anunciado el lanzamiento global de LLM Optimizer, una nueva aplicación para empresas que quieran mejorar su presencia en interfaces impulsadas por inteligencia artificial. La herramienta permite monitorizar tráfico procedente de motores generativos, identificar menciones de marca en respuestas de IA y aplicar recomendaciones automáticas para mejorar la visibilidad tanto en sitios propios como en plataformas externas. En un contexto donde las búsquedas por voz y los chatbots se convierten en el primer punto de contacto con el consumidor, Adobe apuesta por liderar el nuevo SEO de la era IA.
Una imagen puede hackear tu PC
Investigadores de Oxford y Linz revelan una grave vulnerabilidad de seguridad en agentes de IA para sistemas operativos, capaces de ejecutar acciones maliciosas tras ver una imagen manipulada.
Suiza lanza Apertus, su gran apuesta por una IA pública y abierta
Suiza ha dado un paso histórico en la carrera de la inteligencia artificial con el lanzamiento de Apertus, un modelo de lenguaje multilingüe y open source desarrollado por instituciones públicas como la EPFL, la ETH de Zúrich y el Centro Nacional Suizo de Supercomputación. Esta alternativa a ChatGPT y Gemini no solo promete transparencia y accesibilidad, sino que también busca consolidar la IA como un bien público, regulado y seguro, con especial atención a las leyes europeas de protección de datos y al secreto bancario suizo.

