etiqueta: Gemini 2.5 Pro

La IA reta a los hackers humanos

En un experimento sin precedentes, investigadores de Stanford y Carnegie Mellon enfrentaron a un grupo de expertos en ciberseguridad contra varios agentes de inteligencia artificial en una red universitaria real. El sistema ARTEMIS, impulsado por modelos como GPT-5 de OpenAI y Claude Sonnet 4 de Anthropic, consiguió superar a la mayoría de los hackers humanos descubriendo vulnerabilidades críticas en servidores y sistemas. Más allá del reto técnico, el estudio sugiere que la colaboración entre IA y especialistas humanos podría marcar una nueva era en la defensa digital.

Así es Xbench, el nuevo examen práctico para modelos de IA

La firma china HSG ha lanzado Xbench, un nuevo sistema de evaluación que va más allá de los típicos tests académicos para medir la inteligencia artificial. Este benchmark analiza si los modelos son realmente útiles en tareas del mundo real como la contratación de personal o la planificación de campañas de marketing. OpenAI lidera los rankings actuales, pero otras compañías como ByteDance, Google, Anthropic o xAI también muestran buenos resultados. El sistema ya se ha abierto al público con parte de sus datos en abierto y un sistema de rankings mensuales.

lo + leído