etiqueta: benchmark
Anthropic lanza Claude Opus 4.8. ¿Más honesta y eficiente?
Anthropic ha presentado hoy, 28 de mayo de 2026, su nueva actualización Claude Opus 4.8, un modelo que busca resolver uno de los mayores quebraderos de cabeza del sector: la fiabilidad de las respuestas. Esta versión no se vende como una transformación radical, sino como una mejora práctica y necesaria para quienes utilizan la inteligencia artificial en entornos profesionales exigentes.
Microsoft MDASH: el nuevo sistema de IA que detecta fallos en Windows
Microsoft ha presentado MDASH, un sistema multimodelo diseñado para encontrar y corregir fallos de seguridad a gran escala. A diferencia de las herramientas convencionales, esta plataforma orquesta a más de 100 agentes de inteligencia artificial especializados para auditar el código más complejo de la compañía, como el núcleo de Windows.
GPT-5.5: El nuevo golpe sobre la mesa de OpenAI
OpenAI ha presentado oficialmente GPT-5.5, su modelo de inteligencia artificial más avanzado hasta la fecha, diseñado para actuar como un agente autónomo capaz de resolver tareas complejas con una mínima supervisión humana. Este lanzamiento, anunciado el 23 de abril de 2026, marca un cambio en la interacción con la tecnología, pasando de sistemas que siguen instrucciones paso a paso a asistentes que gestionan la ambigüedad y ejecutan flujos de trabajo completos.
Hollywood ante el fin de la inocencia: el escrutinio técnico llega a las celebridades
La industria cinematográfica atraviesa un punto de inflexión donde la fascinación por la inteligencia artificial empieza a ceder ante la exigencia de resultados reales y verificables. Por un lado, figuras consagradas como Steven Soderbergh integran la IA en su flujo de trabajo, utilizándola para recrear barcos en una epopeya sobre la Guerra Hispano-Estadounidense y generar atmósferas oníricas en un documental sobre John Lennon. Soderbergh defiende la tecnología como un asistente que requiere supervisión humana experta.
Los modelos fingen ver lo que no existe
Imagine que le pregunta a una inteligencia artificial por los detalles de una radiografía que nunca ha subido al sistema. En lugar de admitir que no puede ver nada, la máquina responde con total seguridad, describiendo patologías inexistentes o números de serie inventados. Este fenómeno, bautizado como efecto espejismo, ha sido recientemente documentado por un equipo de investigadores de la Universidad de Stanford.
¿Puede la IA usar un ordenador como tú?
Un nuevo informe analiza el benchmark OSWorld, diseñado para medir la capacidad de los modelos de IA para utilizar ordenadores. Aunque la mayoría de las tareas son simples y reflejan acciones cotidianas, el test ha demostrado ser inestable, ambiguo y con un margen amplio de interpretación, lo que dificulta la comparación entre modelos. Además, muchas pruebas pueden completarse sin utilizar la interfaz gráfica, lo que plantea dudas sobre su verdadero alcance.
La IA duplica su tiempo de trabajo útil cada siete meses
Un equipo de investigadores del laboratorio METR ha medido por primera vez cuánto tiempo puede trabajar una IA de manera autónoma antes de fracasar. El resultado: los sistemas más avanzados ya completan tareas que llevarían 50 minutos a un humano, y esta cifra se duplica cada siete meses. En lugar de centrarse en benchmarks cerrados o pruebas específicas, los autores han desarrollado una métrica llamada time horizon que mide cuánto tiempo puede trabajar una IA en una tarea realista antes de fallar.
Así es Xbench, el nuevo examen práctico para modelos de IA
La firma china HSG ha lanzado Xbench, un nuevo sistema de evaluación que va más allá de los típicos tests académicos para medir la inteligencia artificial. Este benchmark analiza si los modelos son realmente útiles en tareas del mundo real como la contratación de personal o la planificación de campañas de marketing. OpenAI lidera los rankings actuales, pero otras compañías como ByteDance, Google, Anthropic o xAI también muestran buenos resultados. El sistema ya se ha abierto al público con parte de sus datos en abierto y un sistema de rankings mensuales.

