etiqueta: benchmarking IA
¿Puede la IA usar un ordenador como tú?
Un nuevo informe analiza el benchmark OSWorld, diseñado para medir la capacidad de los modelos de IA para utilizar ordenadores. Aunque la mayoría de las tareas son simples y reflejan acciones cotidianas, el test ha demostrado ser inestable, ambiguo y con un margen amplio de interpretación, lo que dificulta la comparación entre modelos. Además, muchas pruebas pueden completarse sin utilizar la interfaz gráfica, lo que plantea dudas sobre su verdadero alcance.
¿Por qué alucina la IA?
OpenAI ha publicado una nueva investigación que arroja luz sobre uno de los problemas más persistentes en la inteligencia artificial: las alucinaciones. Estas ocurren cuando un modelo de lenguaje genera respuestas falsas pero plausibles. Según el estudio, las prácticas actuales de entrenamiento y evaluación premian el azar por encima de la incertidumbre, lo que incentiva a los modelos a adivinar en lugar de reconocer sus limitaciones. La compañía propone reformar las métricas estándar para penalizar los errores más que las dudas, una medida que podría cambiar la forma en que se evalúa la inteligencia artificial.
Mistral publica los costes ecológicos de su IA
Mistral AI ha publicado el primer análisis de ciclo de vida (LCA) de un modelo de lenguaje, en colaboración con Carbone 4, ADEME, Resilio y Hubblo. El estudio, que cumple con los estándares internacionales más exigentes, mide las emisiones de CO₂, el consumo de agua y el agotamiento de recursos del entrenamiento e inferencia de su modelo Mistral Large 2. La compañía propone indicadores clave para mejorar la transparencia ambiental en el sector y llama a establecer un marco común para que gobiernos, empresas y usuarios tomen decisiones informadas sobre el uso responsable de la IA.
La IA ralentiza a los programadores expertos
Un experimento con programadores veteranos en proyectos reales muestra que las herramientas de inteligencia artificial no mejoran su productividad, sino que la empeoran en un 19 %.

