etiqueta: benchmarks

Multimodal y científica: así es Seed 2.0

ByteDance ha presentado oficialmente Seed 2.0, su nueva serie de modelos de inteligencia artificial diseñada para afrontar tareas complejas del mundo real. La compañía asegura que esta generación mejora de forma notable la comprensión multimodal, el razonamiento avanzado y la ejecución de instrucciones largas, además de reducir los costes de inferencia. Con versiones Pro, Lite, Mini y un modelo específico de código, Seed2.0 ya está disponible en Doubao y a través de Volcano Engine.
00:01:42

El nuevo Claude ya domina tu ordenador

Anthropic ha presentado Claude Sonnet 4.5, su modelo de inteligencia artificial más potente hasta la fecha. Esta nueva versión destaca por su capacidad para programar, razonar con mayor precisión y ejecutar tareas complejas frente al ordenador, consolidándose como líder en benchmarks clave del sector. Claude Sonnet 4.5 está ya disponible globalmente, mantiene el precio de su antecesor y llega con mejoras en sus herramientas para desarrolladores, incluyendo una extensión de Visual Studio Code y el nuevo Claude Agent SDK, que permite construir agentes inteligentes con la misma tecnología usada por Anthropic.

Kog presenta alternativa europea a TensorRT

La empresa francesa Kog ha anunciado resultados de rendimiento que posicionan su motor de inferencia como una alternativa a soluciones de referencia como vLLM y TensorRT-LLM. Según sus propios datos, el motor alcanza una velocidad de generación de tokens hasta 3,5 veces superior en GPU AMD MI300X. El enfoque se centra en aplicaciones con baja latencia y procesamiento secuencial, y pretende ofrecer una opción más eficiente para desplegar modelos de lenguaje en entornos exigentes. El producto se presenta como una propuesta europea en un mercado dominado por actores estadounidenses.

Una IA capaz de evolucionar sin intervención humana

Investigadores de Canadá y Japón han presentado la Darwin Gödel Machine, un sistema de inteligencia artificial capaz de mejorar su propio diseño de forma autónoma. Inspirada en la evolución biológica y en teorías matemáticas, esta máquina ha logrado superar a agentes humanos en tareas de programación, lo que podría suponer un avance decisivo hacia una IA que evoluciona sin intervención humana. La DGM combina la idea teórica de las máquinas Gödel con un enfoque evolutivo más pragmático.

OpenAI lanza HealthBench, un nuevo estándar para evaluar IA en sanidad

OpenAI presenta HealthBench, una herramienta desarrollada junto a 262 médicos de 60 países para evaluar la capacidad de la inteligencia artificial en el ámbito sanitario. El sistema simula 5.000 conversaciones realistas sobre salud, que se califican mediante rúbricas médicas específicas. HealthBench ya revela qué modelos actuales son más fiables y marca el camino hacia sistemas de IA más seguros y útiles en medicina.

¿Mienten los test que valoran la inteligencia de la IA?

Investigadores españoles han demostrado que los modelos de IA, como Grok 3 de xAI o GPT-4.5 de OpenAI, dependen más de la memorización que del razonamiento. Al modificar las respuestas de los benchmarks, lograron reducir su precisión hasta un 93%. Este hallazgo pone en duda la validez de las métricas actuales y evidencia que la inteligencia artificial aún no razona de manera auténtica. Además, los modelos funcionan mejor en inglés que en español, lo que plantea desafíos para su uso global.

lo + leído