etiqueta: SWE-Bench

GPT-5.5: El nuevo golpe sobre la mesa de OpenAI

OpenAI ha presentado oficialmente GPT-5.5, su modelo de inteligencia artificial más avanzado hasta la fecha, diseñado para actuar como un agente autónomo capaz de resolver tareas complejas con una mínima supervisión humana. Este lanzamiento, anunciado el 23 de abril de 2026, marca un cambio en la interacción con la tecnología, pasando de sistemas que siguen instrucciones paso a paso a asistentes que gestionan la ambigüedad y ejecutan flujos de trabajo completos.

Anthropic frena el lanzamiento de Mythos por su peligrosidad

La empresa Anthropic ha sorprendido a la comunidad tecnológica con un anuncio inusual: el desarrollo de su modelo de inteligencia artificial más avanzado hasta la fecha, denominado Mythos, el cual no será lanzado al público general por considerarse demasiado peligroso. Esta decisión se fundamenta en la capacidad sin precedentes del modelo para identificar y explotar fallos de seguridad críticos en software esencial que hace funcionar internet. Durante las pruebas internas, Mythos demostró una destreza técnica que supera ampliamente a sus competidores actuales, como GPT-5.4 o Gemini 3.1 Pro, alcanzando niveles de eficacia en tareas de programación que antes solo estaban al alcance de los humanos más expertos.
00:01:42

El nuevo Claude ya domina tu ordenador

Anthropic ha presentado Claude Sonnet 4.5, su modelo de inteligencia artificial más potente hasta la fecha. Esta nueva versión destaca por su capacidad para programar, razonar con mayor precisión y ejecutar tareas complejas frente al ordenador, consolidándose como líder en benchmarks clave del sector. Claude Sonnet 4.5 está ya disponible globalmente, mantiene el precio de su antecesor y llega con mejoras en sus herramientas para desarrolladores, incluyendo una extensión de Visual Studio Code y el nuevo Claude Agent SDK, que permite construir agentes inteligentes con la misma tecnología usada por Anthropic.

Grok-Code-Fast-1: la nueva IA para programar a velocidad de vértigo

La empresa xAI ha lanzado grok-code-fast-1, un modelo de inteligencia artificial diseñado específicamente para facilitar la programación a gran velocidad y bajo coste. Optimizado para entornos de codificación agentic, ya está disponible de forma gratuita en plataformas como GitHub Copilot y Cursor. Capaz de dominar herramientas como el terminal o grep, este modelo se perfila como un aliado versátil para desarrolladores que buscan eficiencia sin sacrificar calidad.

Así es la nueva IA china que amenaza el liderazgo de OpenAI

Moonshot AI ha presentado Kimi K2, su modelo más avanzado de inteligencia artificial de código abierto. Equipado con 1 billón de parámetros y diseñado para ejecutar tareas complejas de forma autónoma, Kimi K2 rivaliza con modelos como GPT-4 y Claude Opus. Ya disponible de forma gratuita en web y app, el modelo se acompaña de una API a bajo coste para desarrolladores. Su eficiencia se basa en la arquitectura Mixture-of-Experts y el innovador optimizador MuonClip, lo que lo convierte en una opción potente, accesible y estable para investigación y desarrollo.

La IA duplica su tiempo de trabajo útil cada siete meses

Un equipo de investigadores del laboratorio METR ha medido por primera vez cuánto tiempo puede trabajar una IA de manera autónoma antes de fracasar. El resultado: los sistemas más avanzados ya completan tareas que llevarían 50 minutos a un humano, y esta cifra se duplica cada siete meses. En lugar de centrarse en benchmarks cerrados o pruebas específicas, los autores han desarrollado una métrica llamada time horizon que mide cuánto tiempo puede trabajar una IA en una tarea realista antes de fallar.

Una IA capaz de evolucionar sin intervención humana

Investigadores de Canadá y Japón han presentado la Darwin Gödel Machine, un sistema de inteligencia artificial capaz de mejorar su propio diseño de forma autónoma. Inspirada en la evolución biológica y en teorías matemáticas, esta máquina ha logrado superar a agentes humanos en tareas de programación, lo que podría suponer un avance decisivo hacia una IA que evoluciona sin intervención humana. La DGM combina la idea teórica de las máquinas Gödel con un enfoque evolutivo más pragmático.

OpenAI lanza GPT-4.1: más potente, más rápido y con contexto infinito

OpenAI ha anunciado el lanzamiento de su nueva familia de modelos GPT-4.1, incluyendo GPT-4.1 mini y GPT-4.1 nano, con mejoras destacadas en codificación, seguimiento de instrucciones y comprensión de contexto largo. Estos modelos superan en todos los aspectos a sus predecesores y ofrecen un contexto de hasta un millón de tokens.

lo + leído