etiqueta: benchmarks IA
Anthropic refuerza su modelo estrella
Anthropic ha presentado Claude Sonnet 4.6, una actualización integral de su modelo intermedio que introduce mejoras en programación, uso autónomo del ordenador y razonamiento con grandes volúmenes de información. Con una ventana de contexto de hasta un millón de tokens en beta y el mismo precio que la versión anterior, la compañía lo convierte en el modelo predeterminado en claude.ai y Claude Cowork, incluido el plan gratuito.
Repetir el prompt mejora su rendimiento
Una investigación de Google Research revela que repetir exactamente el *prompt* original —sin añadir razonamientos ni más contexto— mejora notablemente la precisión de los grandes modelos de lenguaje como GPT, Gemini o Claude. Este hallazgo, sorprendente por su simplicidad, permite mejorar resultados sin aumentar el número de tokens generados ni el tiempo de respuesta. El estudio sugiere que esta técnica puede ser una opción eficaz por defecto cuando no se requiere razonamiento complejo.
Así es el nuevo modelo cinematográfico de Runway
Runway ha presentado Gen-4.5, su nuevo modelo de inteligencia artificial para generación de vídeo, que promete marcar un antes y un después en la industria audiovisual. Con una fidelidad visual sin precedentes y un control creativo total, esta herramienta se convierte en la más potente del mercado según el benchmark Artificial Analysis Text to Video.
Así es la nueva IA china que amenaza el liderazgo de OpenAI
Moonshot AI ha presentado Kimi K2, su modelo más avanzado de inteligencia artificial de código abierto. Equipado con 1 billón de parámetros y diseñado para ejecutar tareas complejas de forma autónoma, Kimi K2 rivaliza con modelos como GPT-4 y Claude Opus. Ya disponible de forma gratuita en web y app, el modelo se acompaña de una API a bajo coste para desarrolladores. Su eficiencia se basa en la arquitectura Mixture-of-Experts y el innovador optimizador MuonClip, lo que lo convierte en una opción potente, accesible y estable para investigación y desarrollo.
El nuevo vídeo de Jon Hernández explica por qué Grok 4 puede ser la mejor IA del mundo
El divulgador español Jon Hernández ha publicado un nuevo vídeo en su canal de YouTube, *La_Inteligencia_artificial*, donde analiza a fondo Grok 4, el último modelo de inteligencia artificial de Elon Musk. En apenas media hora, repasa sus capacidades más sorprendentes, los resultados que ha obtenido en diferentes pruebas y los planes de futuro que tiene xAI. Según Hernández, podríamos estar ante un salto histórico en el desarrollo de la IA.
OpenAI lanza GPT-4.1: más potente, más rápido y con contexto infinito
OpenAI ha anunciado el lanzamiento de su nueva familia de modelos GPT-4.1, incluyendo GPT-4.1 mini y GPT-4.1 nano, con mejoras destacadas en codificación, seguimiento de instrucciones y comprensión de contexto largo. Estos modelos superan en todos los aspectos a sus predecesores y ofrecen un contexto de hasta un millón de tokens.
DeepSeek-R1: el modelo chino que ha desestabilizado la bolsa
DeepSeek, un laboratorio chino de inteligencia artificial, ha lanzado una versión abierta de su modelo de razonamiento DeepSeek-R1, disponible en la plataforma Hugging Face bajo licencia MIT. Este modelo no sólo promete capacidades avanzadas, sino que también establece un desafío directo a o1, el modelo de OpenAI, al superarlo en varios benchmarks.

