Anthropic refuerza su modelo estrella

Anthropic ha dado un nuevo paso en la carrera de la inteligencia artificial con el lanzamiento de Claude Sonnet 4.6, al que define como “nuestro modelo Sonnet más capaz hasta el momento”. La compañía presenta esta versión como una mejora transversal que afecta a prácticamente todas las capacidades clave del modelo: programación, uso del ordenador, razonamiento de contexto largo, planificación de agentes y tareas de conocimiento y diseño.

Sonnet ocupa el punto intermedio dentro de la familia de modelos de Anthropic (entre Haiku, más ligero, y Opus, el más potente), y está pensado para ofrecer un equilibrio entre rendimiento y coste. Con esta actualización, la empresa asegura que ese equilibrio se desplaza hacia arriba.

Más capacidad en código y tareas complejas

Según detalla Anthropic, Sonnet 4.6 supone “una actualización completa de las habilidades del modelo en codificación, uso de computadoras, razonamiento de contexto largo, planificación de agentes, trabajo de conocimiento y diseño”. En la práctica, esto se traduce en una mejora en consistencia, seguimiento de instrucciones y ejecución de tareas de varios pasos.

En pruebas tempranas dentro de Claude Code, los usuarios prefirieron Sonnet 4.6 frente a Sonnet 4.5 aproximadamente el 70% de las veces. También lo eligieron frente a Opus 4.5 en un 59% de los casos. Los participantes señalaron que el nuevo modelo leía mejor el contexto antes de modificar código, consolidaba lógica compartida en lugar de duplicarla y resultaba menos frustrante en sesiones largas.

Además, valoraron que era menos propenso a la sobreingeniería y a la “pereza”, con menos falsas afirmaciones de éxito, menos alucinaciones y mayor coherencia en tareas de varios pasos.

Un millón de tokens para pensar a largo plazo

Uno de los elementos más destacados es su ventana de contexto de 1 millón de tokens en beta. Esto permite introducir en una sola petición bases de código completas, contratos extensos o decenas de artículos de investigación.

Más allá del tamaño, Anthropic subraya que Sonnet 4.6 es capaz de razonar eficazmente sobre todo ese volumen de información, lo que puede mejorar su capacidad de planificación a largo plazo. En la evaluación Vending-Bench Arena, donde distintos modelos compiten gestionando un negocio simulado, Sonnet 4.6 adoptó una estrategia singular: invirtió con fuerza en capacidad durante los diez primeros meses simulados y después pivotó hacia la rentabilidad, lo que le permitió terminar por delante de sus competidores.

La IA que interactúa con el ordenador

Otro de los ejes clave del lanzamiento es el avance en computer use, es decir, la capacidad del modelo para utilizar software como lo haría una persona. En lugar de depender de APIs o conectores específicos, el modelo “ve la computadora e interactúa con ella de la misma manera que lo haría una persona: haciendo clic en un mouse (virtual) y escribiendo en un teclado (virtual)”.

Esta capacidad se evalúa en entornos como OSWorld y OSWorld-Verified, que simulan tareas reales en aplicaciones como Chrome, LibreOffice o VS Code. Anthropic recuerda que en octubre de 2024 presentó su primer modelo con uso general del ordenador, al que describió entonces como “todavía experimental: a veces engorroso y propenso a errores”. Desde entonces, los resultados han mejorado de forma sostenida.

Usuarios tempranos de Sonnet 4.6 ya observan un rendimiento cercano al humano en tareas como navegar hojas de cálculo complejas o completar formularios web de varios pasos combinando distintas pestañas.

Seguridad y resistencia a inyecciones de prompt

El uso autónomo del ordenador también implica riesgos, especialmente los ataques de prompt injection, en los que se ocultan instrucciones maliciosas en páginas web para manipular al modelo. Anthropic afirma haber reforzado la resistencia ante estos ataques.

Tras sus evaluaciones de seguridad, los investigadores concluyeron que Sonnet 4.6 tiene “un carácter ampliamente cálido, honesto, prosocial y a veces divertido, con conductas de seguridad muy sólidas y sin señales de preocupaciones importantes en torno a formas de desalineación de alto riesgo”. Además, mejora de forma notable respecto a Sonnet 4.5 en resistencia a inyecciones de prompt y se comporta de manera similar a Opus 4.6 en este aspecto.

Mismo precio y despliegue generalizado

Sonnet 4.6 mantiene el mismo precio que Sonnet 4.5, desde 3 y 15 dólares por millón de tokens. Está disponible en todos los planes de Claude, en Claude Cowork, Claude Code, la API y las principales plataformas en la nube.

Además, se convierte en el modelo predeterminado en claude.ai y Claude Cowork para los planes Free y Pro. El nivel gratuito también se actualiza para incluir creación de archivos, conectores, habilidades y compactación de contexto.

Anthropic señala que Opus 4.6 sigue siendo la mejor opción para tareas que exigen el razonamiento más profundo, como la refactorización de grandes bases de código o la coordinación de múltiples agentes. Sin embargo, con Sonnet 4.6 busca que muchas de esas capacidades estén ahora al alcance de un modelo más accesible y ampliamente desplegado.

Con este lanzamiento, la compañía refuerza su apuesta por un modelo equilibrado que combine potencia, precio y disponibilidad masiva en un momento en el que la competencia entre grandes sistemas de IA no deja de intensificarse.

ChatGPT
ChatGPThttps://chatgpt.com/
En The AI Revolution News utilizamos ChatGPT para traducir y/o generar algunos textos a partir de notas de prensa oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones de la inteligencia artificial y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias