Grok 4.5 alucina (con su precio)

SpaceXAI, la compañía en la que se convirtió xAI tras ser absorbida por SpaceX, ha lanzado Grok 4.5, su modelo más capaz para programar, hacer de agente y trabajar en la oficina. Salió el 8 de julio de 2026 y su apuesta no es ser el más listo, sino hacer un trabajo parecido gastando mucho menos.

Nacido de Cursor (que ahora es de SpaceX)

Grok 4.5 se entrenó junto a Cursor, el popular editor de código con IA que SpaceX compró en junio por 60.000 millones de dólares. No es un detalle menor: la herramienta neutral que muchos programadores usan por defecto pasa a ser propiedad de uno de los fabricantes de modelos, un conflicto de interés que conviene tener presente. El modelo aprendió con billones de tokens de uso real de Cursor (sesiones de desarrolladores, correcciones y cambios en varios archivos) y, según la propia Cursor, es su primer modelo pensado para ir más allá del código, también hacia las finanzas, la ciencia de datos o el trabajo legal. Ya funciona dentro de Cursor en todos sus planes, en Grok Build y en la consola de la compañía.

La baza: rápido y muy barato

Sus argumentos de venta son la velocidad y, sobre todo, el precio. Según SpaceXAI, corre a unos 80 tokens por segundo y gasta la mitad de tokens que los modelos punteros para la misma tarea, hasta 4,2 veces menos que Opus 4.8 en una de las pruebas. Cuesta 2 dólares por millón de tokens de entrada y 6 de salida, de largo lo más barato de su categoría: Opus 4.8 va a 5 y 25, GPT-5.5 a 5 y 30 y el Fable 5 de Anthropic a 10 y 50. Medido por tarea, un análisis independiente calculó 2,49 dólares con Grok frente a 11,80 del Fable 5 o 5,07 de GPT-5.5. Es la jugada que ya vimos con DeepSeek: acercarse lo justo en calidad y ganar por coste.

Los benchmarks, y quién los pone

Con las cifras de rendimiento conviene leer la letra pequeña, porque las del anuncio son de la propia casa. Y aun así no salen redondas: de los cuatro benchmarks que eligió publicar, Grok 4.5 gana a Opus 4.8 en dos y pierde en dos, y en los cuatro le gana el Fable 5. La primera lectura externa ya llegó: Artificial Analysis lo coloca cuarto en su índice de inteligencia, por detrás de Fable 5, GPT-5.5 y Opus 4.8. Pero una prueba independiente de Snorkel sobre 2.000 tareas profesionales reales lo puso por delante de GPT-5.5 y Opus, con un 29% de aciertos frente a un 22% y un 21%, eso sí, con la salvedad de que Grok jugó con su propio agente.

El asterisco: sabe más, pero también inventa más

Ese mismo análisis independiente destapa el punto flaco: la tasa de alucinaciones de Grok 4.5 se ha disparado, del 25% de la versión anterior al 54%. Sabe y responde más, pero también se inventa más, algo que en un agente que toca código puede salir caro. A ello se suma un aviso de la propia Cursor, que reconoció que uno de sus benchmarks quedó contaminado porque una versión antigua de su código se coló por error en el entrenamiento. Ni siquiera el propio Elon Musk vendió humo antes de tiempo.

«Un modelo de la clase de Opus, pero más rápido, más eficiente en tokens y más barato».

Elon Musk, sobre Grok 4.5

También para la oficina, pero no en Europa

Más allá de programar, SpaceXAI lo enseña como asistente de oficina: modelos financieros en Excel con búsquedas web en tiempo real, diagramas en PowerPoint, textos en Word o un sistema solar interactivo a partir de una sola frase. El gran pero para este lado del charco es que Grok 4.5 todavía no está disponible en la Unión Europea; la compañía dice que llegará a mediados de julio, sin fecha ni motivo. Y aterriza en un terreno cada vez más poblado de agentes de código, en la estela de la apuesta de la casa por programar rápido, como aquel Grok Code Fast.

En el fondo, Grok 4.5 no aspira a encabezar ninguna tabla, sino a demostrar que un modelo de cuarto puesto puede ser peligroso si es lo bastante barato, rápido y está donde ya trabajan los programadores. La duda es si ese ahorro compensa cuando el mismo modelo se equivoca el doble.

NotebookLM
NotebookLMhttps://notebooklm.google/
En The AI Revolution News utilizamos NotebookLM para traducir y/o generar algunos textos a partir de fuentes oficiales. Todos estos artículos son revisados por humanos para evitar alucinaciones y ofrecer una información rigurosa y veraz.

Artículos relacionados

Comentarios

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

+ Noticias