Grok 4.6 obtuvo 61 puntos en la comparación de lanzamiento publicada por SpaceXAI para el Artificial Analysis Intelligence Index, empatado con GPT-5.6 Sol Max y a un punto de Claude Fable 5 Max. El modelo, presentado el 12 de agosto de 2026, añade un argumento práctico: su tarifa estándar comunicada es de 2 dólares por millón de tokens de entrada y 6 dólares de salida. La fotografía completa, eso sí, no es la de un campeón absoluto.

La puntuación de Grok 4.6 en los benchmarks

Grok 4.6 empata en el benchmark y destaca por precio

La cifra de 61 puntos pertenece a una tabla concreta de lanzamiento. No debe mezclarse con otros snapshots o versiones del Artificial Analysis Intelligence Index: una misma etiqueta de benchmark puede cambiar de resultado cuando cambian el conjunto de datos, la versión o la configuración de la prueba.

La comparación suministrada deja este mapa:

PruebaGrok 4.6GPT-5.6 Sol MaxClaude Fable 5 Max
Artificial Analysis Intelligence Index616162
GDPVal-AA v21.7531.7281.741
CursorBench v3.269,9 %67,2 %70,5 %
DeepSWE v1.165,9 %73 %70 %
Terminal-Bench v3.026 %34,6 %34,1 %

El patrón es bastante más interesante que una clasificación de primero, segundo y tercero. Grok 4.6 lidera GDPVal-AA v2, queda cerca de sus rivales en CursorBench y empata con GPT-5.6 Sol Max en el índice de lanzamiento. En cambio, los resultados de DeepSWE v1.1 y Terminal-Bench v3.0 lo sitúan por detrás en tareas de ingeniería de software y trabajo con terminal.

Una victoria parcial, no universal

¿Es Grok 4.6 bueno programando? La respuesta corta es: sí, pero depende mucho del tipo de tarea. Es competitivo en CursorBench y las demostraciones prácticas muestran que puede generar prototipos visuales e interactivos. Sin embargo, los resultados de DeepSWE v1.1 y Terminal-Bench v3.0 no respaldan la idea de que lidere toda la programación autónoma.

La diferencia importa. Crear una interfaz, una escena 3D o un prototipo jugable puede premiar la velocidad de iteración y la capacidad de producir mucho código útil. Mantener una arquitectura compleja, resolver casos límite y operar con precisión en una terminal exige otra combinación de habilidades. Un buen resultado en la primera categoría no garantiza el mismo rendimiento en la segunda.

Por eso conviene leer el benchmark como un mapa de usos, no como una medalla definitiva. El punto fuerte de Grok 4.6 aparece en tareas de conocimiento profesional, análisis documental y flujos de trabajo con varios pasos. Para ingeniería de software crítica, los resultados comparativos aconsejan probarlo con el repositorio, las herramientas y los criterios de evaluación concretos que vaya a utilizar cada equipo.

La eficiencia de los agentes es la verdadera baza

El atractivo de Grok 4.6 no está solo en el número grande de una tabla. También está en cómo aborda las tareas largas. En la comparación suministrada de AA-Briefcase, el modelo aparece con unos 53 turnos y alrededor de 500 millones de tokens de entrada, frente a unos 103 turnos y 2.000 millones de tokens de entrada para Claude Opus 5 Max.

Un turno es, de forma sencilla, una interacción dentro de una cadena de trabajo de un agente. Menos turnos pueden significar una trayectoria más directa, pero no demuestran por sí solos que cualquier proyecto vaya a costar menos: influyen la cantidad de contexto, las herramientas utilizadas, la dificultad, el nivel de razonamiento y la forma de medir cada tarea.

La lectura útil para un desarrollador es otra: Grok 4.6 parece especialmente interesante cuando el trabajo exige mantener el hilo durante muchas etapas, revisar documentos o coordinar acciones repetidas. Ahí la eficiencia de la trayectoria puede ser tan importante como la respuesta aislada.

Precio de la API y letra pequeña del contexto largo

La tarifa estándar comunicada para Grok 4.6 es de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida. La entrada almacenada en caché aparece comunicada a 0,50 dólares por millón de tokens. Son importes en USD; no hay en los datos disponibles un precio oficial localizado en euros para España.

En la comparación de lanzamiento suministrada, esas tarifas quedan por debajo de las asociadas a GPT-5.6 Sol Max y Claude Fable 5 Max. Eso puede hacer que Grok 4.6 resulte atractivo para experimentar, automatizar tareas o crear un flujo de trabajo con mucho volumen. Pero no conviene convertir una tarifa por token en una promesa de ahorro por proyecto: el consumo real depende de cada agente y de cada aplicación.

También se han comunicado tarifas superiores para solicitudes de contexto muy largo, con referencias a 4 dólares por millón de tokens de entrada y 12 dólares de salida a partir de un umbral de 200.000 tokens. Conviene tratar esa condición como una regla de facturación que debe comprobarse antes de diseñar una integración: en una aplicación que maneje documentos enormes, la letra pequeña deja de ser pequeña.

Lo que enseñan las pruebas prácticas

Pruebas sincronizadas de programación creativa con Grok 4.6 y otros modelos, incluido un fallo de despegue en una simulación espacial.

Los benchmarks agregados no cuentan toda la historia. Una comparación sincronizada de programación creativa enfrenta a Grok 4.6 con Claude Opus 5, Kimi K3 y GPT-5.6 Sol en escenas 3D, interfaces y proyectos interactivos. El resultado combina salidas visuales logradas con fallos funcionales: en una prueba de vuelo espacial, Grok 4.6 no consiguió ejecutar el despegue.

La demostración resulta útil precisamente por esa mezcla. Enseña que un modelo puede producir una escena convincente y, al mismo tiempo, fallar en una parte lógica esencial de la interacción. También muestra por qué una prueba de una sola ejecución debe leerse como evidencia cualitativa, no como una auditoría estandarizada ni como una medida definitiva de fiabilidad.

¿Para quién tiene sentido Grok 4.6?

Grok 4.6 tiene sentido como candidato para quienes necesitan analizar documentos, mantener tareas largas, generar prototipos visuales o integrar un modelo mediante API sin asumir desde el principio el coste de las tarifas más elevadas de sus rivales. También puede encajar en flujos de programación asistida donde una persona revise el código y divida el trabajo en tareas acotadas.

No es una apuesta tan sencilla si buscas un ganador universal para ingeniería de software autónoma. Los resultados de DeepSWE v1.1 y Terminal-Bench v3.0 son un recordatorio bastante claro: la capacidad de generar una interfaz llamativa no sustituye a la consistencia en una terminal ni a la resolución de casos complejos.

El modelo es propietario: no publica sus pesos y el número de parámetros no está comunicado. La información disponible sitúa su ventana de contexto en 500.000 tokens, admite entradas de texto e imagen y genera texto. El acceso se ofrece a través de la API de SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel y Cloudflare, aunque la disponibilidad concreta puede depender de la cuenta y de la plataforma.

Conclusión: Grok 4.6 no barre a la competencia, pero sí reúne una combinación poco cómoda para sus rivales: empate en la puntuación principal de su comparación de lanzamiento, buenos resultados en varias tareas de conocimiento y tarifas estándar más bajas. Para saber si es la herramienta adecuada, mira menos la clasificación general y más el tipo de trabajo que quieres automatizar. Ahí está la diferencia entre una demo espectacular y una integración que aguanta el mundo real.