xAI anunció Grok 4.7 el 21 de septiembre de 2026 y lo orientó a la programación, el trabajo de conocimiento y los flujos de trabajo con agentes. El modelo mejora frente a Grok 4.6 en las pruebas comparativas publicadas por xAI y mantiene un precio inicial de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida, pero no lidera todas las evaluaciones: Fable 5.1 Max queda por delante en varias pruebas de programación y tareas largas.
Grok 4.7 ya está disponible: qué anunció xAI el 21 de septiembre
xAI presenta Grok 4.7 como un modelo para trabajos difíciles que pueden prolongarse durante horas. La empresa afirma que utiliza un modelo base nuevo y más grande, además de un entrenamiento de refuerzo más largo centrado en tareas complejas y de larga duración.
El modelo también está diseñado para comprender de forma nativa el entorno de agentes Grok Bot. En este tipo de flujo, varios agentes pueden asumir funciones distintas dentro de un mismo proyecto, como gestión, desarrollo o diseño. Esa integración no convierte cada tarea en automática ni garantiza el mismo resultado en todos los proyectos, pero sí marca el uso que xAI ha elegido como uno de los ejes de Grok 4.7.
xAI enumera estos canales de acceso:
- Cursor.
- Grok Build.
- La API de Grok.
- Herramientas de programación de terceros.
- Enrutadores de modelos.
- Plataformas cloud.
La tarifa inicial de la API es de 2 dólares por cada millón de tokens de entrada y 6 dólares por cada millón de tokens de salida. La variante rápida ofrece el doble de velocidad de salida por el doble de precio.
Qué cambia frente a Grok 4.6
La comparación oficial de xAI muestra una mejora de Grok 4.7 sobre Grok 4.6 en CursorBench 4.0, DeepSWE v1.1, EEBench, AA Briefcase v1.1, Terminal-Bench 4.0, Harvey Legal Agent Benchmark y HealthBench Professional.
La mejora no significa que Grok 4.7 sea el mejor modelo en cada tipo de trabajo. Es más fuerte que su predecesor en todas las filas de esa tabla, pero el resultado frente a otros modelos cambia según la tarea.
Dónde gana y dónde pierde en los benchmarks
Estos son los resultados publicados por xAI para cuatro modelos y siete pruebas. Las modalidades no son idénticas: Grok 4.7 aparece como xHigh, Grok 4.6 como High y los otros dos modelos como Max.
| Prueba | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
| CursorBench 4.0 | 46,3 % | 40,4 % | 41,7 % | 51,8 % |
| DeepSWE v1.1 | 71,0 %* | 65,2 % | 72,7 % | 70,0 % |
| EEBench | 64,0 % | 53,0 % | 39,4 % | 56,4 % |
| AA Briefcase v1.1 | 1.657 | 1.546 | 1.487 | 1.678 |
| Terminal-Bench 4.0 | 38,0 % | 20,3 % | 37,3 % | 57,9 % |
| Harvey Legal Agent Benchmark | 19,6 % | 15,8 % | 2,5 % | 6,7 % |
| HealthBench Professional | 56,7 % | 48,5 % | 60,5 % | 62,1 % |
* xAI marca el resultado de Grok 4.7 en DeepSWE v1.1 como una ejecución de alto esfuerzo.
El patrón es claro. Grok 4.7 queda por delante de los otros modelos de la tabla en Harvey Legal Agent Benchmark y EEBench. En cambio, Fable 5.1 Max supera a Grok 4.7 en CursorBench 4.0, AA Briefcase v1.1, Terminal-Bench 4.0 y HealthBench Professional. GPT-5.6 Sol Max obtiene una puntuación superior en DeepSWE v1.1.
La mayor diferencia frente a Grok 4.6 aparece en Terminal-Bench 4.0: Grok 4.7 alcanza el 38,0 %, frente al 20,3 % de su predecesor. En Harvey Legal Agent Benchmark pasa del 15,8 % al 19,6 %, mientras que en EEBench sube del 53,0 % al 64,0 %.
El precio por token no es el coste de una tarea
Los precios de API son fáciles de comparar, pero una tarea compleja puede consumir cantidades muy distintas de tokens. Una medición externa asociada al Artificial Analysis Intelligence Index registró aproximadamente 81.000 tokens de salida por tarea para Grok 4.7, frente a 36.000 para Grok 4.6 y 27.000 para GPT-6 Astra.
Eso separa dos conceptos que a menudo se mezclan: el precio de cada token y el coste total de completar un trabajo. Un modelo con una tarifa nominal inferior puede generar más tokens durante una tarea concreta. El gasto final también depende del modo de razonamiento, el contexto y las herramientas que intervienen en el flujo.
Por eso, los 2 dólares de entrada y 6 de salida describen la tarifa inicial de la API, no un coste universal por proyecto. Para una integración real, el dato decisivo será el consumo de la tarea que vaya a ejecutar el sistema.
Qué significa para elegir modelo
Grok 4.7 resulta especialmente atractivo si buscas una mejora clara sobre Grok 4.6 en las pruebas oficiales y una tarifa de API inicial contenida. También encaja con flujos que necesitan programación, trabajo de conocimiento o tareas largas dentro de Grok Bot.
La elección cambia si el trabajo depende de una prueba concreta. Fable 5.1 Max lidera CursorBench 4.0, AA Briefcase v1.1, Terminal-Bench 4.0 y HealthBench Professional en la tabla de xAI, mientras que GPT-5.6 Sol Max supera a Grok 4.7 en DeepSWE v1.1. Grok 4.7 no barre a la competencia: ofrece una mejora medible frente a Grok 4.6 y un precio de entrada bajo, pero su ventaja depende del tipo de tarea y del consumo de tokens.