xAI a lancé Grok 4.7 le 21 septembre 2026. Le modèle vise le codage, le travail intellectuel et les tâches longues menées par des agents, avec un tarif API de départ de 2 $ par million de tokens en entrée et 6 $ par million en sortie. Face à Grok 4.6, les scores progressent sur plusieurs évaluations officielles, mais Grok 4.7 ne domine pas tous les modèles concurrents : Fable 5.1 Max reste devant sur plusieurs tests de programmation et de travail long.

Grok 4.7 est accessible sur plusieurs plateformes

xAI propose Grok 4.7 via Cursor, Grok Build, l’API Grok, des environnements de développement tiers, des routeurs de modèles et des plateformes cloud. Le lancement concerne donc autant les développeurs qui passent par une API que les équipes qui utilisent déjà un environnement de programmation assisté par l’IA.

Le tarif API standard est de 2 $ par million de tokens en entrée et de 6 $ par million de tokens en sortie. Une variante rapide double le prix pour doubler la vitesse de génération en sortie. Ces montants sont des tarifs de départ en dollars : ils ne constituent pas une grille de prix grand public en euros.

xAI présente aussi Grok 4.7 comme un modèle conçu pour les travaux qui peuvent durer plusieurs heures. L’entreprise indique qu’il repose sur un modèle de base plus grand et sur une phase d’apprentissage par renforcement plus longue, orientée vers des problèmes complexes et prolongés.

Ce que Grok 4.7 change face à Grok 4.6

Grok 4.7 améliore le score de Grok 4.6 sur les sept évaluations comparées dans le tableau officiel de xAI : CursorBench 4.0, DeepSWE v1.1, EEBench, AA Briefcase v1.1, Terminal-Bench 4.0, Harvey Legal Agent Benchmark et HealthBench Professional.

xAI affirme également que Grok 4.7 comprend nativement Grok Bot, son environnement d’agents. Dans ce type de workflow, plusieurs rôles peuvent être affectés à différentes étapes d’un projet, comme la gestion, le développement ou la conception. Cette intégration vise surtout les tâches où le modèle doit conserver le fil d’un travail long et enchaîner plusieurs opérations.

Où Grok 4.7 progresse, et où il reste derrière

Les résultats officiels montrent une amélioration claire face à Grok 4.6, mais ils dessinent un paysage très irrégulier selon la tâche. Voici les scores publiés par xAI pour les quatre modèles comparés dans les mêmes évaluations.

ÉvaluationGrok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
CursorBench 4.046,3 %40,4 %41,7 %51,8 %
DeepSWE v1.171,0 %65,2 %72,7 %70,0 %
EEBench64,0 %53,0 %39,4 %56,4 %
AA Briefcase v1.11 6571 5461 4871 678
Terminal-Bench 4.038,0 %20,3 %37,3 %57,9 %
Harvey Legal Agent Benchmark19,6 %15,8 %2,5 %6,7 %
HealthBench Professional56,7 %48,5 %60,5 %62,1 %

Grok 4.7 arrive en tête de cette sélection sur EEBench et sur le Harvey Legal Agent Benchmark. Il dépasse aussi nettement Grok 4.6 sur Terminal-Bench 4.0, avec 38,0 % contre 20,3 %. En revanche, Fable 5.1 Max obtient de meilleurs résultats que Grok 4.7 sur CursorBench 4.0, AA Briefcase v1.1, Terminal-Bench 4.0 et HealthBench Professional. GPT-5.6 Sol Max reste devant sur DeepSWE v1.1 et HealthBench Professional.

La réponse à la question « Grok 4.7 a-t-il dépassé tous ses rivaux ? » est donc non. Son intérêt dépend du travail demandé : les résultats sont plus favorables pour certaines tâches juridiques, professionnelles et d’ingénierie que pour les évaluations de programmation ou de raisonnement clinique où un autre modèle prend l’avantage.

Le prix par token ne donne pas le coût réel d’une tâche

Le tarif affiché par xAI ne suffit pas à calculer le coût d’un projet complet. Une tâche longue peut générer beaucoup plus de tokens de sortie qu’une tâche courte, même lorsque le prix d’un million de tokens reste identique.

Des données liées à l’Artificial Analysis indiquent une consommation d’environ 81 000 tokens de sortie par tâche pour Grok 4.7 sur l’Intelligence Index, contre environ 36 000 pour Grok 4.6 et 27 000 pour GPT-6 Astra. Il s’agit d’une mesure de consommation dans cette évaluation, pas d’un classement universel du coût par tâche réussie.

Pour une équipe qui choisit un modèle, il faut donc regarder au moins trois éléments : le tarif des tokens, le nombre de tokens utilisés et le taux de réussite sur le type de travail visé. Un modèle moins cher par million de tokens peut consommer davantage sur une tâche donnée. La facture finale dépend aussi du mode de raisonnement et des outils mobilisés.

Un modèle plus intéressant pour certains workflows

Grok 4.7 est surtout pertinent pour les développeurs et les équipes qui cherchent à automatiser des tâches longues dans un environnement compatible avec Grok Bot, Cursor ou l’API Grok. Ses progrès face à Grok 4.6 sont visibles dans les résultats publiés par xAI, tandis que son prix API de départ reste inchangé par rapport à son prédécesseur.

Le choix devient moins évident dès qu’une tâche dépend fortement de Terminal-Bench, de HealthBench Professional ou d’un autre domaine où Fable 5.1 Max obtient un meilleur score dans la comparaison de xAI. Le lancement de Grok 4.7 apporte donc une amélioration concrète, mais pas un nouveau modèle dominant dans chaque catégorie.