Dans la comparaison de lancement fournie, Grok 4.6 obtient 61 points à l’Artificial Analysis Intelligence Index, à égalité avec GPT-5.6 Sol Max et derrière Claude Fable 5 Max, qui atteint 62 points. Le modèle de SpaceXAI se distingue surtout par des tarifs API standards plus bas et par une orientation vers les tâches longues avec agents — pas par une victoire générale sur tous les tests.

Le score de Grok 4.6

Grok 4.6 égale GPT-5.6 Sol Max, mais pas partout

Le chiffre de 61 est celui de la table comparative publiée lors du lancement de Grok 4.6, annoncé le 12 août 2026. Il faut le lire comme un résultat lié à cette évaluation précise : une autre valeur publiée dans un instantané différent d’Artificial Analysis ne doit pas être fusionnée avec cette table.

La comparaison donne une image assez équilibrée :

ÉvaluationGrok 4.6GPT-5.6 Sol MaxClaude Fable 5 Max
Artificial Analysis Intelligence Index616162
GDPVal-AA v21 7531 7281 741
CursorBench v3.269,9 %67,2 %70,5 %
DeepSWE v1.165,9 %73 %70 %
Terminal-Bench v3.026 %34,6 %34,1 %
AA-Briefcase1 5771 5021 574

Grok 4.6 arrive donc en tête sur GDPVal-AA v2 et AA-Briefcase dans cette sélection, tandis que Claude Fable 5 Max conserve l’avantage sur l’index général et CursorBench v3.2. Les versions des benchmarks comptent énormément : un résultat sur Terminal-Bench v3.0 ne se compare pas directement à un résultat obtenu sur Terminal-Bench v2.1.

Une performance solide, mais irrégulière

Grok 4.6 est compétitif en programmation, sans dominer les tâches de génie logiciel autonome. Son score de 69,9 % sur CursorBench v3.2 le place près de ses concurrents dans la table de lancement. En revanche, ses 65,9 % sur DeepSWE v1.1 restent inférieurs aux 73 % de GPT-5.6 Sol Max, et ses 26 % sur Terminal-Bench v3.0 sont également derrière les deux autres modèles comparés.

La nuance est importante. Écrire une modification dans un éditeur, analyser des documents ou produire une réponse structurée ne demande pas exactement les mêmes capacités qu’orchestrer un long travail dans un terminal, corriger plusieurs erreurs et maintenir une architecture cohérente. Le résultat dépend donc du type de travail, pas seulement du nom du modèle.

Les éléments disponibles orientent plutôt Grok 4.6 vers l’analyse professionnelle, les tâches documentaires et les workflows à plusieurs étapes. C’est une bonne nouvelle pour les utilisateurs qui cherchent un agent capable de manipuler un contexte important. Ce n’est pas une preuve que le modèle remportera chaque projet logiciel complexe.

L’intérêt des tâches longues

SpaceXAI présente Grok 4.6 comme une évolution de Grok 4.5 axée sur les agents capables de travailler longtemps, ainsi que sur les usages interactifs et visuels. La table de lancement donne aussi à Grok 4.6 un score AA-Briefcase de 1 577, légèrement supérieur à celui de Claude Fable 5 Max et nettement supérieur à celui de GPT-5.6 Sol Max dans cette comparaison.

Pour vous, cela signifie que le modèle peut être particulièrement intéressant lorsque le travail consiste à enchaîner plusieurs étapes : examiner un dossier, organiser des informations, rédiger une synthèse ou construire progressivement un prototype. Mais un score d’agent ne garantit pas à lui seul un coût inférieur pour votre projet réel. Le nombre de tokens, les outils utilisés, la longueur des échanges et les corrections nécessaires changent rapidement la facture.

Tarifs API et contexte long

Le tarif API standard communiqué pour Grok 4.6 est de 2 $ par million de tokens en entrée et 6 $ par million de tokens en sortie. L’entrée mise en cache est indiquée à 0,50 $ par million de tokens dans les données de modèle disponibles.

Pour la France, les éléments fournis indiquent des tarifs libellés en dollars, mais pas de grille officielle en euros. Il faut donc éviter de transformer ces montants en prix français : le taux de change, la TVA et les règles de facturation du fournisseur peuvent modifier le montant réellement payé.

Des tarifs plus élevés pour les très longues requêtes et certaines variantes rapides ou prioritaires sont rapportés séparément, mais ils ne constituent pas ici une grille officielle suffisamment stable pour être présentée comme une règle générale. Avant d’intégrer Grok 4.6 dans une application, vérifiez surtout la tarification correspondant à votre surface d’accès et à la taille habituelle de vos requêtes.

Artificial Analysis indique par ailleurs une fenêtre de contexte de 500 000 tokens, avec des entrées texte et image et une sortie texte. Grok 4.6 reste un modèle propriétaire : ses poids ne sont pas publics et son nombre de paramètres n’est pas communiqué.

Ce que montrent les essais pratiques

Comparaison vidéo de tâches de création avec Grok 4.6, Claude Opus 5, Kimi K3 et GPT-5.6 Sol

Les classements ne racontent pas toute l’histoire. Une comparaison vidéo utilisant les mêmes consignes pour plusieurs tâches de création de jeux et de scènes 3D montre à la fois des productions visuelles réussies et des ratés fonctionnels. Dans un test de simulation spatiale, Grok 4.6 ne parvient notamment pas à effectuer le décollage.

Ce résultat est utile comme signal concret, mais il ne faut pas le transformer en verdict général sur la fiabilité du modèle. La comparaison repose sur des essais en une seule passe, alors qu’un usage professionnel permet souvent de reformuler, d’inspecter le code et de demander des corrections. Elle montre donc une limite possible dans une tâche complexe, pas une mesure universelle de Grok 4.6.

À qui s’adresse Grok 4.6 ?

Grok 4.6 mérite l’attention si vous évaluez un modèle pour l’analyse documentaire, les tâches professionnelles en plusieurs étapes, le prototypage interactif ou le développement assisté dans un environnement compatible. Son rapport entre score de lancement et tarif API standard est séduisant, surtout pour les équipes qui surveillent attentivement le prix des tokens.

Il est moins prudent de le choisir en supposant qu’il remplacera automatiquement le meilleur modèle pour tout travail logiciel. Les résultats de DeepSWE v1.1 et Terminal-Bench v3.0 montrent précisément pourquoi il faut tester ses propres dépôts, outils et consignes avant de migrer une charge de production.

Grok 4.6 est annoncé comme disponible via l’API SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel et Cloudflare. L’accès peut toutefois dépendre du compte et de la plateforme utilisée. Quant à Grok 4.7, Elon Musk a évoqué une arrivée possible trois à quatre semaines après son message, mais cette indication reste une prévision non confirmée, pas une date de sortie.

En résumé : Grok 4.6 est un concurrent sérieux pour les workflows documentaires et agentiques sensibles au coût. Son score de 61 est solide dans la comparaison de lancement, mais ses performances plus faibles sur certains tests de programmation invitent à le considérer comme un outil à évaluer au cas par cas — pas comme le nouveau roi universel de l’IA.