xAI lanceerde Grok 4.7 op 21 september 2026. Het model richt zich op programmeren, kenniswerk en agentworkflows die lang kunnen doorlopen. In xAI’s officiële vergelijking verbeterde Grok 4.7 tegenover Grok 4.6 op meerdere tests, maar Fable 5.1 Max bleef voor op verschillende programmeer- en langetermijntaken.
De API-startprijs bedraagt 2 dollar per miljoen invoertokens en 6 dollar per miljoen uitvoertokens. xAI vermeldt toegang via Cursor, Grok Build, de Grok API, externe coding-harnassen, modelrouters en cloudplatforms.
Wat xAI op 21 september lanceerde
Grok 4.7 is volgens xAI gebouwd rond een nieuw, groter basismodel en een langere reinforcement-learningtraining. Daarbij lag de nadruk op moeilijkere opdrachten die meerdere uren kunnen duren. Reinforcement learning is een trainingsmethode waarbij een model wordt bijgestuurd op basis van de kwaliteit van zijn antwoorden en acties.
xAI zegt ook dat Grok 4.7 beter zijn eigen werk controleert en langere contexten beheert. Daarnaast is het model volgens xAI speciaal getraind om het Grok Bot-harnas van nature te begrijpen. Dat maakt het geschikt voor workflows waarin verschillende AI-rollen samenwerken aan één project.
De API-prijs blijft gelijk aan de genoemde startprijs van Grok 4.6: 2 dollar per miljoen invoertokens en 6 dollar per miljoen uitvoertokens. Een snelle variant verdubbelt de uitvoersnelheid tegen tweemaal die prijs.
Wat verandert er tegenover Grok 4.6?
De officiële vergelijking van xAI laat op alle hieronder genoemde tests een hogere score voor Grok 4.7 zien dan voor Grok 4.6. De modellen zijn daarbij in verschillende standen getest: Grok 4.7 xHigh tegenover Grok 4.6 High.
| Benchmark en taak | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
| CursorBench 4.0 — programmeren | 46,3% | 40,4% | 41,7% | 51,8% |
| DeepSWE v1.1 — software-engineering | 71,0% | 65,2% | 72,7% | 70,0% |
| EEBench — elektrotechniek | 64,0% | 53,0% | 39,4% | 56,4% |
| AA Briefcase v1.1 — langlopend kantoorwerk | 1.657 | 1.546 | 1.487 | 1.678 |
| Terminal-Bench 4.0 — terminaltaken | 38,0% | 20,3% | 37,3% | 57,9% |
| Harvey Legal Agent Benchmark — juridisch werk | 19,6% | 15,8% | 2,5% | 6,7% |
| HealthBench Professional — klinisch redeneren | 56,7% | 48,5% | 60,5% | 62,1% |
De cijfers laten dus geen algemene winnaar zien. Grok 4.7 staat in deze tabel boven de andere genoemde modellen op EEBench en de Harvey Legal Agent Benchmark. Fable 5.1 Max scoort hoger op CursorBench 4.0, AA Briefcase v1.1, Terminal-Bench 4.0 en HealthBench Professional. Op DeepSWE v1.1 staat GPT-5.6 Sol Max boven Grok 4.7.
Waar kan Grok 4.7 worden gebruikt?
xAI noemt Cursor, Grok Build, de Grok API, externe coding-harnassen, modelrouters en cloudplatforms als toegangsroutes. Daarmee richt Grok 4.7 zich niet alleen op chatgebruik, maar ook op ontwikkelaars die het model in een bestaande software- of agentworkflow willen inzetten.
Het Grok Bot-harnas is daarbij een belangrijk onderdeel van de positionering. In een getoonde workflow krijgen meerdere rollen — Project Manager, Developer en Designer — elk een eigen taak binnen hetzelfde project. Die demonstratie laat zien hoe zo’n opzet werkt; ze is geen garantie dat iedere workflow foutloos verloopt.
Een lage tokenprijs maakt een taak niet automatisch goedkoop
De API rekent afzonderlijk af voor invoer- en uitvoertokens. Invoertokens zijn de tekst, code of instructies die je naar het model stuurt. Uitvoertokens zijn de tekst en tussenresultaten die Grok 4.7 terugstuurt.
Dat onderscheid wordt belangrijker bij lange redeneer- en agenttaken. Een gerapporteerde meting van een Artificial Analysis Intelligence Index-taak kwam uit op ongeveer 81.000 uitvoertokens voor Grok 4.7, tegenover ongeveer 36.000 voor Grok 4.6 en 27.000 voor GPT-6 Astra. De rekening per taak hangt daardoor niet alleen af van het tarief per miljoen tokens, maar ook van het aantal gegenereerde tokens en de gekozen workflow.
Grok 4.7 kan dus een laag tarief per token hebben en toch voor een specifieke opdracht meer kosten wanneer het aanzienlijk meer uitvoer genereert. Een universele ranglijst voor de goedkoopste voltooide taak volgt daar niet uit.
De praktische betekenis van de benchmarks
Voor programmeerwerk en technisch kenniswerk is de sprong tegenover Grok 4.6 in de officiële tabel duidelijk zichtbaar. Terminal-Bench stijgt van 20,3% naar 38,0% en EEBench van 53,0% naar 64,0%. Ook de score voor juridisch werk loopt op van 15,8% naar 19,6%.
De keuze hangt daarmee af van het soort werk dat je uitvoert. Wie vooral terminaltaken, lange kantooropdrachten of klinische redeneertests draait, ziet in dezelfde vergelijking andere verhoudingen dan iemand die naar juridisch werk of elektrotechnische opdrachten kijkt. De combinatie van score, uitvoersnelheid en werkelijk tokenverbruik bepaalt welke optie voor een concrete workflow het meest aantrekkelijk is.
Grok 4.7 is daarmee een substantiële stap vooruit ten opzichte van Grok 4.6, maar de officiële cijfers ondersteunen geen claim dat het model elke concurrent verslaat.