Grok 4.6 haalt 61 punten in de aangeleverde lanceringsvergelijking van de Artificial Analysis Intelligence Index. Daarmee staat het model gelijk met GPT-5.6 Sol Max en slechts één punt achter Claude Fable 5 Max. Dat klinkt als een overwinning, maar de bredere cijfers vertellen een genuanceerder verhaal: Grok 4.6 is vooral interessant door zijn combinatie van frontier-prestaties, lagere standaard-API-tarieven en sterke resultaten bij kenniswerk — niet omdat het elke test wint.

De benchmarkscore van Grok 4.6

Grok 4.6 evenaart GPT-5.6 Sol, maar wint niet overal

De score van 61 hoort bij de vergelijking die SpaceXAI bij de lancering publiceerde. In die tabel haalt Grok 4.6 dezelfde score als GPT-5.6 Sol Max, terwijl Claude Fable 5 Max op 62 punten uitkomt.

Er bestaat daarnaast een afzonderlijke momentopname met een waarde van 44,405 voor Grok 4.6 in datasetversie v4.3. Die waarde is niet rechtstreeks vergelijkbaar met de lanceringsscore van 61. Wie benchmarkresultaten naast elkaar legt, moet dus altijd de versie en het meetmoment vermelden. Anders vergelijk je appels met… een heel andere fruitmand.

Sterk, maar niet overal de beste

De aangeleverde lanceringscijfers wijzen op een model met een ongelijk profiel. Op GDPVal-AA v2 — een evaluatie voor professioneel kenniswerk — staat Grok 4.6 bovenaan met 1.753 punten. Op CursorBench v3.2 komt het uit op 69,9 procent, dicht bij Claude Fable 5 Max met 70,5 procent en boven GPT-5.6 Sol Max met 67,2 procent.

Bij software-engineeringtests draait het beeld om. Grok 4.6 haalt 65,9 procent op DeepSWE v1.1, tegenover 73 procent voor GPT-5.6 Sol Max en 70 procent voor Claude Fable 5 Max. Op Terminal-Bench v3.0 komt Grok 4.6 uit op 26 procent; GPT-5.6 Sol Max en Claude Fable 5 Max scoren daar respectievelijk 34,6 en 34,1 procent.

BenchmarkGrok 4.6GPT-5.6 Sol MaxClaude Fable 5 Max
Artificial Analysis Intelligence Index616162
GDPVal-AA v21.7531.7281.741
CursorBench v3.269,9%67,2%70,5%
DeepSWE v1.165,9%73%70%
Terminal-Bench v3.026%34,6%34,1%

De praktische conclusie is helder: Grok 4.6 lijkt vooral geschikt voor analyse, documentwerk en andere langere kenniswerktaken. Voor autonome software-engineering en terminalwerk is het geen vanzelfsprekende koploper.

Wat kost Grok 4.6 in Nederland?

De standaard-API-prijs bedraagt $2 per miljoen invoertokens en $6 per miljoen uitvoertokens. Voor hergebruikte invoer wordt een tarief van $0,50 per miljoen tokens vermeld. Deze bedragen zijn in Amerikaanse dollars; een officiële Nederlandse europrijs is niet genoemd.

Voor een Nederlandse ontwikkelaar betekent dat een eenvoudige rekensom in dollars, zonder dat je daar stilzwijgend btw, wisselkoers of een lokale partneropslag bij moet verzinnen. De uiteindelijke rekening hangt uiteraard af van de hoeveelheid tekst die je verstuurt en terugkrijgt. Tokens zijn de kleine tekstbrokjes waarmee taalmodellen rekenen; lange documenten kunnen er dus flink wat verbruiken.

SpaceXAI positioneert Grok 4.6 voor gebruik via de SpaceXAI API, Cursor, Grok Build, OpenRouter, Vercel en Cloudflare. Account- en marktbeschikbaarheid kunnen per dienst verschillen.

Wat praktijktests laten zien

Een eenmalige vergelijking van Grok 4.6, Claude Opus 5, Kimi K3 en GPT-5.6 Sol toont zowel creatieve successen als een mislukte start in een ruimtesimulatie.

Een gesynchroniseerde vergelijking met creatieve programmeertaken geeft een nuttige realitycheck naast de leaderboardcijfers. Grok 4.6 genereerde in die reeks interactieve en visuele projecten, maar liep ook vast bij een ruimtesimulatie: de startprocedure werkte niet. Dat is waardevolle informatie, zolang je het precies leest. Eén geslaagde demo bewijst geen algemene betrouwbaarheid — en één mislukte start maakt het model evenmin onbruikbaar.

De vergelijking gebruikte eenmalige prompts voor onder meer gameomgevingen, interfaces en 3D-scènes. Dat maakt de resultaten concreet, maar zegt minder over een workflow waarin een ontwikkelaar meerdere keren bijstuurt, tests uitvoert en fouten laat herstellen.

Voor wie Grok 4.6 interessant is

Grok 4.6 is een logische kandidaat als je een model zoekt voor documentanalyse, professioneel kenniswerk, prototyping of geïntegreerde ontwikkelomgevingen. De combinatie van 61 punten in de lanceringsvergelijking en relatief lage standaardtarieven maakt het aantrekkelijk om mee te nemen in een eerste technische vergelijking.

Voor zwaar autonoom programmeerwerk is enige voorzichtigheid verstandig. De resultaten op DeepSWE v1.1 en Terminal-Bench v3.0 liggen onder die van de twee genoemde concurrenten. Ook de praktische test laat zien dat een overtuigende visuele demo niet automatisch betekent dat de onderliggende logica foutloos is.

Grok 4.6 is bovendien niet open source: de gewichten zijn niet openbaar en het aantal parameters is niet bekendgemaakt. Het gerapporteerde contextvenster bedraagt 500.000 tokens, met tekst en afbeeldingen als invoer en tekst als uitvoer.

De eindbalans? Grok 4.6 is een serieuze prijs- en workflowconcurrent, maar geen universele benchmarkkampioen. Kijk bij je keuze niet alleen naar de totaalscore. Bepaal eerst of je vooral documenten wilt analyseren, code wilt laten schrijven of een agent langdurig in een terminal wilt laten werken. Daar zit het echte verschil.