xAI hat Grok 4.7 am 21. September 2026 veröffentlicht. Das neue Modell richtet sich auf Programmierung, Wissensarbeit, lang laufende Aufgaben und agentische Workflows. Die offiziellen Vergleichswerte liegen in mehreren Tests über denen von Grok 4.6 – bei Coding- und Langaufgaben bleibt jedoch Fable 5.1 Max in mehreren Disziplinen vorn. Die API-Preise starten bei 2 US-Dollar pro Million Eingabetoken und 6 US-Dollar pro Million Ausgabetoken.
Grok 4.7 ist für anspruchsvolle Aufgaben gedacht
xAI beschreibt Grok 4.7 als Modell für Aufgaben, die sich über viele Arbeitsschritte und mehrere Stunden ziehen können. Dafür setzt das Unternehmen nach eigenen Angaben auf ein neues, größeres Basismodell und einen längeren Lauf des Reinforcement Learning mit schwierigeren Aufgaben.
Reinforcement Learning bedeutet vereinfacht, dass ein Modell durch Rückmeldungen lernt, welche Lösungswege erfolgreicher sind. Bei Grok 4.7 habe xAI den Trainingsschwerpunkt stärker auf lang laufende Probleme gelegt. xAI sagt außerdem, das Modell könne seine Arbeit besser überprüfen und längere Kontexte verwalten.
Eine weitere Besonderheit ist die laut xAI native Verständlichkeit des Grok Bot-Harnesses. Ein Harness ist die technische Umgebung, in der ein Modell Werkzeuge, Rollen und einzelne Arbeitsschritte koordiniert. Grok 4.7 ist damit ausdrücklich auf agentische Abläufe zugeschnitten – etwa auf die Aufteilung eines Projekts in Planung, Entwicklung und Gestaltung.
Zugang und API-Preise
xAI listet Grok 4.7 für Cursor, Grok Build, die Grok API, externe Coding-Harnesses, Model-Router und Cloud-Plattformen. Für Entwickler ist damit vor allem der API-Zugang relevant; die Preise werden nach Ein- und Ausgabetoken getrennt berechnet.
| Variante | Eingabe | Ausgabe |
| Grok 4.7 Standard | 2 US-Dollar pro 1 Mio. Token | 6 US-Dollar pro 1 Mio. Token |
| Grok 4.7 Fast | 4 US-Dollar pro 1 Mio. Token | 12 US-Dollar pro 1 Mio. Token |
Die Fast-Variante kostet laut xAI das Doppelte und soll dafür die Ausgabe mit doppelter Geschwindigkeit erzeugen. Die genannten Beträge sind die von xAI ausgewiesenen API-Startpreise in US-Dollar.
Was sich gegenüber Grok 4.6 verbessert
Die offizielle Vergleichstabelle zeigt bei Grok 4.7 in allen dort aufgeführten direkten Vergleichszeilen höhere Werte als bei Grok 4.6. Besonders deutlich fällt der Abstand bei Terminal-Bench 4.0 aus: Grok 4.7 erreicht 38,0 Prozent, Grok 4.6 kommt auf 20,3 Prozent.
Auch bei CursorBench 4.0 steigt der Wert von 40,4 auf 46,3 Prozent. Beim Harvey Legal Agent Benchmark legt Grok 4.7 von 15,8 auf 19,6 Prozent zu. Diese Zahlen beziehen sich jeweils auf die in der Tabelle genannten Modellvarianten und Testbedingungen.
| Benchmark und Aufgabenbereich | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
| CursorBench 4.0 – Coding | 46,3 % | 40,4 % | 41,7 % | 51,8 % |
| DeepSWE v1.1 – Softwareentwicklung | 71,0 %* | 65,2 % | 72,7 % | 70,0 % |
| EEBench – Elektrotechnik | 64,0 % | 53,0 % | 39,4 % | 56,4 % |
| AA Briefcase v1.1 – mehrstündige Wissensarbeit | 1.657 | 1.546 | 1.487 | 1.678 |
| Terminal-Bench 4.0 – Terminal-Aufgaben | 38,0 % | 20,3 % | 37,3 % | 57,9 % |
| Harvey Legal Agent Benchmark – juristische Aufgaben | 19,6 % | 15,8 % | 2,5 % | 6,7 % |
| HealthBench Professional – klinische Aufgaben | 56,7 % | 48,5 % | 60,5 % | 62,1 % |
* xAI kennzeichnet den Wert von Grok 4.7 bei DeepSWE v1.1 als Ergebnis im Modus „High Effort“.
Grok 4.7 liegt in dieser Tabelle bei Harvey und EEBench vor den drei Vergleichsmodellen. Bei CursorBench, AA Briefcase, Terminal-Bench und HealthBench Professional führt dagegen Fable 5.1 Max. GPT-5.6 Sol Max liegt bei DeepSWE v1.1 mit 72,7 Prozent vor Grok 4.7.
Damit ist die praktische Einordnung klarer als ein pauschales „bestes Modell“: Grok 4.7 verbessert sich gegenüber seinem Vorgänger, aber die passende Wahl hängt vom Aufgabentyp ab. Wer vor allem Terminal- oder bestimmte Coding-Aufgaben automatisiert, findet in der Tabelle weiterhin einen deutlichen Vorsprung von Fable 5.1 Max.
Der Tokenpreis ist nicht der Preis einer fertigen Aufgabe
Die API-Abrechnung pro Million Token beschreibt den Preis einzelner Ein- und Ausgaben. Eine lange Agentenaufgabe kann aber sehr unterschiedlich viele Token erzeugen. Genau hier liegt der Unterschied zwischen dem Listenpreis und den tatsächlichen Kosten eines Workflows.
Für eine Aufgabe im Artificial Analysis Intelligence Index wurden bei Grok 4.7 ungefähr 81.000 Ausgabetoken berichtet. Für Grok 4.6 waren es etwa 36.000, für GPT-6 Astra etwa 27.000. Das sind aufgabenbezogene Verbrauchswerte und keine neuen API-Preise.
Ein niedrigerer Preis pro Million Token garantiert deshalb keine günstigere abgeschlossene Aufgabe. Entscheidend sind zusätzlich die Zahl der generierten Token, der gewählte Modus und die konkrete Arbeitsumgebung. Der Vergleich mit Grok 4.6 zeigt den Effekt besonders deutlich: Grok 4.7 kostet pro Ausgabetoken gleich viel, kann bei einer einzelnen Aufgabe aber wesentlich mehr davon erzeugen.
Für ein kurzes Skript oder eine einzelne Textanfrage fällt dieser Unterschied womöglich weniger ins Gewicht. Bei langen Programmier- und Rechercheläufen kann der Tokenverbrauch dagegen einen erheblichen Teil der Rechnung ausmachen.
Was die Sicherheitswerte aussagen
xAI nennt für Grok 4.7 einen Wert von 62,4 Prozent im LatchBio-Biosicherheitsbenchmark. Im HackerBench v0.3 passierten laut xAI 3,3 Prozent der riskanten Dual-Use-Eingaben. Beide Werte beziehen sich auf die jeweiligen Tests und sind keine allgemeine Sicherheits- oder Zuverlässigkeitsquote für jede Nutzung.
Das Fazit aus dem Start von Grok 4.7
Grok 4.7 ist eine messbare Weiterentwicklung gegenüber Grok 4.6: Die offiziellen Werte steigen bei Programmierung, Elektrotechnik, Wissensarbeit, Terminal-Aufgaben, juristischen Aufgaben und klinischen Tests. Gleichzeitig bleibt Fable 5.1 Max in mehreren der genannten Coding- und Langaufgaben vorn.
Für Entwickler ist Grok 4.7 deshalb vor allem dann interessant, wenn der Grok-Bot-Workflow, der API-Startpreis oder die bessere Leistung in bestimmten Benchmarks zum eigenen Einsatz passt. Der Preis von 2 US-Dollar pro Million Eingabetoken und 6 US-Dollar pro Million Ausgabetoken ist ein klarer Ausgangspunkt – die tatsächliche Rechnung entscheidet sich aber erst am Tokenverbrauch der jeweiligen Aufgabe.