DrivingBench zufolge beendete GPT-6 Astra als einziges der vier getesteten KI-Modelle einen Fahrkurs mit einem echten Toyota Corolla. Beim zweiten Versuch erreichte das Modell 100 Prozent Fortschritt und die Ziellinie nach 5:22 Minuten. Claude Fable 5.1, Grok 4.6 und GPT-5.6 Sol kamen in ihren besten Läufen nicht ins Ziel.
GPT-6 Astra beendete den DrivingBench-Kurs
DrivingBench testete GPT-6 Astra, Claude Fable 5.1, Grok 4.6 und GPT-5.6 Sol in einem Toyota Corolla. Die Modelle erhielten Kamerabilder und steuerten das Fahrzeug über softwarevermittelte Befehle für Lenkung, Beschleunigung und Bremsen. Die Bestenliste führt GPT-6 Astra als einzigen Finisher: Der erste Versuch kam auf 49 Prozent, der zweite auf 100 Prozent. Ein dritter Lauf fand nicht statt.
So lief der Test im Toyota Corolla ab
DrivingBench setzte den Wagen auf einem leeren Gelände ein und begrenzte seine Höchstgeschwindigkeit per Software auf 8 mph, also rund 13 km/h. Ein Mensch saß auf dem Fahrersitz, lenkte aber nicht.
Die Steuerung übernahm laut Projekt ein comma 4, das Lenkung, Beschleunigung und Bremsen über den CAN-Bus ansteuerte. Die Modelle gaben ihre Befehle über MCP-Werkzeuge in Codex, Cursor oder Claude Code aus. So verband der Versuch KI-Ausgaben mit den Steuereingaben eines echten Autos – allerdings unter stark begrenzten Bedingungen.
Was die Fortschrittswerte bedeuten
Die Prozentwerte geben den Fortschritt entlang der Kursmittellinie an. DrivingBench zählt ihn, solange das Fahrzeug höchstens vier Meter von dieser Linie entfernt bleibt. Ein Wert von 100 Prozent entspricht dem Abschluss des Kurses.
Die Modelle erhielten jeweils bis zu drei Versuche innerhalb desselben fortlaufenden Chats. Auf spätere Anläufe folgten Reflexions- und Fortsetzungsaufforderungen. Die Versuche waren damit keine unabhängigen Durchläufe in jeweils frischen Chats.
Die besten Fortschrittswerte der vier Modelle
DrivingBench führt folgende Bestwerte beim Fortschritt auf der Kursmittellinie auf:
| Modell | Bester Fortschritt auf der Kursmittellinie |
| GPT-6 Astra | 100 % |
| Claude Fable 5.1 | 45 % |
| Grok 4.6 | 11 % |
| GPT-5.6 Sol | 6 % |
Was der Benchmark aussagt
Der Versuch zeigt, wie die vier Modelle unter den beschriebenen Bedingungen auf einem einzelnen Kurs abschnitten. Er belegt nicht, dass ein Modell für den öffentlichen Straßenverkehr geeignet ist: Gefahren wurde auf einem leeren Gelände, bei rund 13 km/h Höchstgeschwindigkeit und mit einem Menschen im Wagen.