GPT-6 Astra beendete den DrivingBench-Parcours mit einem echten Toyota Corolla im zweiten Versuch. Claude Fable 5.1, Grok 4.6 und GPT-5.6 Sol kamen bei ihren gelisteten Läufen nicht ins Ziel. Getestet wurde auf einem langsamen Parkplatzkurs mit Hütchen, nicht in einer virtuellen Fahrsimulation. Die Ergebnisse stehen auf der offiziellen DrivingBench-Rangliste; die Beschreibung des Tests stammt von den Benchmark-Autoren.

Was DrivingBench ergab

Von den vier gelisteten Modellen beendete allein GPT-6 Astra den Kurs. Sein erster Versuch erreichte 49 Prozent Fortschritt, der zweite 100 Prozent. Für den erfolgreichen Lauf verzeichnete die Rangliste eine Zeit von 5 Minuten und 22 Sekunden.

Claude Fable 5.1 kam in drei Versuchen auf 9, 10 und 45 Prozent. Grok 4.6 erreichte 8, 11 und 10 Prozent; GPT-5.6 Sol blieb in allen drei Läufen bei 6 Prozent. Keines dieser drei Modelle beendete einen gelisteten Lauf.

So funktionierte der Test

DrivingBench setzte die Modelle in einen echten Toyota Corolla auf einem festen, langsamen Parkplatz-Parcours mit Hütchen. Die Systeme erhielten Kamerabilder aus dem Auto und konnten über Werkzeuge Lenkung und Geschwindigkeit steuern. Da sich das Auto während der Verarbeitung einer Antwort weiterbewegen konnte, floss auch die Verzögerung des Modells in die Aufgabe ein.

Jedes Modell erhielt bis zu drei Versuche innerhalb eines fortlaufenden Gesprächs. Für spätere Läufe sah das Verfahren Reflexions- und Fortsetzungsaufforderungen vor. Die Rangliste führt GPT-6 Astra mit Codex, Claude Fable 5.1 mit Claude Code und Grok 4.6 mit Cursor auf; GPT-5.6 Sol lief ebenfalls über Codex. Für alle vier ist der mittlere Aufwandsgrad angegeben.

Die Ergebnisse der vier Modelle

Die Prozentwerte geben an, wie weit ein Lauf auf der Mittellinie des Kurses vorankam. Gezählt wurde der Fortschritt, solange das Auto höchstens 4 m von dieser Linie entfernt blieb. Nach einem Zusammenstoß blieb der angezeigte Fortschritt bei der bis dahin erreichten Entfernung stehen.

ModellSteuerungsumgebung und AufwandFortschritt in den VersuchenBestwertErgebnis
GPT-6 AstraCodex, mittel49 %; 100 % in 5:22100 %Im zweiten Versuch beendet
Claude Fable 5.1Claude Code, mittel9 %; 10 %; 45 %45 %Kein Lauf beendet
Grok 4.6Cursor, mittel8 %; 11 %; 10 %11 %Kein Lauf beendet
GPT-5.6 SolCodex, mittel6 %; 6 %; 6 %6 %Kein Lauf beendet

GPT-6 Astra legte auf seinem erfolgreichen Lauf 134,7 m zurück. Die Prozentwerte beschreiben damit den Fortschritt auf genau diesem Parcours und innerhalb der aufgeführten Versuche.

Was der Parcours über autonomes Fahren aussagt

DrivingBench erfasste, wie die vier genannten Modellvarianten unter den jeweiligen Testbedingungen einen festen, langsamen Hütchenparcours steuerten. Öffentlicher Straßenverkehr, andere Fahrzeuge und wechselnde Verkehrssituationen gehörten nicht zu dieser Aufgabe. Die Rangliste liefert daher Ergebnisse zu den aufgeführten Läufen auf dem Parkplatzkurs; sie bewertet kein autonomes Fahrsystem für den Straßenverkehr.