DrivingBench listet elf Versuche von vier KI-Konfigurationen auf einem kurzen, mit Hütchen markierten Parkplatzkurs. GPT-6 Astra war die einzige gelistete Konfiguration, die das Ziel erreichte: beim zweiten Versuch mit 100 Prozent Fortschritt in 5:22. Acht der elf Versuche kamen auf höchstens 11 Prozent.

Vier Konfigurationen, elf Versuche

GPT-6 Astra beendet als einzige gelistete Konfiguration den DrivingBench-Kurs
ModellkonfigurationFortschritt je VersuchBester FortschrittKurs abgeschlossen
GPT-6 Astra49 %, 100 %100 %Ja, beim zweiten Versuch in 5:22
Claude Fable 5.19 %, 10 %, 45 %45 %Nein
Grok 4.68 %, 11 %, 10 %11 %Nein
GPT-5.6 Sol6 %, 6 %, 6 %6 %Nein

GPT-6 Astra lief über Codex, Claude Fable 5.1 über Claude Code, Grok 4.6 über Cursor und GPT-5.6 Sol ebenfalls über Codex. DrivingBench kennzeichnet alle vier Einträge mit der Stufe „mittel“. Grok 4.6 erreichte bei seinem ersten Versuch nach zwei angenommenen Steuerbefehlen 8 Prozent Fortschritt.

So misst DrivingBench den Fortschritt

DrivingBench berechnet den Fortschritt als Anteil der Kursmittellinie bis zur Zielzone, den ein Versuch zurücklegt, solange die Fahrt höchstens vier Meter von der Mittellinie entfernt bleibt. Der vor einer Kollision erreichte Fortschritt zählt weiter.

Die Werte beschreiben die Leistung auf diesem kurzen Parkplatzkurs. Sie messen nicht, wie die Konfigurationen im öffentlichen Straßenverkehr fahren.