DrivingBench listet elf Versuche von vier KI-Konfigurationen auf einem kurzen, mit Hütchen markierten Parkplatzkurs. GPT-6 Astra war die einzige gelistete Konfiguration, die das Ziel erreichte: beim zweiten Versuch mit 100 Prozent Fortschritt in 5:22. Acht der elf Versuche kamen auf höchstens 11 Prozent.
Vier Konfigurationen, elf Versuche
| Modellkonfiguration | Fortschritt je Versuch | Bester Fortschritt | Kurs abgeschlossen |
| GPT-6 Astra | 49 %, 100 % | 100 % | Ja, beim zweiten Versuch in 5:22 |
| Claude Fable 5.1 | 9 %, 10 %, 45 % | 45 % | Nein |
| Grok 4.6 | 8 %, 11 %, 10 % | 11 % | Nein |
| GPT-5.6 Sol | 6 %, 6 %, 6 % | 6 % | Nein |
GPT-6 Astra lief über Codex, Claude Fable 5.1 über Claude Code, Grok 4.6 über Cursor und GPT-5.6 Sol ebenfalls über Codex. DrivingBench kennzeichnet alle vier Einträge mit der Stufe „mittel“. Grok 4.6 erreichte bei seinem ersten Versuch nach zwei angenommenen Steuerbefehlen 8 Prozent Fortschritt.
So misst DrivingBench den Fortschritt
DrivingBench berechnet den Fortschritt als Anteil der Kursmittellinie bis zur Zielzone, den ein Versuch zurücklegt, solange die Fahrt höchstens vier Meter von der Mittellinie entfernt bleibt. Der vor einer Kollision erreichte Fortschritt zählt weiter.
Die Werte beschreiben die Leistung auf diesem kurzen Parkplatzkurs. Sie messen nicht, wie die Konfigurationen im öffentlichen Straßenverkehr fahren.