GPT-6 Astra ukończył trasę DrivingBench za drugim podejściem; Claude Fable 5.1, Grok 4.6 i GPT-5.6 Sol nie dotarły do mety w swoich próbach. Benchmark polegał na sterowaniu prawdziwą Toyotą Corollą na wolnym torze z pachołkami, wytyczonym na parkingu.
Jak przebiegał test
Modele otrzymywały obraz z kamer samochodu i wydawały polecenia dotyczące skrętu oraz prędkości. Auto mogło poruszać się, gdy model analizował sytuację, więc opóźnienie potrzebne na przetworzenie danych również miało znaczenie.
Każdy model mógł podejść do zadania maksymalnie trzy razy w ramach jednej ciągłej rozmowy. Kolejne próby następowały po poleceniach skłaniających model do refleksji i kontynuowania zadania. Wyniki zestawiono dla konkretnych modeli i środowisk: Codex, Claude Code oraz Cursor, każde z ustawieniem średniego poziomu wysiłku.
DrivingBench liczył postęp jako część długości osi trasy pokonaną w odległości nie większej niż 4 m od tej osi. Jeśli doszło do zderzenia, wynik uwzględniał odległość osiągniętą przed nim. Procenty opisują zatem postęp na tym torze, nie ogólną ocenę zdolności prowadzenia.
Wyniki czterech modeli
| Model | Środowisko i poziom wysiłku | Wyniki prób | Najlepszy postęp | Rezultat |
| GPT-6 Astra | Codex, średni | 49% (nie ukończył); 100% (ukończył w 5 min 22 s) | 100% | Ukończył za drugim podejściem |
| Claude Fable 5.1 | Claude Code, średni | 9%, 10%, 45% (żadna próba nieukończona) | 45% | Nie ukończył |
| Grok 4.6 | Cursor, średni | 8%, 11%, 10% (żadna próba nieukończona) | 11% | Nie ukończył |
| GPT-5.6 Sol | Codex, średni | 6%, 6%, 6% (żadna próba nieukończona) | 6% | Nie ukończył |
Udana próba GPT-6 Astra obejmowała 134,7 m trasy. Claude Fable 5.1 poprawił swój wynik do 45% w trzeciej próbie, a Grok 4.6 osiągnął 11% w drugiej. GPT-5.6 Sol zakończył każdą z trzech prób na poziomie 6%.
Co mówi wynik o jeździe
DrivingBench oceniało konkretne modele na stałym, wolnym torze parkingowym, z obrazem z kamer i poleceniami sterującymi. Wyniki odpowiadają więc na pytanie, jak te konfiguracje poradziły sobie z tym zadaniem; test nie obejmował autonomicznej jazdy po drogach publicznych ani porównania z produkcyjnymi systemami autonomicznej jazdy.
Autorzy benchmarku udostępnili między innymi środowisko testowe, polecenia, mapę toru, przebiegi, nagranie i telemetrię.