GPT-6 Astra ukończył trasę DrivingBench za drugim podejściem; Claude Fable 5.1, Grok 4.6 i GPT-5.6 Sol nie dotarły do mety w swoich próbach. Benchmark polegał na sterowaniu prawdziwą Toyotą Corollą na wolnym torze z pachołkami, wytyczonym na parkingu.

Jak przebiegał test

Modele otrzymywały obraz z kamer samochodu i wydawały polecenia dotyczące skrętu oraz prędkości. Auto mogło poruszać się, gdy model analizował sytuację, więc opóźnienie potrzebne na przetworzenie danych również miało znaczenie.

Każdy model mógł podejść do zadania maksymalnie trzy razy w ramach jednej ciągłej rozmowy. Kolejne próby następowały po poleceniach skłaniających model do refleksji i kontynuowania zadania. Wyniki zestawiono dla konkretnych modeli i środowisk: Codex, Claude Code oraz Cursor, każde z ustawieniem średniego poziomu wysiłku.

DrivingBench liczył postęp jako część długości osi trasy pokonaną w odległości nie większej niż 4 m od tej osi. Jeśli doszło do zderzenia, wynik uwzględniał odległość osiągniętą przed nim. Procenty opisują zatem postęp na tym torze, nie ogólną ocenę zdolności prowadzenia.

Wyniki czterech modeli

ModelŚrodowisko i poziom wysiłkuWyniki próbNajlepszy postępRezultat
GPT-6 AstraCodex, średni49% (nie ukończył); 100% (ukończył w 5 min 22 s)100%Ukończył za drugim podejściem
Claude Fable 5.1Claude Code, średni9%, 10%, 45% (żadna próba nieukończona)45%Nie ukończył
Grok 4.6Cursor, średni8%, 11%, 10% (żadna próba nieukończona)11%Nie ukończył
GPT-5.6 SolCodex, średni6%, 6%, 6% (żadna próba nieukończona)6%Nie ukończył

Udana próba GPT-6 Astra obejmowała 134,7 m trasy. Claude Fable 5.1 poprawił swój wynik do 45% w trzeciej próbie, a Grok 4.6 osiągnął 11% w drugiej. GPT-5.6 Sol zakończył każdą z trzech prób na poziomie 6%.

Co mówi wynik o jeździe

DrivingBench oceniało konkretne modele na stałym, wolnym torze parkingowym, z obrazem z kamer i poleceniami sterującymi. Wyniki odpowiadają więc na pytanie, jak te konfiguracje poradziły sobie z tym zadaniem; test nie obejmował autonomicznej jazdy po drogach publicznych ani porównania z produkcyjnymi systemami autonomicznej jazdy.

Autorzy benchmarku udostępnili między innymi środowisko testowe, polecenia, mapę toru, przebiegi, nagranie i telemetrię.