GPT-6 Astra jako jedyny z czterech modeli ukończył trasę DrivingBench, sterując Toyotą Corollą przy niskiej prędkości na przygotowanym torze z pachołkami. Udało mu się to w drugiej próbie. Pozostałe modele nie przekroczyły połowy trasy.
Jak modele sterowały Toyotą Corollą
DrivingBench sprawdził cztery ogólnego przeznaczenia modele wizyjno-językowe: GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol i Grok 4.6. Modele otrzymywały obrazy z kamer, a za pomocą trzech narzędzi wydawały bezpośrednie polecenia dotyczące skrętu i prędkości samochodu.
Samochód mógł poruszać się także wtedy, gdy model przetwarzał dane. Czas potrzebny na analizę obrazu i przygotowanie kolejnego polecenia miał więc znaczenie dla przebiegu jazdy. Nowe polecenie zastępowało to, które samochód właśnie wykonywał.
Każdy model mógł podejść do zadania maksymalnie trzy razy w ramach jednej rozmowy. W dwóch z czterech przypadków zachowanie kontekstu wiązało się ze znaczną poprawą wyników między próbami.
Wyniki modeli na trasie
| Model | Wynik | Próba lub warunek |
| GPT-6 Astra | Ukończył trasę | Druga próba |
| Claude Fable 5.1 | Żadna próba nie przekroczyła 50% trasy | Do trzech prób w jednej rozmowie |
| GPT-5.6 Sol | Żadna próba nie przekroczyła 50% trasy | Do trzech prób w jednej rozmowie |
| Grok 4.6 | Żadna próba nie przekroczyła 50% trasy | Do trzech prób w jednej rozmowie |
Tylko GPT-6 Astra dotarł do końca. Pozostałe modele nie przekroczyły połowy przygotowanej trasy w żadnej próbie.
Co pokazuje test DrivingBench
Próba dotyczyła jazdy przy niskiej prędkości po przygotowanym torze, a nie prowadzenia samochodu w zwykłym ruchu drogowym. Wynik GPT-6 Astra opisuje zatem wykonanie konkretnego zadania na trasie z pachołkami; sam w sobie nie dowodzi gotowości modeli ogólnego przeznaczenia do jazdy po drogach publicznych.
Twórcy DrivingBench udostępnili narzędzia testowe, prompty, mapę trasy, ślady przebiegu prób, wideo i telemetrię.