GPT-6 Astra jako jedyny z czterech modeli ukończył trasę DrivingBench, sterując Toyotą Corollą przy niskiej prędkości na przygotowanym torze z pachołkami. Udało mu się to w drugiej próbie. Pozostałe modele nie przekroczyły połowy trasy.

Jak modele sterowały Toyotą Corollą

DrivingBench sprawdził cztery ogólnego przeznaczenia modele wizyjno-językowe: GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol i Grok 4.6. Modele otrzymywały obrazy z kamer, a za pomocą trzech narzędzi wydawały bezpośrednie polecenia dotyczące skrętu i prędkości samochodu.

Samochód mógł poruszać się także wtedy, gdy model przetwarzał dane. Czas potrzebny na analizę obrazu i przygotowanie kolejnego polecenia miał więc znaczenie dla przebiegu jazdy. Nowe polecenie zastępowało to, które samochód właśnie wykonywał.

Każdy model mógł podejść do zadania maksymalnie trzy razy w ramach jednej rozmowy. W dwóch z czterech przypadków zachowanie kontekstu wiązało się ze znaczną poprawą wyników między próbami.

Wyniki modeli na trasie

ModelWynikPróba lub warunek
GPT-6 AstraUkończył trasęDruga próba
Claude Fable 5.1Żadna próba nie przekroczyła 50% trasyDo trzech prób w jednej rozmowie
GPT-5.6 SolŻadna próba nie przekroczyła 50% trasyDo trzech prób w jednej rozmowie
Grok 4.6Żadna próba nie przekroczyła 50% trasyDo trzech prób w jednej rozmowie

Tylko GPT-6 Astra dotarł do końca. Pozostałe modele nie przekroczyły połowy przygotowanej trasy w żadnej próbie.

Co pokazuje test DrivingBench

Próba dotyczyła jazdy przy niskiej prędkości po przygotowanym torze, a nie prowadzenia samochodu w zwykłym ruchu drogowym. Wynik GPT-6 Astra opisuje zatem wykonanie konkretnego zadania na trasie z pachołkami; sam w sobie nie dowodzi gotowości modeli ogólnego przeznaczenia do jazdy po drogach publicznych.

Twórcy DrivingBench udostępnili narzędzia testowe, prompty, mapę trasy, ślady przebiegu prób, wideo i telemetrię.