GPT-6 Astra voltooide als enige van de vier vermelde modellen het DrivingBench-parcours. Het model haalde de finish bij zijn tweede poging, na bij de eerste poging 49% van het parcours te hebben afgelegd. Claude Fable 5.1, Grok 4.6 en GPT-5.6 Sol finishten niet.
Wat DrivingBench liet zien
DrivingBench testte de modellen in een echte Toyota Corolla op een langzaam kegelparcours op een parkeerterrein. Het ging dus om een fysieke auto op een vaste route, niet om een virtuele rijsimulatie. De auteurs beschreven de opzet in hun artikel over DrivingBench en publiceerden de resultaten op het officiële klassement.
De modellen kregen camerabeelden vanuit de auto en konden opdrachten geven voor de besturing en snelheid. De auto kon blijven rijden terwijl een model nadacht; ook de vertraging voordat een opdracht binnenkwam, telde daardoor mee in de uitdaging.
Zo werkten het parcours en de pogingen
Het voortgangspercentage staat voor het aandeel van de afstand langs de middellijn van het parcours richting de finishzone. Een rit telde mee zolang de auto binnen 4 meter van die middellijn bleef. Na een botsing bleef de geregistreerde voortgang staan op de afstand die vóór de botsing was bereikt.
Elk model kreeg maximaal drie pogingen binnen één doorlopend gesprek. De modellen gebruikten verschillende programmeeromgevingen: Codex voor GPT-6 Astra en GPT-5.6 Sol, Claude Code voor Claude Fable 5.1 en Cursor voor Grok 4.6. Bij alle runs stond het inspanningsniveau op medium. De latere pogingen volgden op reflectie- en vervolgopdrachten.
De auteurs maakten onder meer de testomgeving, prompts, parcourskaart, sporen, video en telemetrie openbaar.
De resultaten van de vier modellen
| Model | Omgeving en inspanning | Resultaten per poging | Beste voortgang | Uitkomst |
| GPT-6 Astra | Codex, medium | 49% (geen finish); 100% (finish in 5:22) | 100% | Voltooide het parcours bij poging twee |
| Claude Fable 5.1 | Claude Code, medium | 9%, 10%, 45% (geen finish) | 45% | Haalde de finish niet |
| Grok 4.6 | Cursor, medium | 8%, 11%, 10% (geen finish) | 11% | Haalde de finish niet |
| GPT-5.6 Sol | Codex, medium | 6%, 6%, 6% (geen finish) | 6% | Haalde de finish niet |
De geslaagde rit van GPT-6 Astra besloeg 134,7 meter en duurde 5 minuten en 22 seconden. Claude Fable 5.1 kwam met 45% het verst van de drie modellen die niet finishten; Grok 4.6 bleef op zijn beste poging steken op 11% en GPT-5.6 Sol op 6%.
Wat de test over autorijden zegt
De uitslag geldt voor de vier genoemde modelvarianten, hun gebruikte programmeeromgevingen, de geregistreerde pogingen en dit vaste, langzame parkeerterreinparcours. De test zegt niet of GPT-6 Astra of een van de andere modellen veilig en zonder toezicht op openbare wegen kan rijden.