O DrivingBench registrou GPT-6 Astra como o único dos quatro modelos listados a concluir seu percurso de cones: o modelo terminou na segunda tentativa, depois de alcançar 49% na primeira. Claude Fable 5.1, Grok 4.6 e GPT-5.6 Sol não completaram o trajeto. O teste foi feito em baixa velocidade, com um Toyota Corolla real, num estacionamento — não em uma simulação de veículo virtual.
O que o DrivingBench mostrou
O artigo dos autores do benchmark descreve uma tarefa de controle de carro em um circuito físico de cones. Os modelos recebiam imagens das câmeras do veículo e ferramentas para comandar a direção e a velocidade.
Os resultados publicados pelo projeto mostram desempenhos diferentes entre as quatro versões avaliadas. GPT-6 Astra concluiu o percurso na segunda tentativa, em 5min22s. Claude Fable 5.1 avançou mais na terceira tentativa do que nas duas primeiras, mas parou em 45%. Grok 4.6 chegou a 11%, e GPT-5.6 Sol ficou em 6% nas três tentativas.
Como funcionavam o percurso e as tentativas
O DrivingBench permitia até três tentativas por modelo dentro de uma única conversa contínua. As execuções usaram harnesses — ambientes de programação que conectam o modelo às ferramentas da tarefa — associados a cada sistema: Codex para GPT-6 Astra e GPT-5.6 Sol, Claude Code para Claude Fable 5.1 e Cursor para Grok 4.6. O placar registra esforço médio para os quatro.
O carro podia continuar em movimento enquanto o modelo processava uma resposta. Assim, além de interpretar as imagens e escolher comandos, o sistema precisava lidar com o tempo gasto para gerar cada decisão.
A porcentagem de progresso representa a parte da linha central do percurso alcançada enquanto o carro permanecia a até 4 m dela. Após uma colisão, o placar conserva a distância atingida antes do impacto. Portanto, avançar uma porcentagem do trajeto e concluí-lo são resultados diferentes.
Os resultados das quatro versões
| Modelo | Harness e esforço | Tentativas registradas | Melhor progresso | Resultado |
| GPT-6 Astra | Codex, médio | 49%, não concluiu; 100% em 5min22s | 100% | Concluiu na segunda tentativa |
| Claude Fable 5.1 | Claude Code, médio | 9%, 10% e 45%; nenhuma concluiu | 45% | Não concluiu |
| Grok 4.6 | Cursor, médio | 8%, 11% e 10%; nenhuma concluiu | 11% | Não concluiu |
| GPT-5.6 Sol | Codex, médio | 6%, 6% e 6%; nenhuma concluiu | 6% | Não concluiu |
A tentativa concluída por GPT-6 Astra percorreu 134,7 m. Os percentuais e os tempos se referem às execuções listadas no placar do DrivingBench, não a uma medida geral da capacidade de condução de cada modelo.
O que esse percurso diz sobre direção
O DrivingBench mede o controle de um carro em um circuito fixo de baixa velocidade, usando imagens e comandos de direção e velocidade. É uma avaliação desse percurso e dessas tentativas; não mede a condução em vias públicas nem o desempenho de um sistema comercial de direção autônoma.
Os autores também liberaram o harness, os prompts, o mapa do percurso, os registros das execuções, o vídeo e a telemetria do teste.