O DrivingBench registrou GPT-6 Astra como o único dos quatro modelos listados a concluir seu percurso de cones: o modelo terminou na segunda tentativa, depois de alcançar 49% na primeira. Claude Fable 5.1, Grok 4.6 e GPT-5.6 Sol não completaram o trajeto. O teste foi feito em baixa velocidade, com um Toyota Corolla real, num estacionamento — não em uma simulação de veículo virtual.

O que o DrivingBench mostrou

O artigo dos autores do benchmark descreve uma tarefa de controle de carro em um circuito físico de cones. Os modelos recebiam imagens das câmeras do veículo e ferramentas para comandar a direção e a velocidade.

Os resultados publicados pelo projeto mostram desempenhos diferentes entre as quatro versões avaliadas. GPT-6 Astra concluiu o percurso na segunda tentativa, em 5min22s. Claude Fable 5.1 avançou mais na terceira tentativa do que nas duas primeiras, mas parou em 45%. Grok 4.6 chegou a 11%, e GPT-5.6 Sol ficou em 6% nas três tentativas.

Como funcionavam o percurso e as tentativas

O DrivingBench permitia até três tentativas por modelo dentro de uma única conversa contínua. As execuções usaram harnesses — ambientes de programação que conectam o modelo às ferramentas da tarefa — associados a cada sistema: Codex para GPT-6 Astra e GPT-5.6 Sol, Claude Code para Claude Fable 5.1 e Cursor para Grok 4.6. O placar registra esforço médio para os quatro.

O carro podia continuar em movimento enquanto o modelo processava uma resposta. Assim, além de interpretar as imagens e escolher comandos, o sistema precisava lidar com o tempo gasto para gerar cada decisão.

A porcentagem de progresso representa a parte da linha central do percurso alcançada enquanto o carro permanecia a até 4 m dela. Após uma colisão, o placar conserva a distância atingida antes do impacto. Portanto, avançar uma porcentagem do trajeto e concluí-lo são resultados diferentes.

Os resultados das quatro versões

ModeloHarness e esforçoTentativas registradasMelhor progressoResultado
GPT-6 AstraCodex, médio49%, não concluiu; 100% em 5min22s100%Concluiu na segunda tentativa
Claude Fable 5.1Claude Code, médio9%, 10% e 45%; nenhuma concluiu45%Não concluiu
Grok 4.6Cursor, médio8%, 11% e 10%; nenhuma concluiu11%Não concluiu
GPT-5.6 SolCodex, médio6%, 6% e 6%; nenhuma concluiu6%Não concluiu

A tentativa concluída por GPT-6 Astra percorreu 134,7 m. Os percentuais e os tempos se referem às execuções listadas no placar do DrivingBench, não a uma medida geral da capacidade de condução de cada modelo.

O que esse percurso diz sobre direção

O DrivingBench mede o controle de um carro em um circuito fixo de baixa velocidade, usando imagens e comandos de direção e velocidade. É uma avaliação desse percurso e dessas tentativas; não mede a condução em vias públicas nem o desempenho de um sistema comercial de direção autônoma.

Os autores também liberaram o harness, os prompts, o mapa do percurso, os registros das execuções, o vídeo e a telemetria do teste.