No benchmark DrivingBench, quatro modelos de visão e linguagem controlaram um Toyota Corolla em baixa velocidade, num percurso de cones preparado em um estacionamento. Só o GPT-6 Astra concluiu o trajeto, na segunda tentativa. Também foram testados Claude Fable 5.1, GPT-5.6 Sol e Grok 4.6.

Como os modelos controlaram o Corolla

Os modelos recebiam imagens da câmera e usavam três ferramentas para enviar comandos diretos de direção e velocidade. Como o carro podia continuar em movimento enquanto o modelo processava as informações, o tempo de processamento também fazia parte do desafio. Novos comandos substituíam o comando que estivesse em execução.

Cada modelo teve até três tentativas dentro de uma mesma conversa. Em dois dos quatro casos, o desempenho melhorou de forma significativa com o contexto das tentativas anteriores mantido.

Resultados relatados para cada modelo

  • GPT-6 Astra: concluiu o percurso na segunda tentativa. A distância informada para essa conclusão foi de 134,7 metros, em 5 minutos e 22 segundos.
  • Claude Fable 5.1: chegou a aproximadamente metade do percurso na terceira tentativa.
  • GPT-5.6 Sol: percorreu 17,1 metros na terceira tentativa.
  • Grok 4.6: alcançou 22,6 metros em sua melhor tentativa.

Nenhuma outra tentativa passou de 50% do percurso.

O que o teste permite avaliar

A DrivingBench avaliou a condução em um circuito preparado de cones, em baixa velocidade — não em vias públicas ou no trânsito comum. Uma pessoa ficou pronta para acionar o freio durante o ensaio.