DrivingBench a évalué quatre modèles d’IA sur un parcours de cônes à basse vitesse, au volant d’une Toyota Corolla réelle. GPT-6 Astra est le seul à avoir terminé le circuit, à sa deuxième tentative, en 5 min 22 s. Claude Fable 5.1, Grok 4.6 et GPT-5.6 Sol n’ont pas achevé leurs essais.
Les résultats de DrivingBench
Le classement de DrivingBench indique que GPT-6 Astra a parcouru 49 % du circuit lors de son premier essai, sans atteindre l’arrivée, puis l’a terminé à la deuxième tentative. Claude Fable 5.1 a atteint au mieux 45 %, Grok 4.6, 11 %, et GPT-5.6 Sol, 6 % ; aucun des trois n’a terminé ses essais répertoriés.
| Modèle | Environnement et effort | Progression par tentative | Meilleure progression | Résultat |
| GPT-6 Astra | Codex, effort moyen | 49 % ; 100 % en 5 min 22 s | 100 % | Parcours terminé au deuxième essai |
| Claude Fable 5.1 | Claude Code, effort moyen | 9 % ; 10 % ; 45 % | 45 % | Aucun essai terminé |
| Grok 4.6 | Cursor, effort moyen | 8 % ; 11 % ; 10 % | 11 % | Aucun essai terminé |
| GPT-5.6 Sol | Codex, effort moyen | 6 % ; 6 % ; 6 % | 6 % | Aucun essai terminé |
Pour GPT-6 Astra, l’arrivée correspond à 134,7 m parcourus. Le classement accorde la progression selon la distance atteinte le long de l’axe du circuit, rapportée à la longueur de cet axe jusqu’à l’arrivée. Le véhicule doit rester à moins de 4 m de cet axe pour que la distance compte.
Comment fonctionnait le test
Les modèles recevaient des images prises par les caméras de la voiture et pouvaient commander la direction et la vitesse. La présentation de DrivingBench décrit un parcours réel dans un parking, balisé par des cônes : il ne s’agissait pas d’une voiture virtuelle dans un simulateur.
Chaque modèle disposait de trois tentatives au maximum au cours d’une même conversation. Les résultats par essai montrent pourquoi le meilleur pourcentage ne suffit pas à départager les performances : atteindre 45 % ou 11 % ne signifie pas avoir achevé le parcours. GPT-6 Astra a lui aussi échoué à terminer son premier essai avant de réussir le suivant.
Ce que mesure le parcours
La voiture pouvait continuer à avancer pendant que le modèle traitait les images et préparait ses commandes. La latence — le délai de réponse — faisait donc partie du défi, en plus de l’interprétation visuelle et du contrôle de la direction et de la vitesse.
Les pourcentages décrivent les essais des quatre variantes nommées, avec leurs environnements de programmation et sur ce circuit fixe à basse vitesse. DrivingBench mesure une progression jusqu’à une arrivée sur un parcours de parking ; la conduite sur route ouverte est une tâche différente, que ce classement ne mesure pas.