En la clasificación de DrivingBench, GPT-6 Astra fue el único de los cuatro modelos que completó el circuito, y lo hizo en su segundo intento, tras avanzar un 49 % en el primero. Claude Fable 5.1, Grok 4.6 y GPT-5.6 Sol no terminaron sus recorridos. La prueba se hizo con un Toyota Corolla real en un circuito de conos de aparcamiento y a baja velocidad.

Qué encontró DrivingBench

El circuito físico evaluó si los modelos podían controlar un coche real a partir de imágenes de cámara. GPT-6 Astra alcanzó la meta en 5:22; Claude Fable 5.1 llegó como máximo al 45 %, Grok 4.6 al 11 % y GPT-5.6 Sol al 6 %.

Cómo se hizo la prueba

Los modelos recibían imágenes de las cámaras del Toyota Corolla y enviaban comandos para controlar la dirección y la velocidad. El coche podía seguir moviéndose mientras el modelo procesaba la información, así que la latencia también formaba parte del reto.

DrivingBench permitió hasta tres intentos por modelo dentro de una misma conversación. Las pruebas se ejecutaron en distintos entornos de programación: Codex para GPT-6 Astra y GPT-5.6 Sol, Claude Code para Claude Fable 5.1 y Cursor para Grok 4.6. Los cuatro se probaron con un nivel de esfuerzo medio.

El porcentaje de avance representa la parte de la línea central del circuito recorrida hacia la meta, siempre que el coche se mantuviera a no más de 4 m de esa línea. Si había una colisión, el avance registrado conservaba la distancia alcanzada antes del impacto.

Resultados de los cuatro modelos

ModeloEntorno y nivel de esfuerzoAvance por intentoMejor avanceResultado
GPT-6 AstraCodex, medio49 %; 100 % en el segundo intento100 %Completó el circuito en 5:22
Claude Fable 5.1Claude Code, medio9 %; 10 %; 45 %45 %No completó el circuito
Grok 4.6Cursor, medio8 %; 11 %; 10 %11 %No completó el circuito
GPT-5.6 SolCodex, medio6 %; 6 %; 6 %6 %No completó el circuito

La diferencia decisiva está entre avanzar por el trazado y llegar a la meta: solo GPT-6 Astra terminó. Los porcentajes describen estos intentos en este circuito, no una medida general de la capacidad de conducción de cada modelo.

Los autores de DrivingBench publicaron el entorno de prueba, las instrucciones, el mapa del circuito, los registros, el vídeo y la telemetría para facilitar la reproducibilidad.

Qué significa para la conducción

DrivingBench evaluó un recorrido fijo de conos en un aparcamiento, con un coche real y a baja velocidad. No fue una prueba de conducción autónoma en vías públicas: completar el circuito mide el desempeño en esa tarea concreta, no la capacidad de circular sin supervisión por carretera.