El 3 de octubre se difundieron detalles de DrivingBench, una prueba en la que GPT-6 Astra fue el único de cuatro modelos que completó un circuito de conos con un Toyota Corolla. El ensayo se hizo a baja velocidad; Astra terminó el recorrido en su segundo intento.
Los otros modelos probados fueron Claude Fable 5.1, GPT-5.6 Sol y Grok 4.6. Cada uno tuvo hasta tres intentos dentro de una misma conversación.
Cómo controlaron el coche los modelos
Los modelos de visión y lenguaje recibían imágenes de la cámara y utilizaban tres herramientas para enviar órdenes de dirección y velocidad. El coche podía seguir moviéndose mientras el modelo procesaba la información, y una orden nueva sustituía a la que seguía ejecutándose.
Así, el tiempo de procesamiento —la latencia— también formaba parte del reto: el modelo tenía que responder mientras el coche continuaba avanzando.
Resultados de los cuatro modelos
| Modelo | Resultado informado | Intento o condición |
| GPT-6 Astra | Completó el recorrido: 134,7 metros en 5 minutos y 22 segundos | Segundo intento |
| Claude Fable 5.1 | Aproximadamente la mitad del recorrido | Tercer intento |
| GPT-5.6 Sol | 17,1 metros, alrededor del 6 % del circuito | Tercer intento |
| Grok 4.6 | 22,6 metros, alrededor del 11 % del circuito | Mejor intento |
El resumen del benchmark indica que ningún intento distinto de Astra superó el 50 % del recorrido. La cifra de Claude se describió como aproximada.
El alcance de la prueba
DrivingBench evaluó el control de un coche a baja velocidad en un recorrido preparado de aparcamiento, no la circulación en vías públicas. Durante la prueba, una persona estaba preparada para accionar el freno. El resultado se limita a ese circuito y a las condiciones del ensayo; no mide el comportamiento de los modelos en el tráfico cotidiano.