El 3 de octubre se difundieron detalles de DrivingBench, una prueba en la que GPT-6 Astra fue el único de cuatro modelos que completó un circuito de conos con un Toyota Corolla. El ensayo se hizo a baja velocidad; Astra terminó el recorrido en su segundo intento.

Los otros modelos probados fueron Claude Fable 5.1, GPT-5.6 Sol y Grok 4.6. Cada uno tuvo hasta tres intentos dentro de una misma conversación.

Cómo controlaron el coche los modelos

Los modelos de visión y lenguaje recibían imágenes de la cámara y utilizaban tres herramientas para enviar órdenes de dirección y velocidad. El coche podía seguir moviéndose mientras el modelo procesaba la información, y una orden nueva sustituía a la que seguía ejecutándose.

Así, el tiempo de procesamiento —la latencia— también formaba parte del reto: el modelo tenía que responder mientras el coche continuaba avanzando.

Resultados de los cuatro modelos

ModeloResultado informadoIntento o condición
GPT-6 AstraCompletó el recorrido: 134,7 metros en 5 minutos y 22 segundosSegundo intento
Claude Fable 5.1Aproximadamente la mitad del recorridoTercer intento
GPT-5.6 Sol17,1 metros, alrededor del 6 % del circuitoTercer intento
Grok 4.622,6 metros, alrededor del 11 % del circuitoMejor intento

El resumen del benchmark indica que ningún intento distinto de Astra superó el 50 % del recorrido. La cifra de Claude se describió como aproximada.

El alcance de la prueba

DrivingBench evaluó el control de un coche a baja velocidad en un recorrido preparado de aparcamiento, no la circulación en vías públicas. Durante la prueba, una persona estaba preparada para accionar el freno. El resultado se limita a ese circuito y a las condiciones del ensayo; no mide el comportamiento de los modelos en el tráfico cotidiano.