DrivingBench ha registrato GPT-6 Astra come unico modello, fra i quattro in classifica, ad aver completato il percorso: ci è riuscito al secondo tentativo, dopo essersi fermato al 49% nel primo. Claude Fable 5.1, Grok 4.6 e GPT-5.6 Sol non hanno raggiunto il traguardo. La prova si è svolta con una Toyota Corolla reale su un circuito a bassa velocità tracciato con coni in un parcheggio.

Che cosa ha rilevato DrivingBench

La classifica di DrivingBench riporta i risultati di quattro varianti: GPT-6 Astra, Claude Fable 5.1, Grok 4.6 e GPT-5.6 Sol. Solo GPT-6 Astra ha concluso il circuito, al secondo tentativo: ha percorso 134,7 m in 5 minuti e 22 secondi. Gli altri tre modelli hanno raggiunto percentuali diverse del tracciato, ma non lo hanno completato.

Come si è svolto il test

Gli autori descrivono DrivingBench come una prova su un’auto reale, non una simulazione virtuale: i modelli ricevevano immagini dalle telecamere della Toyota Corolla e strumenti per impartire comandi di sterzo e velocità su un percorso fisso in un parcheggio. La descrizione del benchmark precisa anche che l’auto poteva continuare a muoversi mentre il modello elaborava una risposta, rendendo rilevante la latenza, cioè il tempo necessario per rispondere.

Ogni modello poteva affrontare fino a tre tentativi nella stessa conversazione; quelli successivi includevano prompt per riflettere e proseguire. Gli ambienti di esecuzione e il livello di effort erano: Codex, medio, per GPT-6 Astra e GPT-5.6 Sol; Claude Code, medio, per Claude Fable 5.1; Cursor, medio, per Grok 4.6.

La percentuale indica quanta parte della linea centrale del percorso è stata raggiunta, mantenendosi entro 4 m da essa. È quindi una misura di avanzamento verso la zona d’arrivo, non un punteggio generale delle capacità di guida.

I risultati dei quattro modelli

ModelloHarness e effortRisultati dei tentativiMiglior avanzamentoEsito
GPT-6 AstraCodex, medio49% (non concluso); 100% in 5:22100%Percorso completato al secondo tentativo
Claude Fable 5.1Claude Code, medio9%, 10%, 45% (nessun tentativo concluso)45%Non ha completato il percorso
Grok 4.6Cursor, medio8%, 11%, 10% (nessun tentativo concluso)11%Non ha completato il percorso
GPT-5.6 SolCodex, medio6%, 6%, 6% (nessun tentativo concluso)6%Non ha completato il percorso

Il dato più netto è il completamento di GPT-6 Astra al secondo tentativo, dopo un primo passaggio arrivato al 49%. Claude Fable 5.1 ha raggiunto il 45% al terzo tentativo; Grok 4.6 è arrivato all’11% al secondo. GPT-5.6 Sol è rimasto al 6% in tutti e tre i tentativi.

Che cosa dice il percorso sulla guida

DrivingBench misura il controllo di un’auto su un circuito fisso a bassa velocità: immagini in ingresso, comandi di sterzo e velocità, e avanzamento lungo una linea centrale entro una tolleranza di 4 m. I risultati riguardano quelle varianti, i rispettivi ambienti di esecuzione e i tentativi elencati. Il percorso era in un parcheggio e non su strade pubbliche.