DrivingBench ha registrato GPT-6 Astra come unico modello, fra i quattro in classifica, ad aver completato il percorso: ci è riuscito al secondo tentativo, dopo essersi fermato al 49% nel primo. Claude Fable 5.1, Grok 4.6 e GPT-5.6 Sol non hanno raggiunto il traguardo. La prova si è svolta con una Toyota Corolla reale su un circuito a bassa velocità tracciato con coni in un parcheggio.
Che cosa ha rilevato DrivingBench
La classifica di DrivingBench riporta i risultati di quattro varianti: GPT-6 Astra, Claude Fable 5.1, Grok 4.6 e GPT-5.6 Sol. Solo GPT-6 Astra ha concluso il circuito, al secondo tentativo: ha percorso 134,7 m in 5 minuti e 22 secondi. Gli altri tre modelli hanno raggiunto percentuali diverse del tracciato, ma non lo hanno completato.
Come si è svolto il test
Gli autori descrivono DrivingBench come una prova su un’auto reale, non una simulazione virtuale: i modelli ricevevano immagini dalle telecamere della Toyota Corolla e strumenti per impartire comandi di sterzo e velocità su un percorso fisso in un parcheggio. La descrizione del benchmark precisa anche che l’auto poteva continuare a muoversi mentre il modello elaborava una risposta, rendendo rilevante la latenza, cioè il tempo necessario per rispondere.
Ogni modello poteva affrontare fino a tre tentativi nella stessa conversazione; quelli successivi includevano prompt per riflettere e proseguire. Gli ambienti di esecuzione e il livello di effort erano: Codex, medio, per GPT-6 Astra e GPT-5.6 Sol; Claude Code, medio, per Claude Fable 5.1; Cursor, medio, per Grok 4.6.
La percentuale indica quanta parte della linea centrale del percorso è stata raggiunta, mantenendosi entro 4 m da essa. È quindi una misura di avanzamento verso la zona d’arrivo, non un punteggio generale delle capacità di guida.
I risultati dei quattro modelli
| Modello | Harness e effort | Risultati dei tentativi | Miglior avanzamento | Esito |
| GPT-6 Astra | Codex, medio | 49% (non concluso); 100% in 5:22 | 100% | Percorso completato al secondo tentativo |
| Claude Fable 5.1 | Claude Code, medio | 9%, 10%, 45% (nessun tentativo concluso) | 45% | Non ha completato il percorso |
| Grok 4.6 | Cursor, medio | 8%, 11%, 10% (nessun tentativo concluso) | 11% | Non ha completato il percorso |
| GPT-5.6 Sol | Codex, medio | 6%, 6%, 6% (nessun tentativo concluso) | 6% | Non ha completato il percorso |
Il dato più netto è il completamento di GPT-6 Astra al secondo tentativo, dopo un primo passaggio arrivato al 49%. Claude Fable 5.1 ha raggiunto il 45% al terzo tentativo; Grok 4.6 è arrivato all’11% al secondo. GPT-5.6 Sol è rimasto al 6% in tutti e tre i tentativi.
Che cosa dice il percorso sulla guida
DrivingBench misura il controllo di un’auto su un circuito fisso a bassa velocità: immagini in ingresso, comandi di sterzo e velocità, e avanzamento lungo una linea centrale entro una tolleranza di 4 m. I risultati riguardano quelle varianti, i rispettivi ambienti di esecuzione e i tentativi elencati. Il percorso era in un parcheggio e non su strade pubbliche.