Il 2 ottobre 2026 NVIDIA ha annunciato GPT-6 Astra Ultrafast, una modalità accessibile tramite API e per utenti idonei di ChatGPT Work e Codex. NVIDIA dichiara fino a 8× più velocità nella generazione dei token rispetto ad Astra Standard e afferma che la modalità gira su GPU NVIDIA Blackwell.
GPT-6 Astra Ultrafast: accesso e dichiarazione sulla velocità
La modalità riguarda la velocità di generazione dei token, cioè le unità di testo elaborate dal modello. Il dato «fino a 8×» è un massimo dichiarato da NVIDIA, riferito al confronto con Astra Standard.
NVIDIA attribuisce l’accelerazione all’ottimizzazione dell’inferenza con i modelli interni di OpenAI e alla programmabilità delle GPU NVIDIA. Per l’accesso tramite API, OpenAI indica limiti predefiniti diversi in base al livello dell’account.
Configurare Ultrafast nell’API
Per usare la modalità, OpenAI indica il modello gpt-6-astra e il livello di servizio ultrafast. Le richieste possono usare HTTP o WebSocket. Per gli agenti che effettuano frequenti chiamate agli strumenti, OpenAI raccomanda connessioni WebSocket persistenti: ridurre l’overhead di rete può aiutare a sfruttare il vantaggio di latenza.
I limiti predefiniti sono espressi in token al minuto (TPM):
| Livello di utilizzo API | Limite predefinito |
| Livelli 1–3 | 500.000 token al minuto |
| Livello 4 | 1.000.000 token al minuto |
| Livello 5 | 5.000.000 token al minuto |
OpenAI indica inoltre l’accesso tramite ChatGPT Work e Codex per gli spazi Enterprise ed Edu idonei, soggetto ai permessi necessari e ai crediti dello spazio di lavoro. Il piano Plus include l’accesso ad Astra ordinario in Work e Codex, ma non a Ultrafast.
Per il contesto sul modello, puoi leggere anche la precedente analisi di NeoTeo su GPT-6 Astra.
Elaborazione globale e residenza dei dati
Per l’API, OpenAI indica la residenza dei dati negli Stati Uniti e l’elaborazione globale, senza endpoint regionali UE o di altre aree fuori dagli Stati Uniti. La limitazione riguarda la scelta della regione di elaborazione: non esclude l’accesso all’API dall’Italia.
Un flusso di modellazione in Blender
Una dimostrazione sponsorizzata mostra GPT-6 Astra Ultrafast mentre interagisce con Blender tramite MCP per creare un modello 3D di un drago. Nel resoconto della dimostrazione, la prima versione richiede poco più di 10 minuti e la rifinitura altri 35 minuti: due durate riferite a quel flusso di lavoro.