NVIDIA maakte op 2 oktober 2026 bekend dat GPT-6 Astra Ultrafast beschikbaar is via de OpenAI API en voor daarvoor in aanmerking komende ChatGPT Work- en Codex-gebruikers. NVIDIA claimt dat de modus tokens tot 8× sneller genereert dan Astra Standard.
Wie meer wil weten over het model zelf, leest ook NeoTeo’s eerdere artikel over GPT-6 Astra. Deze update gaat over de toegang tot de Ultrafast-modus.
Toegang en snelheidsclaim
GPT-6 Astra Ultrafast is een servicemodus voor GPT-6 Astra. Via de API is de modus beschikbaar; OpenAI noemt daarnaast toegang voor het hoogste Pro-niveau en voor daarvoor in aanmerking komende Enterprise- en Edu-werkruimten. Gebruik binnen die werkruimten vereist de juiste machtigingen en gaat ten koste van werkruimtecredits.
Plus geeft in Work en Codex toegang tot gewone Astra, maar niet tot Ultrafast. Ook Business valt bij de introductie buiten Ultrafast.
NVIDIA’s claim betreft tokengeneratie ten opzichte van Astra Standard. Het bedrijf zegt dat Ultrafast draait op NVIDIA Blackwell-GPU’s en schrijft de versnelling toe aan optimalisatie van de inferentie: het proces waarmee een model uitvoer genereert.
Ultrafast instellen via de API
Voor API-verzoeken gebruik je de model-ID gpt-6-astra en stel je service_tier in op ultrafast. OpenAI ondersteunt zowel HTTP als WebSocket-verzoeken. TPM staat voor tokens per minuut; de standaardlimiet hangt af van het API-gebruiksniveau.
| API-gebruiksniveau | Standaardlimiet |
| 1–3 | 500.000 tokens per minuut |
| 4 | 1.000.000 tokens per minuut |
| 5 | 5.000.000 tokens per minuut |
Voor agenten die vaak achter elkaar tools aanroepen, raadt OpenAI langdurig open WebSocket-verbindingen aan. Netwerkvertraging kan anders een deel van het latencyvoordeel tenietdoen.
Wereldwijde verwerking en toegang vanuit Nederland
OpenAI noemt voor de API gegevensresidency in de VS en wereldwijde verwerking. De API heeft geen regionale verwerkingsendpoints voor de EU of andere regio’s buiten de VS. Nederlandse gebruikers zijn niet uitgesloten van API-toegang; wereldwijde verwerking is een van de genoemde opties.
Een Blender-demonstratie in de praktijk
Een gesponsorde demonstratie laat GPT-6 Astra Ultrafast via Blender MCP aan een drakenmodel werken. De maker meldt iets meer dan 10 minuten voor de eerste versie en nog eens 35 minuten voor de verfijning. Die tijden beschrijven één Blender-workflow, geen gecontroleerde vergelijking met Astra Standard.