NVIDIA meldete am 2. Oktober 2026, dass GPT-6 Astra Ultrafast über die OpenAI-API und für berechtigte Nutzer von ChatGPT Work und Codex verfügbar ist. NVIDIA beansprucht für die Token-Erzeugung bis zu achtmal mehr Geschwindigkeit als bei Astra Standard. Die Angaben zu Zugang und API-Einstellungen helfen dabei, den neuen Modus von der Geschwindigkeitsbehauptung zu trennen.
NeoTeo hat GPT-6 Astra bereits in einem früheren Praxistest betrachtet; hier geht es um den später gemeldeten Zugang zu Ultrafast.
Zugang und Geschwindigkeitsangabe
NVIDIA sagt, GPT-6 Astra Ultrafast laufe auf NVIDIA-Blackwell-GPUs. Das Unternehmen führt die Beschleunigung auf optimierte Inferenz zurück. Auch die Angabe von bis zu achtmal schnellerer Token-Erzeugung stammt von NVIDIA und bezieht sich auf Astra Standard.
Für ChatGPT Work und Codex führt OpenAI die entsprechende Pro-Variante sowie berechtigte Enterprise- und Edu-Arbeitsbereiche als Zugangswege auf. In diesen Arbeitsbereichen hängt die Nutzung von den erforderlichen Berechtigungen und dem verfügbaren Workspace-Guthaben ab. Plus, Business und niedrigere Pro-Stufen umfassen Ultrafast zum Start nicht. Plus bietet dort regulären Astra-Zugang, der vom Ultrafast-Modus getrennt ist.
Ultrafast über die API aufrufen
In der API setzt du model="gpt-6-astra" und service_tier="ultrafast". OpenAI unterstützt dafür HTTP-Anfragen und WebSockets. Für agentische Anwendungen mit häufigen Werkzeugaufrufen empfiehlt das Unternehmen dauerhafte WebSocket-Verbindungen, weil Netzwerkaufwand den Latenzvorteil schmälern kann.
Die Standardlimits sind nach API-Nutzungsstufe gestaffelt. TPM steht für Tokens pro Minute; diese Werte sind Nutzungsgrenzen, keine Messwerte für die Antwortgeschwindigkeit.
| API-Nutzungsstufe | Standardlimit in Tokens pro Minute |
| Stufen 1–3 | 500.000 |
| Stufe 4 | 1.000.000 |
| Stufe 5 | 5.000.000 |
Globale Verarbeitung und regionale Datenresidenz
OpenAI nennt für API-Anfragen US-Datenresidenz und globale Verarbeitung. Regionale Verarbeitungsendpunkte für die EU und andere Regionen außerhalb der USA werden nicht unterstützt. Für Deutschland ist globale Verarbeitung damit die dokumentierte API-Option; die regionale Einschränkung betrifft den Verarbeitungsort, nicht eine Sperre für deutsche Nutzer.
Was die Blender-Demonstration zeigt
Eine gesponserte Demonstration zeigt GPT-6 Astra Ultrafast bei der Arbeit an einem Drachenmodell in Blender. Der Ersteller gibt für die erste Version etwas mehr als zehn Minuten und für die anschließende Verfeinerung weitere 35 Minuten an. Diese Zeitangaben beziehen sich auf den gezeigten Arbeitsablauf; die Blender-Sequenz enthält keine Vergleichsmessung mit Astra Standard.