Le 2 octobre 2026, NVIDIA annonce que GPT-6 Astra Ultrafast est accessible par l’API OpenAI et à certains utilisateurs de ChatGPT Work et Codex. NVIDIA affirme que ce mode peut générer des tokens jusqu’à 8× plus vite qu’Astra Standard. Pour les développeurs, l’API utilise gpt-6-astra avec le niveau de service ultrafast.
Cette annonce prolonge notre couverture de GPT-6 Astra et de ses progrès, en se concentrant sur l’accès à ce mode plus rapide.
Configurer GPT-6 Astra Ultrafast dans l’API
Dans une requête API, indiquez model="gpt-6-astra" et service_tier="ultrafast". OpenAI prend en charge les requêtes HTTP et WebSocket. Pour les agents qui enchaînent de nombreux appels à des outils, OpenAI recommande des connexions WebSocket persistantes : elles réduisent les échanges réseau susceptibles de rogner le gain de latence.
Les limites par défaut sont exprimées en tokens par minute, abrégés en TPM. Elles dépendent du niveau d’utilisation de l’API :
| Niveau d’utilisation de l’API | Limite par défaut |
| Niveaux 1 à 3 | 500 000 tokens par minute |
| Niveau 4 | 1 000 000 de tokens par minute |
| Niveau 5 | 5 000 000 de tokens par minute |
Accès dans Work et Codex et options de traitement
Dans ChatGPT Work et Codex, OpenAI réserve Ultrafast à une formule Pro spécifique et aux espaces Enterprise et Edu admissibles. Pour ces espaces, l’accès dépend des autorisations requises et des crédits de l’espace de travail. L’accès à Astra standard dans Work et Codex ne donne pas automatiquement accès au mode Ultrafast.
En France, la documentation de l’API prévoit le traitement global, mais pas d’endpoints régionaux de traitement dans l’Union européenne ni ailleurs hors des États-Unis. Elle prend également en charge la résidence des données aux États-Unis. Le traitement global constitue une option distincte de la résidence régionale.
NVIDIA attribue le mode aux GPU Blackwell
NVIDIA indique que GPT-6 Astra Ultrafast fonctionne sur des GPU NVIDIA Blackwell et relie l’accélération à l’optimisation de l’inférence. Son affirmation porte sur la génération de tokens face à Astra Standard ; elle ne décrit pas une durée garantie pour une tâche donnée.
Une démonstration Blender donne un aperçu d’un seul flux de travail
Une démonstration vidéo sponsorisée montre GPT-6 Astra Ultrafast à l’œuvre dans Blender pour créer un modèle de dragon. La première version aurait pris un peu plus de 10 minutes, puis son affinage 35 minutes supplémentaires. Ces durées décrivent les étapes de ce flux Blender ; l’affirmation de NVIDIA porte, elle, sur la génération de tokens.