Le 2 octobre 2026, NVIDIA annonce que GPT-6 Astra Ultrafast est accessible par l’API OpenAI et à certains utilisateurs de ChatGPT Work et Codex. NVIDIA affirme que ce mode peut générer des tokens jusqu’à 8× plus vite qu’Astra Standard. Pour les développeurs, l’API utilise gpt-6-astra avec le niveau de service ultrafast.

Cette annonce prolonge notre couverture de GPT-6 Astra et de ses progrès, en se concentrant sur l’accès à ce mode plus rapide.

Configurer GPT-6 Astra Ultrafast dans l’API

Dans une requête API, indiquez model="gpt-6-astra" et service_tier="ultrafast". OpenAI prend en charge les requêtes HTTP et WebSocket. Pour les agents qui enchaînent de nombreux appels à des outils, OpenAI recommande des connexions WebSocket persistantes : elles réduisent les échanges réseau susceptibles de rogner le gain de latence.

Les limites par défaut sont exprimées en tokens par minute, abrégés en TPM. Elles dépendent du niveau d’utilisation de l’API :

Niveau d’utilisation de l’APILimite par défaut
Niveaux 1 à 3500 000 tokens par minute
Niveau 41 000 000 de tokens par minute
Niveau 55 000 000 de tokens par minute

Accès dans Work et Codex et options de traitement

Dans ChatGPT Work et Codex, OpenAI réserve Ultrafast à une formule Pro spécifique et aux espaces Enterprise et Edu admissibles. Pour ces espaces, l’accès dépend des autorisations requises et des crédits de l’espace de travail. L’accès à Astra standard dans Work et Codex ne donne pas automatiquement accès au mode Ultrafast.

En France, la documentation de l’API prévoit le traitement global, mais pas d’endpoints régionaux de traitement dans l’Union européenne ni ailleurs hors des États-Unis. Elle prend également en charge la résidence des données aux États-Unis. Le traitement global constitue une option distincte de la résidence régionale.

NVIDIA attribue le mode aux GPU Blackwell

NVIDIA indique que GPT-6 Astra Ultrafast fonctionne sur des GPU NVIDIA Blackwell et relie l’accélération à l’optimisation de l’inférence. Son affirmation porte sur la génération de tokens face à Astra Standard ; elle ne décrit pas une durée garantie pour une tâche donnée.

Une démonstration Blender donne un aperçu d’un seul flux de travail

Une démonstration sponsorisée montre la création d’un modèle de dragon dans Blender avec GPT-6 Astra Ultrafast.

Une démonstration vidéo sponsorisée montre GPT-6 Astra Ultrafast à l’œuvre dans Blender pour créer un modèle de dragon. La première version aurait pris un peu plus de 10 minutes, puis son affinage 35 minutes supplémentaires. Ces durées décrivent les étapes de ce flux Blender ; l’affirmation de NVIDIA porte, elle, sur la génération de tokens.