Em 2 de outubro de 2026, a NVIDIA anunciou a disponibilidade do GPT-6 Astra Ultrafast pela API da OpenAI e para usuários elegíveis do Work e do Codex. A empresa afirma que o modo gera tokens até 8× mais rápido que Astra Standard.
A NeoTeo já publicou uma cobertura anterior sobre o GPT-6 Astra. O anúncio de agora trata do acesso ao modo Ultrafast e da configuração da API.
GPT-6 Astra Ultrafast: acesso e alegação de velocidade
A NVIDIA afirma que o GPT-6 Astra Ultrafast roda em GPUs NVIDIA Blackwell e pode gerar tokens até 8× mais rápido que Astra Standard. A empresa também atribui a aceleração a otimizações de inferência — o processamento que o modelo usa para produzir respostas.
Essa alegação se refere à geração de tokens. Os limites de uso da API, por sua vez, são expressos em tokens por minuto e variam conforme o nível da conta.
Como configurar o Ultrafast na API
Para fazer uma requisição, defina model como gpt-6-astra e service_tier como ultrafast. A API aceita requisições por HTTP ou WebSocket. Para agentes que fazem chamadas frequentes a ferramentas, a OpenAI recomenda conexões WebSocket persistentes, porque o tráfego de rede pode reduzir o ganho de latência.
Os limites padrão indicados pela OpenAI são medidos em tokens por minuto (TPM):
| Nível de uso da API | Limite padrão |
| Níveis 1 a 3 | 500.000 tokens por minuto |
| Nível 4 | 1.000.000 de tokens por minuto |
| Nível 5 | 5.000.000 de tokens por minuto |
No Work e no Codex, a OpenAI lista acesso para workspaces Enterprise e Edu elegíveis. O uso nesses ambientes consome créditos do workspace e depende das permissões correspondentes.
Processamento global e residência de dados no Brasil
Para a API, a OpenAI oferece processamento global e residência de dados nos Estados Unidos. Não há endpoints regionais de processamento no Brasil nem em outras regiões fora dos EUA.
Uma tarefa no Blender como exemplo prático
Uma demonstração patrocinada usa GPT-6 Astra Ultrafast com Blender MCP para modelar um dragão em 3D. O criador relata pouco mais de 10 minutos para a versão inicial e mais 35 minutos para refiná-la. São tempos de etapas sucessivas de uma tarefa; a afirmação de até 8× é a comparação que a NVIDIA faz com Astra Standard.