NVIDIA anuncia el 2 de octubre de 2026 la disponibilidad de GPT-6 Astra Ultrafast por API y para usuarios elegibles de ChatGPT Work y Codex. La compañía afirma que el modo puede generar tokens hasta 8× más rápido que Astra Standard y dice que funciona con GPU NVIDIA Blackwell.
Para la API, OpenAI especifica el modelo gpt-6-astra y el nivel de servicio ultrafast. En Work y Codex, el acceso también está previsto para espacios Enterprise y Edu elegibles, sujeto a permisos y créditos del espacio. Para conocer el contexto del lanzamiento inicial de GPT-6 Astra, consulta la cobertura anterior de NeoTeo.
Cómo configurar Ultrafast en la API
En una solicitud a la API, indica gpt-6-astra como modelo y ultrafast como nivel de servicio. OpenAI admite solicitudes HTTP y WebSocket. Para aplicaciones con agentes que realizan llamadas frecuentes a herramientas, recomienda mantener conexiones WebSocket persistentes: así se reduce el peso de la comunicación de red en la latencia.
Los límites predeterminados se expresan en tokens por minuto (TPM):
| Nivel de uso de la API | Límite predeterminado |
| Niveles 1–3 | 500.000 TPM |
| Nivel 4 | 1.000.000 TPM |
| Nivel 5 | 5.000.000 TPM |
Procesamiento global y residencia de datos
La API admite el procesamiento global y la residencia de datos en Estados Unidos. No ofrece endpoints regionales para la Unión Europea ni para otras regiones fuera de Estados Unidos; para España, la opción de procesamiento descrita es la global.
Qué afirma NVIDIA sobre la velocidad y Blackwell
NVIDIA atribuye a GPT-6 Astra Ultrafast una generación de tokens de hasta ocho veces la de Astra Standard. La cifra se refiere a la generación de tokens y la presenta como un máximo, no como un resultado para cada tarea. NVIDIA también afirma que el servicio se ejecuta en sus GPU Blackwell y vincula la aceleración a la optimización de la inferencia.
Un flujo de trabajo con Blender
Una demostración patrocinada muestra a GPT-6 Astra Ultrafast trabajando con Blender mediante MCP para crear un modelo 3D de un dragón. Según el creador, la primera versión tardó algo más de 10 minutos y el refinamiento añadió otros 35 minutos.