NVIDIA anuncia el 2 de octubre de 2026 la disponibilidad de GPT-6 Astra Ultrafast por API y para usuarios elegibles de ChatGPT Work y Codex. La compañía afirma que el modo puede generar tokens hasta 8× más rápido que Astra Standard y dice que funciona con GPU NVIDIA Blackwell.

Para la API, OpenAI especifica el modelo gpt-6-astra y el nivel de servicio ultrafast. En Work y Codex, el acceso también está previsto para espacios Enterprise y Edu elegibles, sujeto a permisos y créditos del espacio. Para conocer el contexto del lanzamiento inicial de GPT-6 Astra, consulta la cobertura anterior de NeoTeo.

Cómo configurar Ultrafast en la API

En una solicitud a la API, indica gpt-6-astra como modelo y ultrafast como nivel de servicio. OpenAI admite solicitudes HTTP y WebSocket. Para aplicaciones con agentes que realizan llamadas frecuentes a herramientas, recomienda mantener conexiones WebSocket persistentes: así se reduce el peso de la comunicación de red en la latencia.

Los límites predeterminados se expresan en tokens por minuto (TPM):

Nivel de uso de la APILímite predeterminado
Niveles 1–3500.000 TPM
Nivel 41.000.000 TPM
Nivel 55.000.000 TPM

Procesamiento global y residencia de datos

La API admite el procesamiento global y la residencia de datos en Estados Unidos. No ofrece endpoints regionales para la Unión Europea ni para otras regiones fuera de Estados Unidos; para España, la opción de procesamiento descrita es la global.

Qué afirma NVIDIA sobre la velocidad y Blackwell

NVIDIA atribuye a GPT-6 Astra Ultrafast una generación de tokens de hasta ocho veces la de Astra Standard. La cifra se refiere a la generación de tokens y la presenta como un máximo, no como un resultado para cada tarea. NVIDIA también afirma que el servicio se ejecuta en sus GPU Blackwell y vincula la aceleración a la optimización de la inferencia.

Un flujo de trabajo con Blender

Demostración patrocinada de GPT-6 Astra Ultrafast creando un dragón en Blender

Una demostración patrocinada muestra a GPT-6 Astra Ultrafast trabajando con Blender mediante MCP para crear un modelo 3D de un dragón. Según el creador, la primera versión tardó algo más de 10 minutos y el refinamiento añadió otros 35 minutos.