OpenAI wprowadziło Ultrafast jako ograniczoną wersję zapoznawczą warstwy API dla GPT-5.6 Sol. Usługa wykorzystuje infrastrukturę Cerebras Systems i według deklaracji ma generować do 750 tokenów wyjściowych na sekundę, czyli działać nawet do 14 razy szybciej niż przetwarzanie Standard. To zmiana sposobu udostępniania i obsługi modelu, nie premiera nowego modelu.

Ultrafast to warstwa usługi API, nie nowy model

GPT-5.6 Sol pozostaje modelem, a Ultrafast jest przypisaną do niego warstwą usługi w OpenAI API. OpenAI opisuje ją jako rozwiązanie dla zadań, w których opóźnienie ma szczególne znaczenie: obsługi głosowej, reagowania na incydenty, programowania, handlu, badań finansowych, bezpieczeństwa i eksperymentów prowadzonych na żywo.

Na tym etapie dostęp otrzymała wybrana grupa klientów API. Zapowiedź nie opisuje Ultrafast jako ogólnodostępnej funkcji ChatGPT, więc użytkownik zwykłej aplikacji nie powinien traktować jej jako nowego przełącznika w interfejsie.

WymiarGPT-5.6 Sol z UltrafastCo to oznacza w praktyce
Tożsamość usługiWarstwa API dla GPT-5.6 SolNie jest to osobny model
Deklarowana szybkośćDo 750 tokenów wyjściowych na sekundę; do 14 razy szybciej niż StandardTo maksymalna wartość deklarowana przez dostawców, a nie gwarantowane tempo każdej odpowiedzi
DostępOgraniczone preview dla wybranych klientów OpenAI APINie oznacza powszechnego dostępu ani wdrożenia w ChatGPT
InfrastrukturaInferencja z wykorzystaniem Cerebras Systems i architektury wafer-scaleSposób dostarczania modelu ma ograniczać opóźnienia, ale nie określa sam w sobie czasu wykonania każdego zadania
CenaOsobna publiczna cena Ultrafast nie została ogłoszonaStandardowych stawek API nie należy automatycznie uznawać za cennik Ultrafast

Co naprawdę oznacza 750 tokenów na sekundę

Tokeny to małe jednostki, na które model dzieli tekst podczas pracy. Wskaźnik 750 tokenów na sekundę opisuje tempo generowania odpowiedzi, a porównanie „do 14 razy szybciej” odnosi się do przetwarzania Standard. Obie liczby są deklarowanymi wartościami maksymalnymi.

Nie wynika z nich, że każda aplikacja zakończy zadanie 14 razy szybciej. Na całkowity czas wpływają także przesłanie żądania, przygotowanie kontekstu, narzędzia używane przez aplikację, długość odpowiedzi oraz obciążenie usługi. Samo tempo generowania nie jest więc tym samym co opóźnienie end-to-end, wynik p95 pod obciążeniem, przepustowość wielu równoczesnych żądań ani koszt wykonania kompletnego zadania.

Cerebras podało także wyniki własnych testów: 2500 pytań z zestawu Humanity’s Last Exam miało zostać wykonanych w 11 godzin i 11 minut, a w GDP-Val firma raportowała 5,6-krotne przyspieszenie end-to-end bez zgłoszonego pogorszenia jakości. To benchmarki producenta, nie niezależne pomiary w warunkach produkcyjnych. Warto je czytać jako ilustrację możliwości deklarowanych przez dostawcę, a nie jako obietnicę dla każdego wdrożenia.

Rola Cerebras i architektura wafer-scale

Cerebras Systems dostarcza infrastrukturę inferencyjną dla Ultrafast. Firma opisuje podejście oparte na Wafer-Scale Engine, w którym wagi modelu pozostają w pamięci znajdującej się bezpośrednio na układzie. W materiałach technicznych Cerebras wskazuje na 44 GB pamięci SRAM na układzie wafer-scale.

To ważny szczegół, bo przenoszenie danych między pamięcią a jednostkami obliczeniowymi jest jednym z czynników wpływających na szybkość inferencji. Nie należy jednak robić z tej architektury prostego dowodu, że każda odpowiedź będzie miała określone opóźnienie. Architektura wyjaśnia, jak dostawca chce osiągnąć wysoką przepustowość; nie zastępuje pomiarów w konkretnym obciążeniu.

Gdzie niska latencja może mieć znaczenie

Oficjalna demonstracja OpenAI pokazuje interfejs Ultrafast podczas analizy incydentu bezpieczeństwa i refaktoryzacji kodu.

Najbardziej przekonujący sens Ultrafast widać tam, gdzie użytkownik prowadzi z modelem szybką, wieloetapową interakcję. Dotyczy to na przykład głosowej obsługi klienta, pracy programistycznej, analizy incydentów bezpieczeństwa, badań finansowych i aplikacji reagujących na bieżące zdarzenia.

W oficjalnej demonstracji OpenAI pokazano interfejs analizujący incydent z logami i metrykami, a także przepływ refaktoryzacji kodu. W demonstracji padła deklaracja, że zebranie, uporządkowanie, normalizacja i opisanie danych z jednego procesu bezpieczeństwa skróciło się z jednej–dwóch godzin do około 10–15 minut. To rezultat przedstawiony w demonstracji OpenAI, a nie niezależny benchmark produkcyjny.

W przypadku badań finansowych szybkość może ułatwiać interaktywną analizę, ale sama w sobie nie potwierdza przydatności do handlu wysokich częstotliwości. Nie wynika z niej także dostęp do giełd, deterministyczne działanie ani spełnienie wymogów regulacyjnych.

Ograniczony preview, cena i dostępność

Ultrafast pozostaje ograniczonym preview dla wybranych klientów OpenAI API. Nie ogłoszono daty powszechnej dostępności ani osobnej publicznej ceny tej warstwy. To oznacza, że na razie nie da się rzetelnie ocenić kosztu kompletnego zadania ani porównać go ze standardowym przetwarzaniem wyłącznie na podstawie szybkości generowania.

Dla osób budujących aplikacje najważniejsze będą w praktyce nie tylko maksymalne 750 tokenów na sekundę, lecz także rzeczywiste opóźnienie całego żądania, zachowanie usługi przy wielu równoczesnych użytkownikach, limity kontekstu, cena i jakość odpowiedzi. Tych elementów ogłoszenie nie zamienia w obietnicę.

Wniosek

Ultrafast jest interesującym testem tego, co daje połączenie GPT-5.6 Sol z infrastrukturą Cerebras Systems: OpenAI obiecuje znacznie szybsze generowanie, a demonstracja pokazuje, dlaczego może to mieć znaczenie dla agentów, głosu i pracy programistycznej. Na dziś to jednak przede wszystkim ograniczona usługa API z atrakcyjnymi maksymalnymi deklaracjami, a nie powszechnie dostępna funkcja ChatGPT ani kompletny dowód 14-krotnego przyspieszenia każdego zadania.