OpenAI heeft op 13 augustus 2026 Ultrafast geïntroduceerd: een nieuwe servicelaag in de OpenAI API die GPT-5.6 Sol volgens de aangekondigde maximumsnelheid tot 750 outputtokens per seconde laat produceren, of tot 14× sneller dan Standard-verwerking. Cerebras Systems levert daarvoor de inferentie-infrastructuur. Het gaat dus om een snellere manier om hetzelfde model via de API te gebruiken, niet om een nieuw model of een nieuwe algemene ChatGPT-functie.

Ultrafast is een API-servicelaag, geen nieuw model

Ultrafast is momenteel een beperkte preview voor een geselecteerde groep OpenAI API-klanten. OpenAI noemt toepassingen waarbij wachttijd zwaar meetelt: incidentrespons, spraakondersteuning, coderen, handel, financieel onderzoek, beveiligingsreacties en live experimenten.

Voor Nederlandse ontwikkelaars is de belangrijkste praktische conclusie eenvoudig: dit is geen knop die je in ChatGPT kunt aanzetten. De aangekondigde toegang loopt via de API en is niet als algemene ChatGPT-functie beschikbaar.

DimensieGPT-5.6 Sol met UltrafastPraktische betekenis
IdentiteitServicelaag voor GPT-5.6 SolHet onderliggende model verandert niet in een nieuw model
Aangekondigde snelheidTot 750 outputtokens per seconde; tot 14× Standard-verwerkingVooral relevant voor toepassingen die snel nieuwe output moeten ontvangen
ToegangBeperkte preview voor geselecteerde OpenAI API-klantenGeen algemene toegang via ChatGPT
InfrastructuurInferentie via Cerebras Systems en diens wafer-scale-architectuurDe snelheid komt uit de manier waarop de dienst wordt uitgevoerd, niet uit een nieuwe modelnaam
Prijs en brede beschikbaarheidGeen aparte publieke Ultrafast-prijs of datum voor algemene beschikbaarheid bekendgemaaktJe kunt de kosten en toekomstige toegang nog niet betrouwbaar inschatten

Wat 750 outputtokens per seconde wel en niet betekent

De headline gaat over de snelheid waarmee het model outputtokens genereert. Dat is nuttige informatie, maar geen complete latency-meting. De tijd tot een bruikbaar antwoord hangt ook af van invoer, netwerkverkeer, wachtrijen, verwerking vóór het genereren, eventuele hulpmiddelen en de hoeveelheid werk die een taak nodig heeft.

Een maximum van 750 outputtokens per seconde betekent daarom niet dat elke opdracht veertien keer sneller klaar is. Het zegt evenmin hoe Ultrafast zich onder zware belasting gedraagt, wat de p95-latency wordt, hoeveel gelijktijdige verzoeken mogelijk zijn of hoeveel een volledig afgeronde taak kost. Voor een chatbot kan een hoge uitvoersnelheid een vloeiender gesprek opleveren; voor een complexe agent telt vooral hoe snel de hele workflow klaar is. Dat zijn niet dezelfde maatstaven.

Cerebras rapporteert daarnaast een 5,6× hogere end-to-end snelheid op GDP-Val zonder gemelde kwaliteitsvermindering. Ook meldt het bedrijf dat GPT-5.6 Sol Ultrafast een test met 2.500 vragen uit Humanity’s Last Exam in 11 uur en 11 minuten afrondde. Dit zijn bedrijfsbenchmarks: ze geven context bij de claim, maar vormen geen onafhankelijke, onder identieke omstandigheden uitgevoerde vergelijking.

Waarom Cerebras de infrastructuur levert

Cerebras Systems gebruikt een wafer-scale-architectuur: in plaats van inferentie uitsluitend over veel kleinere chips te verdelen, worden modelgegevens volgens de uitleg van het bedrijf op een zeer grote chiparchitectuur verwerkt. Cerebras noemt daarbij 44 GB SRAM per wafer-scale-chip en zegt dat modelgewichten op de chip kunnen blijven. SRAM is snel geheugen dat dicht bij de rekenonderdelen zit; die nabijheid kan gegevensverplaatsing beperken.

Dat technische ontwerp helpt verklaren waarom Cerebras in dit verhaal zit, maar het is geen zelfstandig bewijs dat iedere toepassing de aangekondigde 750 outputtokens per seconde haalt. De architectuur, de gekozen taak en de belasting van de dienst bepalen samen wat een gebruiker uiteindelijk merkt.

Waar lagere latency verschil kan maken

Officiële OpenAI-demonstratie van Ultrafast met incidentanalyse en code-refactoring

De toepassingen van Ultrafast zijn vooral interessant wanneer een model meerdere keren achter elkaar moet reageren. Denk aan een beveiligingsanalyse waarin logs worden bekeken, hypotheses worden opgesteld en code of configuratie wordt aangepast. Minder wachttijd kan daar de lus tussen vraag, antwoord en volgende actie verkorten.

De officiële demonstratie van OpenAI toont een interface voor incidentonderzoek met logs, metingen en bestandsbewerkingen. Ook is een workflow voor code-refactoring te zien. In die demonstratie wordt gezegd dat een intern beveiligingsproces van ongeveer één tot twee uur naar circa 10 tot 15 minuten ging. Dat is een demonstratieresultaat uit een specifieke workflow, geen onafhankelijke productiemeting voor alle klanten.

Voor spraakondersteuning kan snelle generatie de pauzes tussen een gebruiker en een AI-systeem verkorten. Bij financieel onderzoek en live experimenten kan een snellere iteratielus eveneens waardevol zijn. Maar daaruit volgt niet automatisch dat Ultrafast geschikt is voor hoogfrequente handel, beurskoppelingen of gereguleerde besluitvorming. De aankondiging ondersteunt die bredere conclusie niet.

Preview, prijs en beschikbaarheid

OpenAI heeft geen aparte publieke prijs voor Ultrafast bekendgemaakt. De standaardprijzen van de OpenAI API kun je daarom niet zonder meer als Ultrafast-prijs gebruiken. Ook is er geen datum aangekondigd waarop de dienst algemeen beschikbaar wordt.

Cerebras en OpenAI koppelen verdere uitbreiding aan beschikbare capaciteit. Voor nu blijft de relevante status dus: een beperkte API-preview voor geselecteerde klanten. Er is geen onderbouwde Nederlandse prijs, retailer of lokale lanceringsdatum om aan deze status toe te voegen.

De dienst is daarmee vooral interessant voor organisaties en ontwikkelaars die latency een doorslaggevende factor vinden en toegang tot de preview hebben. Voor individuele ChatGPT-gebruikers verandert er door deze aankondiging niets aan de algemene beschikbaarheid.

De kern van Ultrafast is overtuigend genoeg zonder marketingversnelling: OpenAI koppelt GPT-5.6 Sol aan Cerebras-infrastructuur en claimt een zeer hoge output­snelheid. Maar 750 tokens per seconde is een bovengrens voor generatie, geen garantie dat elke taak 14× sneller of goedkoper wordt. De volgende belangrijke gegevens zijn dan ook niet nóg een indrukwekkend maximum, maar prijs, brede toegang en prestaties onder echte gelijktijdige belasting.