GPT-6 Astra erzielte im ARC-AGI-3-Test 62,7 Prozent mit dem Standard-Harness bei maximalem Reasoning-Aufwand und 99,9 Prozent mit dem Provider Adapter bei hohem Reasoning-Aufwand. ARC Prize veröffentlichte diese Ergebnisse am 3. September 2026 und beansprucht nicht, dass Astra AGI ist. ARC-AGI-3 prüft, wie ein Modell in neuen, abstrakten Spielumgebungen lernt und handelt – nicht allgemeine Intelligenz in sämtlichen Lebensbereichen.
Die ARC-AGI-3-Ergebnisse von GPT-6 Astra im Vergleich
Die drei von ARC Prize gemeldeten Werte beziehen sich auf den ARC-AGI-3-Test „Semi-Private“. Ein Harness ist die technische Testumgebung, über die ein Modell mit der Aufgabe interagiert. Je nach Harness und Reasoning-Aufwand fällt das Ergebnis unterschiedlich aus:
| Testbedingung | Ergebnis | Reasoning-Aufwand | Kontextverarbeitung |
| Standard-Harness | 62,7 % | Maximal | Anbieterneutrale Schnittstelle für Vergleiche zwischen Anbietern |
| Provider Adapter | 98,6 % | Maximal | Bewahrt nicht offengelegten Reasoning-Zustand zwischen Anfragen und nutzt Kompaktierung |
| Provider Adapter | 99,9 % | Hoch | Bewahrt nicht offengelegten Reasoning-Zustand zwischen Anfragen und nutzt Kompaktierung |
Der Wert von 99,9 Prozent gehört also zum Provider Adapter bei hohem Reasoning-Aufwand. Beim selben Adapter lag der Wert bei maximalem Aufwand bei 98,6 Prozent; der Wert von 62,7 Prozent stammt dagegen aus dem Standard-Harness bei maximalem Aufwand. Die Ergebnisse unterscheiden sich sowohl in der Testumgebung als auch – beim Vergleich von 62,7 und 99,9 Prozent – im Reasoning-Aufwand.
Was Standard-Harness und Provider Adapter unterscheidet
Das Standard-Harness ist als anbieterneutrale Schnittstelle angelegt. Es soll Vergleiche zwischen Modellen verschiedener Anbieter unter einer gemeinsamen Testumgebung ermöglichen. Der Provider Adapter nutzt dagegen Funktionen zur Kontextverwaltung des jeweiligen Anbieters: Er erhält den nicht offengelegten Reasoning-Zustand zwischen Anfragen und verwendet Kompaktierung.
Das ist für längere Interaktionen relevant. Ein Modell, das in mehreren Schritten an einer Aufgabe arbeitet, muss Informationen aus vorherigen Anfragen weiterführen können. Die beiden ARC-AGI-3-Werte spiegeln daher unterschiedliche technische Testbedingungen wider. Sie sind keine zwei Messungen unter identischem Aufbau.
Die frühere NeoTeo-Einordnung zu GPT-6 Astra und der AGI-Frage bietet Hintergrund zum Modellstart; für die Bewertung dieser Ergebnisse sind die konkreten Harness- und Reasoning-Bedingungen entscheidend.
Was der Vergleich mit menschlichen Aktionen aussagt
ARC Prize verglich die benötigten Aktionen mit einem menschlichen Medianwert für jedes Level. Für diesen Vergleich testete die Organisation rund 500 Personen aus der allgemeinen Bevölkerung; als Referenz pro Level diente der Median der Aktionen jener Teilnehmenden, die das jeweilige Level abschlossen.
Bei maximalem Reasoning-Aufwand und mit dem Provider Adapter benötigte GPT-6 Astra auf 96,0 Prozent der Levels weniger Aktionen als dieser Median. Über die Levels hinweg waren es durchschnittlich 51,7 Prozent weniger Aktionen pro Level. Das beschreibt die Aktionseffizienz in genau diesem Benchmark und unter diesen Testbedingungen.
ARC-AGI-3 stellt Modelle vor neuartige, abstrakte Umgebungen mit rundenbasierten Interaktionen. Sie müssen Ziele aus der Interaktion ableiten und Aufgaben durch Erkunden, Modellieren, Planen und Ausführen lösen. Die menschlichen Vergleichswerte beziehen sich somit auf Aktionen in diesen Levels, nicht auf ein allgemeines Maß menschlicher Fähigkeiten.
Warum ARC-AGI-3 keinen AGI-Nachweis liefert
ARC Prize beschreibt sein AGI-Ziel als die Fähigkeit, jede Fertigkeit zu erwerben, die ein Mensch beherrscht, und sie ebenso effizient auszuführen. Die Organisation erklärt zugleich, dass ARC-AGI-3 auf begrenzten, deterministischen und abgeschlossenen Umgebungen beruht, die die Komplexität der realen Welt nicht abbilden. Ein hoher Wert in diesem Aufgabenfeld reicht deshalb nicht als Nachweis allgemeiner künstlicher Intelligenz.
ARC Prize wertet GPT-6 Astra als Fortschritt bei der Generalisierung, erklärt aber ausdrücklich, nicht zu behaupten, Astra sei AGI.