Ein Retest von GPT-5.6 Luna und die veröffentlichten ARC-AGI-3-Ergebnisse von GPT-5.6 Sol zeichnen ein klares, aber unbequemes Bild: Die Modelle können anspruchsvolle Aufgaben lösen, übertragen ihr scheinbares Verständnis jedoch nicht zuverlässig auf nahe Varianten. Dazu kommt, dass sich die Benchmarkwerte je nach Testaufbau und aktivierten Funktionen deutlich verändern.
Eine allgemein akzeptierte Schwelle für künstliche allgemeine Intelligenz (AGI) gibt es nicht. Häufig ist damit ein System gemeint, das menschliche Fähigkeiten bei nahezu allen kognitiven Aufgaben erreicht oder übertrifft. Die vorliegenden Tests beantworten diese große Frage deshalb nicht mit einer einzelnen Zahl.
Ein kleiner Wechsel im Text führte zu einer anderen Antwort
Ein am 14. September 2026 veröffentlichter Retest prüfte GPT-5.6 Luna mit drei Aufgabentypen: einem Winograd-Schema zur Auflösung von Pronomen, der Erklärung eines mathematischen Witzes von Will Rogers und einer Variante von Drei gewinnt mit gedrehtem Spielfeld.
Beim Winograd-Schema identifizierte GPT-5.6 Luna in einem Beispiel den braunen Koffer als den Gegenstand, der zu klein war. Nach einer kleinen Änderung des Wortlauts antwortete das Modell dagegen, der Tisch sei zu klein gewesen, obwohl sich die richtige Bezugnahme auf das Auto bezog. Die Beobachtung stammt aus einem konkreten Retest und ist keine allgemeine Fehlerquote für die gesamte Modellfamilie.
Gerade solche Aufgaben sind interessant, weil sie keine reine Wissensabfrage darstellen. Das Modell muss den Bezug eines Satzes über die Formulierung hinweg stabil halten. Eine flüssige Antwort genügt dafür nicht; entscheidend ist, ob die zugrunde liegende Beziehung auch nach einer kleinen Änderung erhalten bleibt.
Witz und Spielfeld: Wenn Erklärungen kippen
Beim Will-Rogers-Witz über die durchschnittliche Intelligenz in Oklahoma und Kalifornien lieferte GPT-5.6 Luna laut dem Retest widersprüchliche Erklärungen. Teilweise behandelte das Modell den Witz wie einen mathematischen Widerspruch, statt den Vergleich von Durchschnittswerten zu erfassen.
Auch beim gedrehten Drei-gewinnt-Spielfeld wechselte die Erklärung. In einer Antwort behandelte das Modell die einmalige Drehung um 90 Grad als strategisch bedeutsam, in einer anderen als bloße Umbenennung der Positionen eines normalen 3×3-Spielfelds. Der zweite Gedankengang beschreibt die Spielstruktur, der Wechsel zwischen beiden Antworten aber zeigt, wie empfindlich die Begründung auf die konkrete Aufgabenformulierung reagierte.
Ein Video mit einer mathematischen Demonstration von GPT-5.6 Sol Pro ergänzt diesen Befund aus einem anderen Blickwinkel: Das Modell bearbeitet darin Aufgaben auf dem Niveau fortgeschrittener Mathematik, darunter Riemann-Hilbert-Analysen, erzeugt LaTeX-Formeln und wird zugleich für ausführliche oder verwirrende Passagen kritisiert. Das ist eine anschauliche Demonstration spezialisierter Leistung, aber kein standardisierter AGI-Test.
Warum GPT-5.6 Sol bei ARC-AGI-3 so unterschiedliche Werte erreicht
ARC-AGI-3 prüft Agenten in unbekannten zweidimensionalen Spielumgebungen. Sie müssen zunächst die Regeln erschließen und anschließend möglichst effizient handeln. Für GPT-5.6 Sol sind dabei mehrere Werte veröffentlicht worden:
| Auswertung | Bedingung | Ergebnis | Aussage für den Vergleich |
| Öffentlicher Datensatz | Auf der ARC-Prize-Ergebnisseite gelistete Auswertung | 13,33 % | Ergebnis unter den dort festgelegten Bedingungen |
| Halbprivater Datensatz | Auf der ARC-Prize-Ergebnisseite gelistete Auswertung | 7,78 % | Ergebnis auf einem anderen Teil des Benchmarks |
| Öffentlicher Datensatz | OpenAI-Harness mit beibehaltenem Reasoning und Komprimierung | 38,3 % | Von OpenAI berichtetes Ergebnis mit anderer Konfiguration |
OpenAI führt den Sprung von 13,3 auf 38,3 Prozent auf zwei Einstellungen zurück: Das Reasoning bleibt über längere Aufgaben hinweg erhalten, während die Komprimierung den Umgang mit dem Gesprächskontext verändert. Damit wird nicht derselbe Messwert einfach nachträglich umbenannt. Die Bedingungen unterscheiden sich, und genau diese Bedingungen beeinflussen das Ergebnis.
Das ist bei Benchmarks entscheidend. Eine Punktzahl beschreibt nicht nur ein Modell, sondern das Zusammenspiel aus Modellvariante, Datensatz, Werkzeugen, Kontextverwaltung und Auswertungs-Harness. Wer nur die größte Zahl herausgreift, lässt einen wesentlichen Teil des Ergebnisses weg.
Was ARC-AGI-3 leisten kann – und was nicht
Die Benchmark ist nützlich, weil sie eine konkrete Fähigkeit sichtbar macht: Ein System soll Regeln in unbekannten Umgebungen erkennen und daraus Handlungen ableiten. Sie deckt damit mehr ab als das bloße Wiedergeben gelernter Fakten.
Sie bildet aber nicht die gesamte Bandbreite menschlicher Intelligenz ab. François Chollet verwies darauf, dass reale Aufgaben deutlich längere Lernzeiträume, komplexere Weltmodelle, größere Mehrdeutigkeit bei Zielen und weit größere Suchräume umfassen als die Spiele in ARC-AGI-3. Ein gutes Ergebnis ist deshalb ein Befund über diese Aufgabenklasse – kein vollständiges Urteil über allgemeine Intelligenz.
Die Diskussion wurde zusätzlich durch GPT-6 Astra angeheizt. GPT-6 Astra ist ein separates, späteres Produkt und nicht GPT-5.6. Seine berichteten Werte gehören daher nicht in die Messreihe von GPT-5.6; sie veranschaulichen lediglich, wie stark sich Ergebnisse desselben Benchmarknamens zwischen einem firmeneigenen Harness und der Standardauswertung unterscheiden können.
Der sinnvollere Maßstab ist stabile Übertragung
Für die AGI-Frage zählt nicht nur, ob ein Modell eine schwierige Aufgabe einmal löst. Aussagekräftiger ist, ob es die relevante Regel bei einer veränderten Formulierung beibehält, seine Erklärung konsistent anpasst und Fehler in einer neuen Situation korrigiert.
Bei GPT-5.6 liegen dafür unterschiedliche Signale nebeneinander: GPT-5.6 Sol erreicht bei ARC-AGI-3 je nach Bedingungen deutlich verschiedene Werte, während GPT-5.6 Luna in einem Retest bei eng verwandten Aufgaben wechselnde Antworten gab. Das spricht für leistungsfähige, aber stark kontextabhängige Fähigkeiten – und macht die Testbedingungen zum Teil des Ergebnisses.