Porównanie opublikowane 26 września 2026 r. przyniosło taki sam wynik Claude Opus 5.5 i Claude Opus 5 w trzech zadaniach: oba modele rozwiązały łamigłówkę logiczną i grę w usuwanie kamieni, a żaden nie odpowiedział na zadanie z ograniczoną kolejnością. W zestawieniu wszystkich wywołań Claude Opus 5.5 generował 103,4 tokena wyjściowego na sekundę, wobec 93,1 w przypadku Claude Opus 5 — różnica wyniosła około 11%.
Dwa zadania rozwiązane, jedno bez odpowiedzi
W łamigłówce logicznej oba modele zdobyły 28/28 punktów. W grze w usuwanie kamieni każdy poprawnie odpowiedział na trzy pytania. W zadaniu dotyczącym kolejności pracy żaden nie podał odpowiedzi przy sprawdzonych limitach wyjściowych 48 000 i 128 000 tokenów.
| Zadanie | Claude Opus 5.5 | Claude Opus 5 |
| Łamigłówka logiczna | 28/28 punktów | 28/28 punktów |
| Zadanie z ograniczoną kolejnością | Brak odpowiedzi przy limitach 48 000 i 128 000 tokenów wyjściowych | Brak odpowiedzi przy limitach 48 000 i 128 000 tokenów wyjściowych |
| Gra w usuwanie kamieni | 3/3 poprawne odpowiedzi | 3/3 poprawne odpowiedzi |
Jak przebiegało porównanie
Modele otrzymały identyczne prompty za pośrednictwem API Anthropic, czyli interfejsu, przez który aplikacje mogą wysyłać zapytania do modelu. Użyto adaptacyjnego myślenia z domyślnym poziomem wysiłku. Każdy problem uruchomiono raz na model.
Łamigłówka logiczna wymagała przyporządkowania siedmiu inżynierów do dni, języków programowania, usług i miast na podstawie 22 wskazówek. W zadaniu z ograniczoną kolejnością trzeba było obliczyć liczbę układów dla 6, 8 i 10 zadań, przy ograniczeniach dotyczących ich pozycji. Poprawne wyniki wynosiły odpowiednio 27, 1 695 i 159 019, lecz żaden model nie podał odpowiedzi. W grze każdy ruch polegał na usunięciu 2, 5, 7 albo 11 kamieni, a gracze nie mogli powtarzać własnego poprzedniego ruchu.
Szybkość generowania a deklaracja Anthropic
W zestawieniu wszystkich wywołań Claude Opus 5.5 osiągnął szybkość 103,4 tokena wyjściowego na sekundę, a Claude Opus 5 — 93,1. To około 11% wyższy wynik dla Claude Opus 5.5 w tym konkretnym teście.
Anthropic osobno deklaruje, że Claude Opus 5.5 generuje odpowiedzi o ponad 30% szybciej niż Claude Opus 5. Ta deklaracja firmy i pomiar z porównania dotyczą różnych zakresów: pomiar objął trzy opisane zadania i pojedyncze uruchomienie każdego problemu na model.
Zakres wyników
Rezultaty dotyczą trzech konkretnych zadań oraz zastosowanych w nich ustawień. Przy jednym uruchomieniu każdego problemu na model nie składają się na ogólną ocenę zdolności rozumowania Claude Opus 5.5 ani Claude Opus 5.