Porównanie opublikowane 26 września 2026 r. przyniosło taki sam wynik Claude Opus 5.5 i Claude Opus 5 w trzech zadaniach: oba modele rozwiązały łamigłówkę logiczną i grę w usuwanie kamieni, a żaden nie odpowiedział na zadanie z ograniczoną kolejnością. W zestawieniu wszystkich wywołań Claude Opus 5.5 generował 103,4 tokena wyjściowego na sekundę, wobec 93,1 w przypadku Claude Opus 5 — różnica wyniosła około 11%.

Dwa zadania rozwiązane, jedno bez odpowiedzi

W łamigłówce logicznej oba modele zdobyły 28/28 punktów. W grze w usuwanie kamieni każdy poprawnie odpowiedział na trzy pytania. W zadaniu dotyczącym kolejności pracy żaden nie podał odpowiedzi przy sprawdzonych limitach wyjściowych 48 000 i 128 000 tokenów.

ZadanieClaude Opus 5.5Claude Opus 5
Łamigłówka logiczna28/28 punktów28/28 punktów
Zadanie z ograniczoną kolejnościąBrak odpowiedzi przy limitach 48 000 i 128 000 tokenów wyjściowychBrak odpowiedzi przy limitach 48 000 i 128 000 tokenów wyjściowych
Gra w usuwanie kamieni3/3 poprawne odpowiedzi3/3 poprawne odpowiedzi

Jak przebiegało porównanie

Modele otrzymały identyczne prompty za pośrednictwem API Anthropic, czyli interfejsu, przez który aplikacje mogą wysyłać zapytania do modelu. Użyto adaptacyjnego myślenia z domyślnym poziomem wysiłku. Każdy problem uruchomiono raz na model.

Łamigłówka logiczna wymagała przyporządkowania siedmiu inżynierów do dni, języków programowania, usług i miast na podstawie 22 wskazówek. W zadaniu z ograniczoną kolejnością trzeba było obliczyć liczbę układów dla 6, 8 i 10 zadań, przy ograniczeniach dotyczących ich pozycji. Poprawne wyniki wynosiły odpowiednio 27, 1 695 i 159 019, lecz żaden model nie podał odpowiedzi. W grze każdy ruch polegał na usunięciu 2, 5, 7 albo 11 kamieni, a gracze nie mogli powtarzać własnego poprzedniego ruchu.

Szybkość generowania a deklaracja Anthropic

W zestawieniu wszystkich wywołań Claude Opus 5.5 osiągnął szybkość 103,4 tokena wyjściowego na sekundę, a Claude Opus 5 — 93,1. To około 11% wyższy wynik dla Claude Opus 5.5 w tym konkretnym teście.

Anthropic osobno deklaruje, że Claude Opus 5.5 generuje odpowiedzi o ponad 30% szybciej niż Claude Opus 5. Ta deklaracja firmy i pomiar z porównania dotyczą różnych zakresów: pomiar objął trzy opisane zadania i pojedyncze uruchomienie każdego problemu na model.

Zakres wyników

Rezultaty dotyczą trzech konkretnych zadań oraz zastosowanych w nich ustawień. Przy jednym uruchomieniu każdego problemu na model nie składają się na ogólną ocenę zdolności rozumowania Claude Opus 5.5 ani Claude Opus 5.