Claude Opus 5.5 benchmarki: pełna tabela 9 testów i przypisy, których nikt nie tłumaczy
Wygrywa z Fable 5.1 we wszystkich dziewięciu testach, ale producent sam zastrzega, że w praktyce różnica jest mniejsza. Wyjaśniam dlaczego.

👁 116 przeczytań
- Opus 5.5 wygrywa z GPT-6 Astra w czterech z sześciu testów, przegrywając w AutomationBench (40,0% vs 41,4%) i Terminal-Bench-Science (58,7% vs 64,6%).
- Największy skok względem poprzednika to Terminal-Bench 4.0: Opus 5.5 osiąga 66,4% wobec 52,3% u Opus 5, czyli o ponad 14 punktów procentowych więcej.
- Wszystkie wyniki w tabeli pochodzą z najwyższego poziomu wysiłku (max lub xhigh), podczas gdy domyślny poziom to medium - dwa poziomy niżej.
Anthropic opublikował przy premierze Claude Opus 5.5 tabelę dziewięciu benchmarków i trzy przypisy, które zmieniają sposób czytania tych liczb. Zebrałem wszystko po polsku, z komentarzem do każdego testu - bo same procenty bez przypisów wprowadzają w błąd.
Werdykt w jednym akapicie
Opus 5.5 wygrywa z Fable 5.1 i z Opus 5 we wszystkich dziewięciu testach, a z GPT-6 Astra w czterech z sześciu, w których OpenAI podał wynik. Największy skok jest w programowaniu w terminalu: 66,4% wobec 52,3% u poprzednika. Jest jednak zastrzeżenie, które Anthropic podaje sam i które warto przeczytać dwa razy: przy tym poziomie możliwości różnice w benchmarkach stały się mniej wiarygodnym wskaźnikiem różnic w praktyce, a w codziennej pracy dystans do Fable 5.1 jest mniejszy, niż wynika z tabeli.
Pełna tabela
| Test | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 66,4% | 55,8% | 52,3% | 57,9% | 37,3% |
| FrontierCode v1.1 | 54,4% | 50,3% | 48,0% | 53,3% | 47,5% |
| CursorBench 4.0 | 57,8% | 51,8% | 46,6% | - | 41,7% |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1708 | 1542 | 1588 |
| AutomationBench | 40,0% | 31,4% | 26,9% | 41,4% | 28,8% |
| Humanity’s Last Exam, z narzędziami | 67,7% | 65,6% | 63,6% | 57,2% | - |
| Terminal-Bench-Science 0.1 | 58,7% | 52,6% | 29,0% | 64,6% | 22,4% |
| OSWorld 2.0, częściowe | 81,8% | 80,7% | 74,0% | - | - |
| Chartography, z narzędziami | 89,0% | 88,4% | 83,4% | - | - |
Z GPT-6 Astra Opus 5.5 przegrywa w dwóch testach: w AutomationBench (40,0 wobec 41,4) i w Terminal-Bench-Science (58,7 wobec 64,6). W trzech kolejnych OpenAI nie podał wyniku Astry, więc porównania nie ma.
Trzy przypisy, które zmieniają obraz
1. Wyniki są z poziomu max, a Terminal-Bench z xhigh
Wszystkie liczby Opus 5.5 pochodzą z najwyższego poziomu wysiłku, a nie z domyślnego. Domyślny jest medium. Jeśli korzystasz z modelu bez zmiany ustawień, pracujesz dwa poziomy niżej niż w tej tabeli. Sprawdziłem, ile to realnie zmienia.
2. Zabezpieczenia zaniżały wynik
Opus 5.5 był testowany z włączonymi zabezpieczeniami produkcyjnymi. Gdy klasyfikator zatrzymywał zadanie, zadania z cyberbezpieczeństwa kończył Opus 4.8, a z biologii i rozwoju modeli - Opus 5. Anthropic pisze wprost, że to prawdopodobnie obniża wynik Opus 5.5 w tych testach.
3. AutomationBench liczył blokady jako porażki
Ten test przeprowadził Zapier, bez modelu zapasowego. Każda interwencja zabezpieczeń liczyła się jako błąd - producent zaznacza, że w praktyce wynik byłby wyższy. To tłumaczy, dlaczego akurat tu GPT-6 Astra wychodzi na prowadzenie.
Co mierzy każdy test
| Test | Co sprawdza | Dla kogo ważny |
|---|---|---|
| Terminal-Bench 4.0 | Złożone zadania zawodowe w wierszu poleceń | Programiści, agenci |
| FrontierCode | Programowanie agentowe na trudnych zadaniach | Zespoły programistyczne |
| CursorBench | Praca w edytorze Cursor na realnych repozytoriach | Użytkownicy Cursora |
| GDPval-AA | Realna praca biurowa w 44 zawodach, ranking Elo | Analitycy, biura |
| AutomationBench | Automatyzacja procesów biznesowych | Automatyzacja, operacje |
| Humanity’s Last Exam | Trudne pytania z wielu dziedzin | Badania, wiedza ekspercka |
| Terminal-Bench-Science | Agentowa praca naukowa | Nauka, laboratoria |
| OSWorld 2.0 | Obsługa komputera ze zrzutów ekranu | Automatyzacja interfejsów |
| Chartography | Odczytywanie wykresów | Raporty, finanse |
Najciekawszy wynik: koszt, a nie procenty
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Anthropic zestawia wyniki z kosztem na zadanie i tu różnice są największe. Według producenta:
- Terminal-Bench: Opus 5.5 przy domyślnym wysiłku wygrywa z Opus 5 przy maksymalnym za mniej więcej piątą część kosztu, a dorównuje GPT-6 Astra za około 40% jej kosztu.
- FrontierCode: przy domyślnym wysiłku wygrywa z GPT-6 Astra za około 20% kosztu na zadanie.
- CursorBench: wygrywa z GPT-5.6 Sol o 11 punktów za mniej więcej trzecią część kosztu.
- GDPval-AA: na poziomie medium wygrywa z GPT-6 Astra na poziomie max za około piątą część kosztu.
To jest opinia: dla kogoś, kto płaci za zużycie, ta część ogłoszenia jest ważniejsza niż sama tabela. Model, który wygrywa o trzy punkty, ale kosztuje pięć razy mniej, zmienia rachunek bardziej niż model, który wygrywa o dziesięć i kosztuje tyle samo.
Jak to wypada na tle innych rankingów
Niezależny ranking Artificial Analysis, który aktualizujemy na megaherc.pl, stawia Opus 5.5 na trzech pierwszych miejscach: wariant max z indeksem 58, xhigh z 56 i high z 54. Fable 5.1 na max ma 53, GPT-6 Astra - 53. Wariant medium, czyli domyślny, ma 51 - tyle co Opus 5 na poziomie max.
Najczęstsze pytania
W jakich benchmarkach Opus 5.5 jest najlepszy?
W programowaniu w terminalu (66,4%), pracy biurowej GDPval-AA (1846 Elo) i obsłudze komputera OSWorld (81,8%).
Czy Opus 5.5 wygrywa z GPT-6 Astra?
W czterech z sześciu testów, w których oba mają wynik. Przegrywa w AutomationBench i Terminal-Bench-Science.
Na jakim ustawieniu mierzono wyniki?
Na maksymalnym poziomie wysiłku, a Terminal-Bench na xhigh. Domyślny poziom to medium.
Dlaczego wyniki mogą być zaniżone?
Bo testy szły z włączonymi zabezpieczeniami, a część zadań kończyły wtedy starsze modele.
Jaki jest indeks Opus 5.5 w Artificial Analysis?
58 w wariancie max, 51 w domyślnym medium - według rankingu z 24 września 2026.
Źródła i data sprawdzenia
Tabela wyników, przypisy i zestawienia kosztu na zadanie z ogłoszenia premiery na anthropic.com z 22 września 2026; wyniki GPT-6 Astra i GPT-5.6 Sol w tej tabeli podaje Anthropic za OpenAI. Indeksy z rankingu Artificial Analysis pobranego przez API 24 września 2026. Opisy tego, co mierzy każdy test, to moje streszczenie opisów producentów testów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Na jakim ustawieniu były mierzone benchmarki Claude Opus 5.5?
Wyniki mierzono na maksymalnym poziomie wysiłku, a Terminal-Bench konkretnie na poziomie xhigh. Domyślny poziom modelu to medium, co oznacza, że standardowy użytkownik pracuje dwa poziomy niżej niż dane z tabeli.
Dlaczego Opus 5.5 przegrywa z GPT-6 Astra w AutomationBench?
Test AutomationBench przeprowadził Zapier bez modelu zapasowego i każda interwencja zabezpieczeń liczyła się jako błąd - Opus 5.5 uzyskał 40,0%, a GPT-6 Astra 41,4%. Anthropic zaznacza, że bez tej zasady wynik Opus 5.5 byłby wyższy.
Ile kosztuje użycie Claude Opus 5.5 w porównaniu z GPT-6 Astra?
Według danych Anthropic, Opus 5.5 przy domyślnym wysiłku dorównuje GPT-6 Astra w Terminal-Bench za około 40% jej kosztu, a w FrontierCode wygrywa z Astrą za około 20% kosztu na zadanie. W GDPval-AA na poziomie medium wygrywa z Astrą na poziomie max za około piątą część kosztu.
Jaki wynik ma Claude Opus 5.5 w rankingu Artificial Analysis?
Opus 5.5 w wariancie max ma indeks 58, w xhigh - 56, a w high - 54, według danych pobranych 24 września 2026. Wariant medium, czyli domyślny, osiąga indeks 51 - tyle samo co Opus 5 na poziomie max.
