Przejdź do treści
Warsztat

Claude Opus 5.5 benchmarki: pełna tabela 9 testów i przypisy, których nikt nie tłumaczy

Wygrywa z Fable 5.1 we wszystkich dziewięciu testach, ale producent sam zastrzega, że w praktyce różnica jest mniejsza. Wyjaśniam dlaczego.

4 min czytania
Claude Opus 5.5 benchmarki: pełna tabela 9 testów i przypisy, których nikt nie tłumaczy

👁 116 przeczytań

// w skrócie
  • Opus 5.5 wygrywa z GPT-6 Astra w czterech z sześciu testów, przegrywając w AutomationBench (40,0% vs 41,4%) i Terminal-Bench-Science (58,7% vs 64,6%).
  • Największy skok względem poprzednika to Terminal-Bench 4.0: Opus 5.5 osiąga 66,4% wobec 52,3% u Opus 5, czyli o ponad 14 punktów procentowych więcej.
  • Wszystkie wyniki w tabeli pochodzą z najwyższego poziomu wysiłku (max lub xhigh), podczas gdy domyślny poziom to medium - dwa poziomy niżej.

Anthropic opublikował przy premierze Claude Opus 5.5 tabelę dziewięciu benchmarków i trzy przypisy, które zmieniają sposób czytania tych liczb. Zebrałem wszystko po polsku, z komentarzem do każdego testu - bo same procenty bez przypisów wprowadzają w błąd.

Werdykt w jednym akapicie

Opus 5.5 wygrywa z Fable 5.1 i z Opus 5 we wszystkich dziewięciu testach, a z GPT-6 Astra w czterech z sześciu, w których OpenAI podał wynik. Największy skok jest w programowaniu w terminalu: 66,4% wobec 52,3% u poprzednika. Jest jednak zastrzeżenie, które Anthropic podaje sam i które warto przeczytać dwa razy: przy tym poziomie możliwości różnice w benchmarkach stały się mniej wiarygodnym wskaźnikiem różnic w praktyce, a w codziennej pracy dystans do Fable 5.1 jest mniejszy, niż wynika z tabeli.

Pełna tabela

TestOpus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.066,4%55,8%52,3%57,9%37,3%
FrontierCode v1.154,4%50,3%48,0%53,3%47,5%
CursorBench 4.057,8%51,8%46,6%-41,7%
GDPval-AA v2.1 (Elo)18461735170815421588
AutomationBench40,0%31,4%26,9%41,4%28,8%
Humanity’s Last Exam, z narzędziami67,7%65,6%63,6%57,2%-
Terminal-Bench-Science 0.158,7%52,6%29,0%64,6%22,4%
OSWorld 2.0, częściowe81,8%80,7%74,0%--
Chartography, z narzędziami89,0%88,4%83,4%--

Z GPT-6 Astra Opus 5.5 przegrywa w dwóch testach: w AutomationBench (40,0 wobec 41,4) i w Terminal-Bench-Science (58,7 wobec 64,6). W trzech kolejnych OpenAI nie podał wyniku Astry, więc porównania nie ma.

Trzy przypisy, które zmieniają obraz

1. Wyniki są z poziomu max, a Terminal-Bench z xhigh

Wszystkie liczby Opus 5.5 pochodzą z najwyższego poziomu wysiłku, a nie z domyślnego. Domyślny jest medium. Jeśli korzystasz z modelu bez zmiany ustawień, pracujesz dwa poziomy niżej niż w tej tabeli. Sprawdziłem, ile to realnie zmienia.

2. Zabezpieczenia zaniżały wynik

Opus 5.5 był testowany z włączonymi zabezpieczeniami produkcyjnymi. Gdy klasyfikator zatrzymywał zadanie, zadania z cyberbezpieczeństwa kończył Opus 4.8, a z biologii i rozwoju modeli - Opus 5. Anthropic pisze wprost, że to prawdopodobnie obniża wynik Opus 5.5 w tych testach.

3. AutomationBench liczył blokady jako porażki

Ten test przeprowadził Zapier, bez modelu zapasowego. Każda interwencja zabezpieczeń liczyła się jako błąd - producent zaznacza, że w praktyce wynik byłby wyższy. To tłumaczy, dlaczego akurat tu GPT-6 Astra wychodzi na prowadzenie.

Co mierzy każdy test

TestCo sprawdzaDla kogo ważny
Terminal-Bench 4.0Złożone zadania zawodowe w wierszu poleceńProgramiści, agenci
FrontierCodeProgramowanie agentowe na trudnych zadaniachZespoły programistyczne
CursorBenchPraca w edytorze Cursor na realnych repozytoriachUżytkownicy Cursora
GDPval-AARealna praca biurowa w 44 zawodach, ranking EloAnalitycy, biura
AutomationBenchAutomatyzacja procesów biznesowychAutomatyzacja, operacje
Humanity’s Last ExamTrudne pytania z wielu dziedzinBadania, wiedza ekspercka
Terminal-Bench-ScienceAgentowa praca naukowaNauka, laboratoria
OSWorld 2.0Obsługa komputera ze zrzutów ekranuAutomatyzacja interfejsów
ChartographyOdczytywanie wykresówRaporty, finanse

Najciekawszy wynik: koszt, a nie procenty

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Anthropic zestawia wyniki z kosztem na zadanie i tu różnice są największe. Według producenta:

  • Terminal-Bench: Opus 5.5 przy domyślnym wysiłku wygrywa z Opus 5 przy maksymalnym za mniej więcej piątą część kosztu, a dorównuje GPT-6 Astra za około 40% jej kosztu.
  • FrontierCode: przy domyślnym wysiłku wygrywa z GPT-6 Astra za około 20% kosztu na zadanie.
  • CursorBench: wygrywa z GPT-5.6 Sol o 11 punktów za mniej więcej trzecią część kosztu.
  • GDPval-AA: na poziomie medium wygrywa z GPT-6 Astra na poziomie max za około piątą część kosztu.

To jest opinia: dla kogoś, kto płaci za zużycie, ta część ogłoszenia jest ważniejsza niż sama tabela. Model, który wygrywa o trzy punkty, ale kosztuje pięć razy mniej, zmienia rachunek bardziej niż model, który wygrywa o dziesięć i kosztuje tyle samo.

Jak to wypada na tle innych rankingów

Niezależny ranking Artificial Analysis, który aktualizujemy na megaherc.pl, stawia Opus 5.5 na trzech pierwszych miejscach: wariant max z indeksem 58, xhigh z 56 i high z 54. Fable 5.1 na max ma 53, GPT-6 Astra - 53. Wariant medium, czyli domyślny, ma 51 - tyle co Opus 5 na poziomie max.

Najczęstsze pytania

W jakich benchmarkach Opus 5.5 jest najlepszy?

W programowaniu w terminalu (66,4%), pracy biurowej GDPval-AA (1846 Elo) i obsłudze komputera OSWorld (81,8%).

Czy Opus 5.5 wygrywa z GPT-6 Astra?

W czterech z sześciu testów, w których oba mają wynik. Przegrywa w AutomationBench i Terminal-Bench-Science.

Na jakim ustawieniu mierzono wyniki?

Na maksymalnym poziomie wysiłku, a Terminal-Bench na xhigh. Domyślny poziom to medium.

Dlaczego wyniki mogą być zaniżone?

Bo testy szły z włączonymi zabezpieczeniami, a część zadań kończyły wtedy starsze modele.

Jaki jest indeks Opus 5.5 w Artificial Analysis?

58 w wariancie max, 51 w domyślnym medium - według rankingu z 24 września 2026.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Źródła i data sprawdzenia

Tabela wyników, przypisy i zestawienia kosztu na zadanie z ogłoszenia premiery na anthropic.com z 22 września 2026; wyniki GPT-6 Astra i GPT-5.6 Sol w tej tabeli podaje Anthropic za OpenAI. Indeksy z rankingu Artificial Analysis pobranego przez API 24 września 2026. Opisy tego, co mierzy każdy test, to moje streszczenie opisów producentów testów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Na jakim ustawieniu były mierzone benchmarki Claude Opus 5.5?

Wyniki mierzono na maksymalnym poziomie wysiłku, a Terminal-Bench konkretnie na poziomie xhigh. Domyślny poziom modelu to medium, co oznacza, że standardowy użytkownik pracuje dwa poziomy niżej niż dane z tabeli.

Dlaczego Opus 5.5 przegrywa z GPT-6 Astra w AutomationBench?

Test AutomationBench przeprowadził Zapier bez modelu zapasowego i każda interwencja zabezpieczeń liczyła się jako błąd - Opus 5.5 uzyskał 40,0%, a GPT-6 Astra 41,4%. Anthropic zaznacza, że bez tej zasady wynik Opus 5.5 byłby wyższy.

Ile kosztuje użycie Claude Opus 5.5 w porównaniu z GPT-6 Astra?

Według danych Anthropic, Opus 5.5 przy domyślnym wysiłku dorównuje GPT-6 Astra w Terminal-Bench za około 40% jej kosztu, a w FrontierCode wygrywa z Astrą za około 20% kosztu na zadanie. W GDPval-AA na poziomie medium wygrywa z Astrą na poziomie max za około piątą część kosztu.

Jaki wynik ma Claude Opus 5.5 w rankingu Artificial Analysis?

Opus 5.5 w wariancie max ma indeks 58, w xhigh - 56, a w high - 54, według danych pobranych 24 września 2026. Wariant medium, czyli domyślny, osiąga indeks 51 - tyle samo co Opus 5 na poziomie max.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie