Claude Opus 5.5 vs GPT-6 Astra: wyniki i koszt na zadanie, test po teście
Na FrontierCode Opus 5.5 przy domyślnym ustawieniu wygrywa z Astrą za około 20% jej kosztu na zadanie.

👁 122 przeczytań
Claude Opus 5.5 i GPT-6 Astra to dziś dwa najmocniejsze modele obu firm i dwa zupełnie różne rachunki. Astra kosztuje 2,5 raza więcej za token, a Anthropic twierdzi, że na kilku testach Opus 5.5 wygrywa z nią za piątą część kosztu zadania. Zestawiłem wyniki test po testie i sprawdziłem, co w tym porównaniu jest mocne, a co wymaga zastrzeżenia.
Werdykt w jednym akapicie
Opus 5.5 wygrywa w czterech z sześciu testów, w których oba modele mają wynik, i przegrywa w dwóch: automatyzacji procesów biznesowych i agentowej pracy naukowej. Tam, gdzie Astra jest lepsza, różnica to 1,4 i 5,9 punktu. Tam, gdzie lepszy jest Opus, różnica dochodzi do 10,5 punktu w Humanity’s Last Exam, 8,5 punktu w programowaniu w terminalu i 304 punktów Elo w pracy biurowej. O wyborze częściej zdecyduje jednak koszt: 4 i 20 USD wobec 10 i 50 USD za milion tokenów, a Astra ma dodatkowo dopłatę za długie zapytania.
Wyniki test po teście
| Test | Opus 5.5 | GPT-6 Astra | Kto wygrywa |
|---|---|---|---|
| Terminal-Bench 4.0 | 66,4% | 57,9% | Opus, +8,5 pkt |
| FrontierCode v1.1 | 54,4% | 53,3% | Opus, +1,1 pkt |
| GDPval-AA v2.1 (Elo) | 1846 | 1542 | Opus, +304 |
| Humanity’s Last Exam | 67,7% | 57,2% | Opus, +10,5 pkt |
| AutomationBench | 40,0% | 41,4% | Astra, +1,4 pkt |
| Terminal-Bench-Science | 58,7% | 64,6% | Astra, +5,9 pkt |
| CursorBench, OSWorld, Chartography | brak wyniku Astry - OpenAI go nie podał | ||
Wyniki Astry to liczby podane przez OpenAI i zestawione przez Anthropic w ogłoszeniu premiery.
Zastrzeżenia, o których trzeba wiedzieć
- Różne poziomy wysiłku. Opus 5.5 był mierzony na max, a w Terminal-Bench na xhigh. Astra w Terminal-Bench - na high, jak podał OpenAI. Każdy model pokazuje swój najlepszy wynik.
- AutomationBench przeprowadził Zapier bez modelu zapasowego. Każda blokada zabezpieczeń Opus 5.5 liczyła się jako porażka. Producent zaznacza, że w praktyce wynik byłby wyższy - to może być różnica 1,4 punktu.
- Tabela pochodzi od Anthropic. Wybór testów należy do strony, której model wygrywa w większości z nich.
Cena: tu różnica jest największa
| Pozycja, za milion tokenów | Opus 5.5 | GPT-6 Astra |
|---|---|---|
| Wejście | 4 USD | 10 USD |
| Wyjście | 20 USD | 50 USD |
| Wejście z pamięci podręcznej | 0,20 USD | 1,00 USD |
| Kontekst | 1 mln tokenów | 1,05 mln tokenów |
| Maksymalne wyjście | 128 tys. tokenów | |
Rzecz, którą łatwo przeoczyć: według dokumentacji OpenAI zapytania do Astry z ponad 272 tysiącami tokenów wejścia są rozliczane po podwójnej stawce wejścia i półtorakrotnej wyjścia - za całe zapytanie. Cennik Opus 5.5 w ogłoszeniu Anthropic takiej progowej stawki nie wymienia. Przy pracy z długimi dokumentami ta różnica potrafi być większa niż sama różnica cen podstawowych.
Koszt na zadanie, a nie za token
Anthropic zestawia wyniki z kosztem na zadanie i tu jego przewaga wygląda najmocniej:
| Test | Co twierdzi producent |
|---|---|
| FrontierCode | Opus 5.5 na domyślnym medium wygrywa z Astrą za około 20% jej kosztu na zadanie |
| Terminal-Bench 4.0 | dorównuje Astrze za około 40% kosztu |
| GDPval-AA | na medium wygrywa z Astrą na max za około piątą część kosztu |
To są twierdzenia producenta, nie mój pomiar - Astry w swoich testach nie uruchamiałem. To jest opinia: jeśli choćby połowa tej różnicy się potwierdzi, przy stałym, dużym wolumenie zapytań decyzja jest prosta.
Niezależny ranking
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
W rankingu Artificial Analysis, który aktualizujemy na megaherc.pl, stan na 24 września:
| Wariant | Indeks |
|---|---|
| Claude Opus 5.5, max | 58 |
| Claude Opus 5.5, xhigh | 56 |
| GPT-6 Astra, max | 53 |
| GPT-6 Astra, xhigh | 52 |
| Claude Opus 5.5, medium (domyślny) | 51 |
| GPT-6 Astra, high | 51 |
Opus 5.5 na domyślnym poziomie wypada tak samo jak Astra na high - przy 2,5 raza niższej cenie za token.
Kiedy wybrać który
| Zastosowanie | Wybór | Dlaczego |
|---|---|---|
| Programowanie, praca w terminalu | Opus 5.5 | +8,5 pkt w Terminal-Bench, niższy koszt |
| Analizy, raporty, praca biurowa | Opus 5.5 | +304 Elo w GDPval-AA |
| Długie dokumenty powyżej 272 tys. tokenów | Opus 5.5 | Astra liczy wtedy podwójnie |
| Agentowa praca naukowa | Astra | +5,9 pkt w Terminal-Bench-Science |
| Masz już ekosystem OpenAI | Astra | Koszt zmiany dostawcy też jest kosztem |
Więcej o samej Astrze - w naszym przewodniku po GPT-6 Astra.
Najczęstsze pytania
Co jest lepsze: Claude Opus 5.5 czy GPT-6 Astra?
W opublikowanych wynikach Opus 5.5 wygrywa w czterech z sześciu testów, w których oba mają wynik, i kosztuje 2,5 raza mniej za token.
W czym GPT-6 Astra jest lepsza?
W agentowej pracy naukowej (64,6% wobec 58,7%) i nieznacznie w automatyzacji procesów biznesowych (41,4% wobec 40,0%).
Która jest tańsza?
Opus 5.5: 4 i 20 USD za milion tokenów wobec 10 i 50 USD. Astra ma dodatkowo wyższą stawkę dla zapytań powyżej 272 tysięcy tokenów.
Która ma większy kontekst?
Astra - 1,05 mln tokenów wobec 1 mln. Maksymalne wyjście jest takie samo: 128 tysięcy.
Źródła i data sprawdzenia
Wyniki obu modeli i porównania kosztu na zadanie z ogłoszenia premiery Opus 5.5 na anthropic.com; wyniki Astry w tej tabeli podaje Anthropic za OpenAI. Cennik, kontekst i próg 272 tysięcy tokenów Astry ze strony modelu w dokumentacji OpenAI. Indeksy z rankingu Artificial Analysis pobranego 24 września 2026. GPT-6 Astra nie była uruchamiana w moich testach.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
