✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5: benchmarki i ceny

Argon wygrywa 13 z 19 testów Google i na start kosztuje piątą część Astry. W programowaniu to jednak remis, a dostępny dziś nie jest wcale.

5 min czytania
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5: benchmarki i ceny

👁 156 przeczytań

// w skrócie
  • Gemini 4 Argon wygrywa w 13 z 19 testów opublikowanych przez Google, ale model nie jest jeszcze publicznie dostępny - tylko w programie Fairwind i GoogleAPI.
  • W cenie startowej Argon kosztuje 2/10 USD za milion tokenów, co czyni go najtańszym z trójki - Astra jest ok. 2,5 raza droższa nawet po zakończeniu promocji.
  • Opus 5.5 ma najlepsze wyniki w testach Terminal-Bench 4.0 i PostTrainBench, co czyni go najsilniejszym z dostępnych modeli do pracy z terminalem i agentami programistycznymi.

Gemini 4 Argon wygrywa z GPT-6 Astra i Claude Opus 5.5 w 13 z 19 testów opublikowanych przez Google, a w cenie startowej kosztuje jedną piątą stawek Astry. Przegrywa za to w dwóch z czterech testów programistycznych i jako jedyny z trójki nie jest dziś dostępny. Zestawiłem wyłącznie dane opublikowane przez producentów i policzyłem koszt trzech typowych zadań.

Trzy modele w jednej tabeli

CechaGemini 4 ArgonGPT-6 AstraClaude Opus 5.5
Producent, premieraGoogle, 30.09.2026OpenAI, 3.09.2026Anthropic, 22.09.2026
Wejście / wyjście za 1 mln tokenów2 / 10 USD na start, potem 4 / 20 USD10 / 50 USD (powyżej 272 tys. wejścia 20 / 75 USD)4 / 20 USD
Wejście z cache za 1 mln0,10 USD na start, potem 0,20 USD1 USD0,20 USD
Okno wejściaGoogle nie podał1 050 000 tokenów1 mln tokenów
Maks. wyjście1 mln tokenów128 tys.128 tys.
Dostępność dziśTylko program Fairwind i GoogleAPI, ChatGPT od Plus (Work, Codex)API, aplikacja Claude, chmury

Ceny Astry i Opusa to stawki standardowe z cenników producentów, bez podatku. Ceny Argona pochodzą z ogłoszenia Google. W oficjalnym cenniku Gemini API modelu jeszcze nie ma. Szczegóły każdego modelu opisuję osobno: Gemini 4 Argon, GPT-6 Astra i Claude Opus 5.5.

// taniej niż u producentaw magazynie
Google AI Gemini Pro + Google Drive 5 TB - 18 miesięcy
Google AI Gemini Pro + Google Drive 5 TB - 18 miesięcyVoucher, którym włączasz Google AI Pro na 18 miesięcy na własnym koncie Google.kinetyka.pl - mój sklep z rocznymi dostępami do narzędzi AI
170 zł-91%zamiast 1 800 zł9,44 zł / mies.Kup w Kinetyce →

Benchmarki: kto wygrywa w czym

Poniżej pełna tabela z dokumentu metodologicznego Google DeepMind. Wyniki Argona Google policzył sam przy najwyższym ustawieniu myślenia, wyniki Astry i Opusa pochodzą z publicznych rankingów albo z kart modeli producentów. Pogrubiam najlepszy wynik w trójce.

Praca biurowa

TestArgonAstraOpus 5.5
Vals Index68,9%63,1%67,0%
AutomationBench (Zapier)51,3%41,4%42,5%
Vals Finance Agent v265,4%53,5%58,6%
Harvey Legal Agent Benchmark19,6%5,4%3,8%

Tu Argon ma najwyraźniejszą przewagę. W teście prawniczym Harvey ma pięciokrotnie wyższy wynik niż Opus 5.5, choć wszystkie trzy modele są daleko od połowy skali.

Programowanie i inżynieria ML

TestArgonAstraOpus 5.5
DeepSWE v1.177,9%74,1%74,2%
FrontierSWE v255,0%65,5%62,3%
Vibe Code Bench91,9%89,6%90,3%
Terminal-Bench 4.057,4%58,2%66,4%
PostTrainBench45,3%44,3%49,3%

Remis w praktyce. Argon wygrywa w DeepSWE i Vibe Code Bench, ale w FrontierSWE v2 traci do Astry 10,5 punktu, a w Terminal-Bench 4.0 do Opusa 9 punktów. Do tego Bloomberg, cytowany przez Techmeme, podał, że według części pracowników Google model radzi sobie gorzej w realnych zadaniach programistycznych niż w benchmarkach. Google się z tym nie zgadza. Do pracy z terminalem i agentami programistycznymi Opus 5.5 ma dziś najmocniejsze liczby w tej trójce.

Nauka i matematyka

TestArgonAstraOpus 5.5
Terminal-Bench Science 0.157,6%68,1%63,3%
LABBench 288,8%85,4%73,1%
RiemannBench76,0%72,0%69,6%

Długi kontekst, obsługa komputera, multimodalność

TestArgonAstraOpus 5.5
GraphWalks do 128 tys.99,7%98,7%90,6%
GraphWalks 256 tys. - 1 mln84,2%71,8%66,8%
Agent’s Last Exam39,5%34,2%38,2%
OSWorld-2.0 (część offline)69,2%72,6%brak
Chartography71,6%71,0%66,3%
LVBench (długie wideo)91,7%87,5%83,7%

Przy OSWorld-2.0 Google zaznacza, że Anthropic podaje tylko wynik łączny dla dwóch części testu, więc Opusa w tym wierszu nie ma. Wyniki GraphWalks Google policzył sam dla wszystkich modeli.

Cyberbezpieczeństwo

TestArgonAstraOpus 5.5
CWE-bench v1 (łatanie luk)68,0%68,0%67,0%
Gray Swan IPI, skuteczność ataków (mniej = lepiej)0,7%8,5%1,0%

Wynik Gray Swan (odporność na ukryte polecenia w treściach, które czyta model) podaję za VentureBeat, który przytoczył dane z materiałów Google. W CWE-bench Google ogłosił remis z Astrą na pierwszym miejscu.

Bilans

Na 19 wierszy tabeli: Argon prowadzi w 13, remisuje w 1, Astra wygrywa w 3, Opus 5.5 w 2. Zaznaczam dwie rzeczy. Tabelę ułożył Google, więc to on wybrał testy, a zabrakło w niej popularnych SWE-bench, GPQA, Humanity’s Last Exam i ARC-AGI. Poza tym wyniki Argona nie zostały jeszcze sprawdzone niezależnie, bo model nie jest publicznie dostępny.

Ile kosztuje typowe zadanie

Mam to spisane w całości

Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.

Pobierz ebooki

Policzyłem koszt samego cennika, bez podatku, opłat za zapis do cache, narzędzi i trybów wsadowych. To obliczenie na stawkach, nie pomiar. Prawdziwy rachunek zależy od tego, ile tokenów myślenia zużyje model, a tego dla Argona nikt jeszcze nie zmierzył.

Zadanie 1: analiza długiego dokumentu

100 tys. tokenów wejścia (umowa albo raport), 5 tys. tokenów odpowiedzi.

ModelKoszt
Gemini 4 Argon, cena startowa0,25 USD
Gemini 4 Argon, cena docelowa0,50 USD
Claude Opus 5.50,50 USD
GPT-6 Astra1,25 USD
GPT-6.1 Sol (dla porównania, 2 / 10 USD)0,25 USD

Zadanie 2: sesja agenta programistycznego

Łącznie 2 mln tokenów wejścia, z czego 1,6 mln odczytane z cache i 0,4 mln bez cache, oraz 100 tys. tokenów wyjścia. Zakładam, że żadne pojedyncze zapytanie nie przekracza 272 tys. tokenów.

ModelWejścieCacheWyjścieRazem
Argon, cena startowa0,80 USD0,16 USD1,00 USD1,96 USD
Argon, cena docelowa1,60 USD0,32 USD2,00 USD3,92 USD
Claude Opus 5.51,60 USD0,32 USD2,00 USD3,92 USD
GPT-6 Astra4,00 USD1,60 USD5,00 USD10,60 USD

Zadanie 3: bardzo długa odpowiedź

50 tys. tokenów wejścia i 400 tys. tokenów wyjścia, np. duża migracja kodu. Tu liczy się limit: tylko Argon może to zrobić w jednej odpowiedzi. Astra i Opus 5.5 mają po 128 tys. tokenów wyjścia, więc potrzebowałyby co najmniej czterech wywołań, a każde kolejne ponownie wczytuje kontekst.

ModelKoszt samych tokenówUwagi
Argon, cena startowa4,10 USDJedna odpowiedź
Argon, cena docelowa8,20 USDJedna odpowiedź
Claude Opus 5.5od 8,20 USDMinimum 4 wywołania, więcej tokenów wejścia
GPT-6 Astraod 20,50 USDMinimum 4 wywołania, więcej tokenów wejścia

Wniosek z liczb: w cenie startowej Argon jest najtańszym z trzech flagowców na każdym zadaniu. Po okresie startowym zrównuje się z Opusem 5.5, a Astra zostaje około 2,5 raza droższa od obu. Google nie podał, jak długo potrwa cena startowa.

Który model wybrać dziś

  • Praca biurowa, finanse, prawo, długie dokumenty - na liczbach Google Argon, ale dziś go nie dostaniesz. Z dostępnych Opus 5.5 ma wyższe wyniki niż Astra w Vals Index i Finance Agent przy niższej cenie.
  • Agenci w terminalu i programowanie - Opus 5.5 (Terminal-Bench 4.0, PostTrainBench), a przy trudnym kodzie z FrontierSWE także Astra.
  • Nauka z użyciem terminala i obsługa komputera - Astra (Terminal-Bench Science, OSWorld-2.0).
  • Bardzo długie odpowiedzi w jednym przebiegu - tylko Argon ma limit powyżej 128 tys. tokenów.

To wnioski z tabel producentów. Własne porównanie po polsku robię w Laboratorium: Astra i Opus 5.5 są już przetestowane, Argona dopiszę, gdy tylko trafi do API. Wszystkie modele w jednym miejscu znajdziesz na stronie modele AI, a o reszcie rodziny Google piszę w przewodniku po Gemini.

Najczęstsze pytania

Czy Gemini 4 Argon jest lepszy od GPT-6 Astra?

W tabeli Google tak, w 13 z 19 testów, ale Astra wygrywa w FrontierSWE v2, Terminal-Bench Science i OSWorld-2.0. Niezależnych pomiarów jeszcze nie ma.

Czy Gemini 4 Argon jest lepszy od Claude Opus 5.5?

W pracy biurowej, długim kontekście i wideo tak. W Terminal-Bench 4.0 i PostTrainBench wygrywa Opus 5.5.

Który z trzech modeli jest najtańszy?

W cenie startowej Argon: 2 / 10 USD za milion tokenów. Po okresie startowym Argon i Opus 5.5 kosztują tyle samo, 4 / 20 USD. Astra jest najdroższa, 10 / 50 USD.

Czemu w porównaniu nie ma GPT-6.1 Sol?

Google nie zestawił z nim Argona w swojej tabeli, więc nie mam wspólnych, opublikowanych wyników. Sol pojawia się tylko w obliczeniu kosztu, bo ma identyczną cenę jak startowy Argon.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Czy Gemini 4 Argon jest lepszy od GPT-6 Astra?

W tabeli Google tak - Argon wygrywa w 13 z 19 testów, ale Astra bije go w FrontierSWE v2 różnicą 10,5 punktu, Terminal-Bench Science i OSWorld-2.0. Niezależnych pomiarów jeszcze nie ma, bo model nie jest publicznie dostępny.

Ile kosztuje GPT-6 Astra w porównaniu do Claude Opus 5.5?

Astra kosztuje 10/50 USD za milion tokenów wejścia/wyjścia, podczas gdy Opus 5.5 to 4/20 USD - Astra jest więc ok. 2,5 raza droższa. W sesji agenta programistycznego z 2 mln tokenów wejścia Astra wychodzi 10,60 USD, a Opus 5.5 tylko 3,92 USD.

Który model ma największe okno wyjściowe?

Tylko Gemini 4 Argon obsługuje do 1 mln tokenów wyjścia w jednej odpowiedzi. GPT-6 Astra i Claude Opus 5.5 mają limit 128 tys. tokenów, co przy dużych zadaniach wymaga co najmniej czterech oddzielnych wywołań.

Kiedy Gemini 4 Argon będzie dostępny publicznie?

Google nie podał daty publicznego udostępnienia - model jest na razie dostępny tylko w programie Fairwind i GoogleAPI. Artykuł sprawdzono 30 września 2026, a wyniki Argona nie zostały jeszcze zweryfikowane niezależnie.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›