Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5: benchmarki i ceny
Argon wygrywa 13 z 19 testów Google i na start kosztuje piątą część Astry. W programowaniu to jednak remis, a dostępny dziś nie jest wcale.

👁 156 przeczytań
- Gemini 4 Argon wygrywa w 13 z 19 testów opublikowanych przez Google, ale model nie jest jeszcze publicznie dostępny - tylko w programie Fairwind i GoogleAPI.
- W cenie startowej Argon kosztuje 2/10 USD za milion tokenów, co czyni go najtańszym z trójki - Astra jest ok. 2,5 raza droższa nawet po zakończeniu promocji.
- Opus 5.5 ma najlepsze wyniki w testach Terminal-Bench 4.0 i PostTrainBench, co czyni go najsilniejszym z dostępnych modeli do pracy z terminalem i agentami programistycznymi.
Gemini 4 Argon wygrywa z GPT-6 Astra i Claude Opus 5.5 w 13 z 19 testów opublikowanych przez Google, a w cenie startowej kosztuje jedną piątą stawek Astry. Przegrywa za to w dwóch z czterech testów programistycznych i jako jedyny z trójki nie jest dziś dostępny. Zestawiłem wyłącznie dane opublikowane przez producentów i policzyłem koszt trzech typowych zadań.
Trzy modele w jednej tabeli
| Cecha | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| Producent, premiera | Google, 30.09.2026 | OpenAI, 3.09.2026 | Anthropic, 22.09.2026 |
| Wejście / wyjście za 1 mln tokenów | 2 / 10 USD na start, potem 4 / 20 USD | 10 / 50 USD (powyżej 272 tys. wejścia 20 / 75 USD) | 4 / 20 USD |
| Wejście z cache za 1 mln | 0,10 USD na start, potem 0,20 USD | 1 USD | 0,20 USD |
| Okno wejścia | Google nie podał | 1 050 000 tokenów | 1 mln tokenów |
| Maks. wyjście | 1 mln tokenów | 128 tys. | 128 tys. |
| Dostępność dziś | Tylko program Fairwind i Google | API, ChatGPT od Plus (Work, Codex) | API, aplikacja Claude, chmury |
Ceny Astry i Opusa to stawki standardowe z cenników producentów, bez podatku. Ceny Argona pochodzą z ogłoszenia Google. W oficjalnym cenniku Gemini API modelu jeszcze nie ma. Szczegóły każdego modelu opisuję osobno: Gemini 4 Argon, GPT-6 Astra i Claude Opus 5.5.

Benchmarki: kto wygrywa w czym
Poniżej pełna tabela z dokumentu metodologicznego Google DeepMind. Wyniki Argona Google policzył sam przy najwyższym ustawieniu myślenia, wyniki Astry i Opusa pochodzą z publicznych rankingów albo z kart modeli producentów. Pogrubiam najlepszy wynik w trójce.
Praca biurowa
| Test | Argon | Astra | Opus 5.5 |
|---|---|---|---|
| Vals Index | 68,9% | 63,1% | 67,0% |
| AutomationBench (Zapier) | 51,3% | 41,4% | 42,5% |
| Vals Finance Agent v2 | 65,4% | 53,5% | 58,6% |
| Harvey Legal Agent Benchmark | 19,6% | 5,4% | 3,8% |
Tu Argon ma najwyraźniejszą przewagę. W teście prawniczym Harvey ma pięciokrotnie wyższy wynik niż Opus 5.5, choć wszystkie trzy modele są daleko od połowy skali.
Programowanie i inżynieria ML
| Test | Argon | Astra | Opus 5.5 |
|---|---|---|---|
| DeepSWE v1.1 | 77,9% | 74,1% | 74,2% |
| FrontierSWE v2 | 55,0% | 65,5% | 62,3% |
| Vibe Code Bench | 91,9% | 89,6% | 90,3% |
| Terminal-Bench 4.0 | 57,4% | 58,2% | 66,4% |
| PostTrainBench | 45,3% | 44,3% | 49,3% |
Remis w praktyce. Argon wygrywa w DeepSWE i Vibe Code Bench, ale w FrontierSWE v2 traci do Astry 10,5 punktu, a w Terminal-Bench 4.0 do Opusa 9 punktów. Do tego Bloomberg, cytowany przez Techmeme, podał, że według części pracowników Google model radzi sobie gorzej w realnych zadaniach programistycznych niż w benchmarkach. Google się z tym nie zgadza. Do pracy z terminalem i agentami programistycznymi Opus 5.5 ma dziś najmocniejsze liczby w tej trójce.
Nauka i matematyka
| Test | Argon | Astra | Opus 5.5 |
|---|---|---|---|
| Terminal-Bench Science 0.1 | 57,6% | 68,1% | 63,3% |
| LABBench 2 | 88,8% | 85,4% | 73,1% |
| RiemannBench | 76,0% | 72,0% | 69,6% |
Długi kontekst, obsługa komputera, multimodalność
| Test | Argon | Astra | Opus 5.5 |
|---|---|---|---|
| GraphWalks do 128 tys. | 99,7% | 98,7% | 90,6% |
| GraphWalks 256 tys. - 1 mln | 84,2% | 71,8% | 66,8% |
| Agent’s Last Exam | 39,5% | 34,2% | 38,2% |
| OSWorld-2.0 (część offline) | 69,2% | 72,6% | brak |
| Chartography | 71,6% | 71,0% | 66,3% |
| LVBench (długie wideo) | 91,7% | 87,5% | 83,7% |
Przy OSWorld-2.0 Google zaznacza, że Anthropic podaje tylko wynik łączny dla dwóch części testu, więc Opusa w tym wierszu nie ma. Wyniki GraphWalks Google policzył sam dla wszystkich modeli.
Cyberbezpieczeństwo
| Test | Argon | Astra | Opus 5.5 |
|---|---|---|---|
| CWE-bench v1 (łatanie luk) | 68,0% | 68,0% | 67,0% |
| Gray Swan IPI, skuteczność ataków (mniej = lepiej) | 0,7% | 8,5% | 1,0% |
Wynik Gray Swan (odporność na ukryte polecenia w treściach, które czyta model) podaję za VentureBeat, który przytoczył dane z materiałów Google. W CWE-bench Google ogłosił remis z Astrą na pierwszym miejscu.
Bilans
Na 19 wierszy tabeli: Argon prowadzi w 13, remisuje w 1, Astra wygrywa w 3, Opus 5.5 w 2. Zaznaczam dwie rzeczy. Tabelę ułożył Google, więc to on wybrał testy, a zabrakło w niej popularnych SWE-bench, GPQA, Humanity’s Last Exam i ARC-AGI. Poza tym wyniki Argona nie zostały jeszcze sprawdzone niezależnie, bo model nie jest publicznie dostępny.
Ile kosztuje typowe zadanie
Mam to spisane w całości
Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.
Policzyłem koszt samego cennika, bez podatku, opłat za zapis do cache, narzędzi i trybów wsadowych. To obliczenie na stawkach, nie pomiar. Prawdziwy rachunek zależy od tego, ile tokenów myślenia zużyje model, a tego dla Argona nikt jeszcze nie zmierzył.
Zadanie 1: analiza długiego dokumentu
100 tys. tokenów wejścia (umowa albo raport), 5 tys. tokenów odpowiedzi.
| Model | Koszt |
|---|---|
| Gemini 4 Argon, cena startowa | 0,25 USD |
| Gemini 4 Argon, cena docelowa | 0,50 USD |
| Claude Opus 5.5 | 0,50 USD |
| GPT-6 Astra | 1,25 USD |
| GPT-6.1 Sol (dla porównania, 2 / 10 USD) | 0,25 USD |
Zadanie 2: sesja agenta programistycznego
Łącznie 2 mln tokenów wejścia, z czego 1,6 mln odczytane z cache i 0,4 mln bez cache, oraz 100 tys. tokenów wyjścia. Zakładam, że żadne pojedyncze zapytanie nie przekracza 272 tys. tokenów.
| Model | Wejście | Cache | Wyjście | Razem |
|---|---|---|---|---|
| Argon, cena startowa | 0,80 USD | 0,16 USD | 1,00 USD | 1,96 USD |
| Argon, cena docelowa | 1,60 USD | 0,32 USD | 2,00 USD | 3,92 USD |
| Claude Opus 5.5 | 1,60 USD | 0,32 USD | 2,00 USD | 3,92 USD |
| GPT-6 Astra | 4,00 USD | 1,60 USD | 5,00 USD | 10,60 USD |
Zadanie 3: bardzo długa odpowiedź
50 tys. tokenów wejścia i 400 tys. tokenów wyjścia, np. duża migracja kodu. Tu liczy się limit: tylko Argon może to zrobić w jednej odpowiedzi. Astra i Opus 5.5 mają po 128 tys. tokenów wyjścia, więc potrzebowałyby co najmniej czterech wywołań, a każde kolejne ponownie wczytuje kontekst.
| Model | Koszt samych tokenów | Uwagi |
|---|---|---|
| Argon, cena startowa | 4,10 USD | Jedna odpowiedź |
| Argon, cena docelowa | 8,20 USD | Jedna odpowiedź |
| Claude Opus 5.5 | od 8,20 USD | Minimum 4 wywołania, więcej tokenów wejścia |
| GPT-6 Astra | od 20,50 USD | Minimum 4 wywołania, więcej tokenów wejścia |
Wniosek z liczb: w cenie startowej Argon jest najtańszym z trzech flagowców na każdym zadaniu. Po okresie startowym zrównuje się z Opusem 5.5, a Astra zostaje około 2,5 raza droższa od obu. Google nie podał, jak długo potrwa cena startowa.
Który model wybrać dziś
- Praca biurowa, finanse, prawo, długie dokumenty - na liczbach Google Argon, ale dziś go nie dostaniesz. Z dostępnych Opus 5.5 ma wyższe wyniki niż Astra w Vals Index i Finance Agent przy niższej cenie.
- Agenci w terminalu i programowanie - Opus 5.5 (Terminal-Bench 4.0, PostTrainBench), a przy trudnym kodzie z FrontierSWE także Astra.
- Nauka z użyciem terminala i obsługa komputera - Astra (Terminal-Bench Science, OSWorld-2.0).
- Bardzo długie odpowiedzi w jednym przebiegu - tylko Argon ma limit powyżej 128 tys. tokenów.
To wnioski z tabel producentów. Własne porównanie po polsku robię w Laboratorium: Astra i Opus 5.5 są już przetestowane, Argona dopiszę, gdy tylko trafi do API. Wszystkie modele w jednym miejscu znajdziesz na stronie modele AI, a o reszcie rodziny Google piszę w przewodniku po Gemini.
Najczęstsze pytania
Czy Gemini 4 Argon jest lepszy od GPT-6 Astra?
W tabeli Google tak, w 13 z 19 testów, ale Astra wygrywa w FrontierSWE v2, Terminal-Bench Science i OSWorld-2.0. Niezależnych pomiarów jeszcze nie ma.
Czy Gemini 4 Argon jest lepszy od Claude Opus 5.5?
W pracy biurowej, długim kontekście i wideo tak. W Terminal-Bench 4.0 i PostTrainBench wygrywa Opus 5.5.
Który z trzech modeli jest najtańszy?
W cenie startowej Argon: 2 / 10 USD za milion tokenów. Po okresie startowym Argon i Opus 5.5 kosztują tyle samo, 4 / 20 USD. Astra jest najdroższa, 10 / 50 USD.
Czemu w porównaniu nie ma GPT-6.1 Sol?
Google nie zestawił z nim Argona w swojej tabeli, więc nie mam wspólnych, opublikowanych wyników. Sol pojawia się tylko w obliczeniu kosztu, bo ma identyczną cenę jak startowy Argon.
Źródła
- Google DeepMind: Gemini 4 Argon Model evaluationstorage.googleapis.com
- Google: Gemini 4 Argonblog.google
- Cennik API OpenAIopenai.com
- Cennik Anthropicanthropic.com
- Cennik Gemini APIai.google.dev
- VentureBeatventurebeat.com
- Techmeme (za Bloombergiem)techmeme.com
Sprawdzone 30 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Czy Gemini 4 Argon jest lepszy od GPT-6 Astra?
W tabeli Google tak - Argon wygrywa w 13 z 19 testów, ale Astra bije go w FrontierSWE v2 różnicą 10,5 punktu, Terminal-Bench Science i OSWorld-2.0. Niezależnych pomiarów jeszcze nie ma, bo model nie jest publicznie dostępny.
Ile kosztuje GPT-6 Astra w porównaniu do Claude Opus 5.5?
Astra kosztuje 10/50 USD za milion tokenów wejścia/wyjścia, podczas gdy Opus 5.5 to 4/20 USD - Astra jest więc ok. 2,5 raza droższa. W sesji agenta programistycznego z 2 mln tokenów wejścia Astra wychodzi 10,60 USD, a Opus 5.5 tylko 3,92 USD.
Który model ma największe okno wyjściowe?
Tylko Gemini 4 Argon obsługuje do 1 mln tokenów wyjścia w jednej odpowiedzi. GPT-6 Astra i Claude Opus 5.5 mają limit 128 tys. tokenów, co przy dużych zadaniach wymaga co najmniej czterech oddzielnych wywołań.
Kiedy Gemini 4 Argon będzie dostępny publicznie?
Google nie podał daty publicznego udostępnienia - model jest na razie dostępny tylko w programie Fairwind i GoogleAPI. Artykuł sprawdzono 30 września 2026, a wyniki Argona nie zostały jeszcze zweryfikowane niezależnie.
