ChatGPT, Claude czy Gemini? Trzy modele, trzy różne zastosowania
Który model AI wybrać? Po ludzku rozkładamy ChatGPT, Claude i Gemini - w czym każdy jest najlepszy i czy warto płacić.

👁 422 przeczytań
ChatGPT, Claude czy Gemini? Do przeszukiwania polskich dokumentów zacząłbym od Gemini 3.8 Flash. Do zadania łączącego kod i ścisłe instrukcje od GPT-6 Astra. Claude Fable 5.1 sprawdziłbym jako alternatywę przy trudnym problemie, a w codziennej pracy z Claude najpierw przetestowałbym Opusa. To kolejność prób wyprowadzona z pomiarów i kosztów. Nie ogłaszam modelu, który ma wygrywać każde zadanie.
Stan dokumentacji i cenników sprawdziłem 11.09.2026. W wynikach zachowuję daty poszczególnych pomiarów. Porównanie aplikacji wymaga dodatkowej ostrożności: nazwa usługi nie wskazuje jednoznacznie modelu, który odpowiada. Dlatego odróżniam Gemini jako aplikację od Gemini 3.8 Flash w API, tak samo jak ChatGPT od Astry.

Najpierw zadanie, potem firma
Nie przypisuję firmom charakterów. Hasło „Claude do pisania, ChatGPT do kodu, Gemini do szukania” może brzmieć poręcznie, lecz nie mówi, co sprawdzono. Potrzebuję konkretnego materiału, sposobu oceny i warunku, po którym uznam wybór za nietrafiony.
| Zadanie | Pierwsza próba | Podstawa | Kiedy zmieniam wybór |
|---|---|---|---|
| Odnalezienie informacji w polskim dokumencie | Gemini 3.8 Flash | Komplet trafień i niższy rachunek niż Astry w mojej próbie | Gdy nie potrafi wskazać prawidłowego fragmentu |
| Kod, tłumaczenie oraz wymagany format | GPT-6 Astra | Najwyższa punktacja w moim mieszanym zestawie | Gdy własny test ujawnia błąd albo koszt jest nieakceptowalny |
| Korekta polszczyzny | Astra albo Fable | Remis w zadaniach gramatycznych | Gdy model zmienia znaczenie lub nie zachowuje mojego stylu |
| Przygotowanie szkicu małym kosztem | Gemini 3.8 Flash | Niższy koszt mojego pomiaru artykułu | Gdy koszt redakcji znosi oszczędność |
| Trudna praca w środowisku Claude | Opus, potem Fable | Zalecenie producenta, nie własny wynik porównawczy Opusa | Gdy droższy model nie usuwa konkretnego błędu |
Szczegóły pomiarów podaję niżej. Ostatni wiersz opieram na dokumentacji Anthropic, sprawdzonej 11.09.2026. Nie dopisuję Opusowi wyników z testu, w którym nie uczestniczył.
Co pokazał ten sam zestaw poleceń
W mieszanym teście sprawdzałem kod, tłumaczenia i trzymanie się instrukcji. Po wykryciu błędu w ocenianiu poprawiłem punktację. To ważne: nawet test automatyczny wymaga kontroli, jeśli klucz odpowiedzi jest błędny. Poniżej podaję wyniki po tej korekcie.
| Model | Punkty | Koszt zestawu | Czas zestawu |
|---|---|---|---|
| GPT-6 Astra | 9/9 | 0,04955 USD | 35,3 s |
| Claude Fable 5.1 | 8/9 | 0,11503 USD | 81,0 s |
| Gemini 3.8 Flash | 8/9 | 0,03957 USD | 72,2 s |
Źródło: mój test opublikowany 09.09.2026. Sprawdzenie danych: 11.09.2026. To koszty wykonanych zapytań, nie cena abonamentu ani uniwersalna wycena podobnego zadania.
Astra jest tutaj moim punktem startowym, bo skończyła z najwyższą punktacją. Gemini stanowi rozsądną alternatywę kosztową do sprawdzenia na tym samym materiale. Nie twierdzę, że Fable gorzej programuje w każdym języku. Wynik łączy różne rodzaje zadań, a trudny projekt może wymagać umiejętności, których zestaw nie obejmował.
Długie dokumenty: tutaj zmieniam kolejność
Przy wyszukiwaniu informacji patrzę najpierw na poprawność odnalezionego fragmentu. W mojej próbie Gemini i Astra znalazły ukryte zdanie na każdej sprawdzanej głębokości. Koszt oraz czas wyglądały jednak inaczej niż w teście mieszanym.
| Model | Trafienia | Koszt pytań | Średni czas odpowiedzi |
|---|---|---|---|
| Gemini 3.8 Flash | 3/3 | 0,05889 USD | 3,3 s |
| GPT-6 Astra | 3/3 | 1,00205 USD | 2,0 s |
| Claude Fable 5.1 | Brak pomiaru w tym zestawie | Brak pomiaru | Brak pomiaru |
Źródło: test okna kontekstu z 10.09.2026, sprawdzony 11.09.2026. Koszt obejmuje cały zestaw pytań, a czas jest średnią. Nie mnożę ani nie dzielę tych wartości, żeby uzyskać pozornie dokładną prognozę dla innego archiwum.
Do odnajdywania zdań wybrałbym więc na początek Gemini. Astrę rozważyłbym, gdy priorytetem jest opóźnienie i własny pomiar potwierdzi przewagę czasu. Przy analizie sprzecznych zapisów umowy przeprowadziłbym nową próbę. Odnalezienie kodu w tekście nie sprawdza interpretacji zależności między dokumentami.
Wynik nie dowodzi również działania na pełnym oknie kontekstu. Google podaje dla API Gemini 3.8 Flash limit wejścia 1 048 576 tokenów oraz wyjścia 65 536 tokenów. To parametry producenta, sprawdzone 11.09.2026 w karcie modelu. Nie przedstawiam ich jako objętości mojego testu.
Polski tekst: oddzielam gramatykę od pisania
W teście gramatyki z 09.09.2026 Astra i Fable uzyskały po 6/6 punktów, a Gemini 5/6. Sprawdzenie: 11.09.2026. Gemini straciło punkt przez pustą odpowiedź, więc nie nazywam tego błędem gramatycznym. Przy pracy wymagającej kompletnego wyniku zaczynam od modeli, które oddały wszystkie poprawne odpowiedzi. Nadal sam sprawdzam ich tekst.
Przy artykule sprawdzam coś innego. W pomiarze z 10.09.2026 Gemini napisało 1032 słowa za 0,01207 USD, Astra 906 słów za 0,11228 USD, a Fable 886 słów za 0,18913 USD. Źródło: koszt artykułu w moim teście, sprawdzony 11.09.2026.
Niższy rachunek Gemini uzasadnia próbę przy szkicach, które sam redaguję. Nie uzasadnia publikowania odpowiedzi bez sprawdzenia. Jeśli muszę usunąć dopowiedzenia, poprawić źródła i przepisać strukturę, oceniam całą pracę. W kosztach projektu uwzględniam własną redakcję, choć nie dopisuję jej sztucznej ceny do tabeli pomiarów.
Stawki API: porównuję identyczny rodzaj rozliczenia
Poniższa tabela dotyczy standardowych zapytań tekstowych bez pamięci podręcznej i bez zniżek wsadowych. Nie obejmuje dodatkowych narzędzi. Nie opisuje subskrypcji aplikacji. Podaję walutę źródła i datę, bo właśnie tutaj łatwo powielić nieaktualną liczbę.
| Model | Wejście, USD za milion tokenów | Wyjście, USD za milion tokenów | Źródło i sprawdzenie |
|---|---|---|---|
| GPT-6 Astra | 10 | 50 | OpenAI, 11.09.2026 |
| Claude Fable 5.1 | 10 | 50 | Anthropic, 11.09.2026 |
| Gemini 3.8 Flash | 0,75 | 3,75 | Google, 11.09.2026 |
Stawki Google są ofertą wprowadzającą obowiązującą do 31.12.2026 według cennika sprawdzonego 11.09.2026. W Astrze długie wejście przekraczające 272 000 tokenów uruchamia wyższe stawki całego żądania. Źródło i sprawdzenie: OpenAI, 11.09.2026. Nie stosuję tabeli bez sprawdzenia tych warunków.
Przed uruchomieniem automatyzacji zapisuję faktyczne użycie z odpowiedzi API. Krótki tekst końcowy nie musi oznaczać małego zużycia rozumowania. Podobnie plik o tej samej liczbie znaków nie musi mieć tej samej liczby tokenów w każdym modelu. Dlatego koszt mierzę po wykonaniu zadania, a budżet ustawiam przed nim.
Aplikacje i plany: czego nie należy utożsamiać z API
Mam to spisane w całości
Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.
ChatGPT Plus ma w polskim cenniku 99,99 zł miesięcznie, a w pomocy ogólnej 20 USD miesięcznie według pomocy OpenAI, sprawdzonej 11.09.2026. Astra jest w tym planie dostępna w Work i Codex, co nie oznacza dostępu do GPT-6 Pro w zwykłym czacie. Potwierdzenie: zasady dostępu, 11.09.2026.
Claude Pro kosztuje 20 USD przy rozliczeniu miesięcznym; Fable wymaga dodatkowych kredytów. Źródła: cennik i warunki modelu, 11.09.2026. Sama subskrypcja nie zamienia go w model bez ograniczeń.
Na polskiej stronie planów Google, otwartej w przeglądarce 11.09.2026, Google AI Plus kosztuje 23,99 zł miesięcznie, Google AI Pro 97,99 zł miesięcznie, a Google AI Ultra od 469,99 zł miesięcznie. Otwarta tego dnia tabela limitów aplikacji nie wymieniała wprost Gemini 3.8 Flash, więc nie przypisuję temu modelowi limitów starszej pozycji.
To konkretna granica porównania. Potwierdzam model w dokumentacji API, ale nie obiecuję jego dostępności w każdym polskim abonamencie. Przed zakupem sprawdzam nazwę modelu na własnym koncie i końcową kwotę płatności. Brak tej informacji jest powodem do weryfikacji, nie miejscem na domysł.
Pliki i analiza danych: wybieram również narzędzie wokół modelu
Jeżeli pracuję na tabeli, interesuje mnie możliwość odtworzenia obliczeń. Proszę o wskazanie użytych kolumn, obsługę pustych wartości i kod wykonujący obliczenie. Potem porównuję wynik z danymi wejściowymi. Nie wystarcza mi prawdopodobnie wyglądający wykres.
Gemini 3.8 Flash według karty sprawdzonej 11.09.2026 przyjmuje także obraz, audio, wideo i PDF, a zwraca tekst. Rozważyłbym je przy analizie materiału mieszanego. Nie oznacza to, że wykonałem porównawczy test odczytywania każdego formatu albo że ten sam model generuje obraz i dźwięk.
W Astrze i Claude również rozdzielam treść odpowiedzi od pracy wykonanej przez otoczenie modelu. Otwarty plik, dostęp do narzędzia i wykonany skrypt to sprawdzalne elementy procesu. Bez nich prośba o analizę może skończyć się opisem tego, jak analiza powinna wyglądać.
Jak wybieram między remisem a niższym kosztem
Załóżmy, że mam przygotować odpowiedź na pytanie z dokumentacji produktu. Najpierw zapisuję oczekiwany fragment źródła. Jeśli Gemini wskazuje go poprawnie, nie zmieniam modelu wyłącznie dlatego, że Astra zajęła wyższe miejsce w innym teście. Jeżeli potrzebuję jeszcze zastosowania wyjątku i wygenerowania kodu, porównuję cały taki przebieg od początku.
To samo robię przy pisaniu. Szkic może być tani, ale jeśli muszę go skrócić i sprawdzić każde twierdzenie, sam rachunek API opisuje tylko część pracy. Zapisuję więc, co poprawiłem. Dzięki temu widzę, czy zmiana modelu usuwa powtarzający się problem, czy tylko daje tekst, który na pierwszy rzut oka bardziej mi odpowiada.
Gdy modele mają tę samą punktację, czytam odpowiedzi. Jeden może nie wykonać formatu, drugi nie odpowiedzieć, a trzeci podać zły fakt. Te sytuacje wymagają innych zabezpieczeń. Nie chcę, żeby wspólna liczba punktów zasłoniła różnicę istotną dla mojego zadania.
W aplikacji sprawdzam również sam przebieg pracy. Czy muszę ponownie dodawać plik? Czy mogę pobrać wynik w potrzebnym formacie? Czy model korzysta z udostępnionego materiału? To moje kryteria do sprawdzenia na koncie, nie deklaracje, że konkretna firma zawsze zapewnia wygodniejszą obsługę.
Nie łączę pomiarów z różnych dni w jedną średnią. Jeżeli w starszym porównaniu widzę inny wynik polszczyzny, wracam do listy zadań. Bez potwierdzenia wspólnej procedury nie nazywam różnicy poprawą ani regresem modelu. Przy kolejnym zakupie bardziej pomaga mi zapisany materiał testowy niż pamięć o tym, który model ostatnio zrobił dobre wrażenie.
Gotowe polecenia do własnej próby
Przy porównaniu używam tego samego materiału i rozpoczynam nową rozmowę. Poniższe polecenia wklejam po dodaniu tekstu albo dokumentu. Są procedurą do wykonania, nie opisem testu, który już przeprowadziłem.
Znajdź w dodanym dokumencie warunki wypowiedzenia. Przy każdym podaj dosłowny fragment oraz jego lokalizację, jeśli jest dostępna. Oddziel warunek podstawowy od wyjątków. Jeśli dokument nie zawiera odpowiedzi, napisz to wprost. Nie korzystaj z wiedzy o podobnych dokumentach.Przeredaguj ostatni tekst z tej rozmowy na krótsze zdania. Zachowaj wszystkie fakty, liczby i zastrzeżenia. Nie dodawaj nowych informacji. Po poprawionej wersji wypisz miejsca, w których pierwotny sens był niejasny i wymaga mojej decyzji.Przeanalizuj dane dołączone do rozmowy. Najpierw opisz, które kolumny odczytałeś i jak potraktujesz braki. Następnie wykonaj obliczenia, jeśli masz odpowiednie narzędzie. Pokaż metodę i wynik. Jeśli nie możesz wykonać obliczeń, nie podawaj zgadywanych wartości.Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Czego się nie spodziewać i dla kogo który
Nie mam podstaw, żeby któremukolwiek modelowi przyznać ogólne pierwszeństwo w nauce, obsłudze klienta czy analizie biznesowej. Moje próby nie obejmują całej pracy w tych dziedzinach. Oczekuję więc sprawdzalnego wyniku na własnym materiale, a nie gwarancji wynikającej z miejsca w tabeli.
Gemini wybieram na początek do oszczędnego przeszukiwania tekstu i przygotowania szkicu. Astrę do zadania podobnego do mojego testu kodu oraz instrukcji. Fable sprawdzam przy trudnym problemie w środowisku Claude, szczególnie jeśli tańszy model nie wystarczył. Rozwinięcie wyboru według obowiązków opisuję w poradniku o modelu AI do pracy. Pozostaję przy rozwiązaniu, które przechodzi moją próbę za akceptowalny koszt.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


