✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Haiku 5.5 vs GPT-6 Luna vs Gemini 3.8 Flash: który tani model wybrać

Trzy tanie modele na tych samych 13 zadaniach po polsku, realny koszt polskiego tekstu, szybkość i 5 scenariuszy, który wybrać.

6 min czytania
claude-haiku-5-5-vs-gpt-6-luna-gemini-flash

👁 131 przeczytań

// w skrócie
  • Spośród trzech tanich modeli najlepszy wynik po polsku osiągnął GPT-6 Luna z 82,8 pkt na 100 w teście 13 zadań.
  • Luna jest też najtańsza przy 1000 polskich zapytań - ok. 0,50 USD, bo jej tokenizer generuje tylko 210 tokenów tam, gdzie Haiku 5.5 produkuje 341.
  • Claude Haiku 5.5 wyraźnie prowadzi w pracy agentowej: OSWorld 2.1 - 72,4% wobec 48,9% Luny, a Terminal-Bench 4.0 - 39,2% wobec 16,4%.

Claude Haiku 5.5, GPT-6 Luna i Gemini 3.8 Flash to dziś trzy najciekawsze tanie modele AI. Wszystkie puściłem przez te same 13 zadań po polsku w moim Laboratorium: wygrała Luna (82,8 pkt), przed Gemini 3.8 Flash (79,4) i Haiku 5.5 (76,8). Ale wynik w teście to nie wszystko - liczy się też rachunek za polski tekst, szybkość i to, do czego model ma służyć. Pełny opis nowego modelu Anthropic jest w przewodniku Claude Haiku 5.5, a tu zestawiam go z konkurencją i podpowiadam, który wybrać.

Stan na 8 października 2026

  • Najlepszy po polsku: GPT-6 Luna - 82,8 pkt na 100.
  • Najtańszy za 1000 polskich zapytań: GPT-6 Luna - ok. 0,50 USD; Haiku 5.5 - ok. 0,81 USD; Gemini 3.8 Flash - ok. 3,39 USD.
  • Najlepszy w pracy agentowej (obsługa komputera, podagenci): Claude Haiku 5.5.
  • Najdokładniejszy w korekcie i faktach o Polsce: Gemini 3.8 Flash (30/30 i 48/48).
  • Haczyk Haiku 5.5: ten sam polski tekst to u niego o 34% więcej tokenów niż w Haiku 4.5.

Wyniki z Laboratorium: 13 zadań po polsku

Test robię zawsze tak samo: 13 poleceń (artykuł, opis produktu, mail, post na LinkedIn, opowiadanie, tytuły, streszczenie, tłumaczenie, dwie korekty i dwa quizy o Polsce), te same limity tokenów, dostęp przez OpenRouter. Odpowiedzi oceniają sędziowie z innych firm niż testowany model (GPT-6 Sol i Gemini 3.1 Pro), a wynik kalibruję stałymi modelami-kotwicami, żeby rundy z różnych dni dało się porównać. Haiku 5.5 sprawdziłem 8 października, dzień po premierze.

// taniej niż u producentaw magazynie
Google AI Gemini Pro + Google Drive 5 TB - 18 miesięcy
Google AI Gemini Pro + Google Drive 5 TB - 18 miesięcyVoucher, którym włączasz pakiet Google AI Pro na 18 miesięcy na własnym koncie Google.kinetyka.pl - mój sklep z rocznymi dostępami do narzędzi AI
170 zł-91%zamiast 1 800 zł9,44 zł / mies.Kup w Kinetyce →
ModelWynik (na 100)Trudna korektaTrudny quiz o PolsceKoszt 13 zadań
GPT-6 Luna82,829/3048/480,004 USD
Gemini 3.8 Flash79,430/3048/480,036 USD
Claude Haiku 5.576,826/3043/480,011 USD
DeepSeek V4.1 Flash72,930/3047/480,023 USD
Claude Haiku 4.5 (dla porównania)59,223/3040/480,069 USD

Co z tego wynika:

  • Haiku 5.5 zrobił największy skok w historii linii: +17,6 pkt wobec Haiku 4.5. Mail, post na LinkedIn i opowiadanie dostały od sędziów po 8,2-8,3 pkt na 10.
  • Najsłabiej wypadło streszczenie w 5 punktach (5,8 pkt): Haiku przekroczył limit 80 słów i zrobił błąd składni, który wytknęli obaj sędziowie.
  • Luna wygrywa ogólnym wynikiem, ale ma najsłabsze zadanie z całej czwórki: opis produktu ocenili na 5,3 pkt.
  • Gemini 3.8 Flash i DeepSeek V4.1 Flash nie zrobiły ani jednego błędu w trudnej korekcie. Haiku 5.5 przepuścił 4 z 30.

Pełną tabelę modeli prowadzę w Laboratorium Promptowego, a odpowiedzi obok siebie przeczytasz w Arenie modeli AI po polsku.

Ceny: cennik to nie rachunek

Na papierze Haiku 5.5 i Luna kosztują identycznie: 0,10 USD za milion tokenów wejścia i 0,50 USD za milion wyjścia. Gemini 3.8 Flash jest 7,5 razy droższy. W praktyce różnice robi tokenizer, czyli to, na ile kawałków model tnie polski tekst.

ModelCena API (1 mln tokenów)Tokeny na ten sam polski tekst*1000 polskich zapytańOkno
GPT-6 Luna0,10 / 0,50 USD210ok. 0,50 USD1,05 mln
Claude Haiku 5.50,10 / 0,50 USD341ok. 0,81 USD1 mln
DeepSeek V4.1 Flash0,30 / 1,20 USD225ok. 1,31 USD1 mln
Gemini 3.8 Flash0,75 / 3,75 USD192ok. 3,39 USD1 mln
Claude Haiku 4.51 / 5 USD254ok. 5,98 USD200 tys.

* Ten sam fragment polskiego tekstu, który w GPT po angielsku zajmuje 144 tokeny. Koszt 1000 zapytań liczę w Rankingu cen AI dla typowego zapytania: 400 tokenów polecenia i 600 tokenów odpowiedzi (w przeliczeniu na angielski), pomnożone przez polski współczynnik danego modelu. Ceny bez VAT, z 8 października 2026.

Trzy rzeczy, o których łatwo zapomnieć:

  • Polski tokenizer Haiku 5.5. Zmierzyłem 341 tokenów tam, gdzie Haiku 4.5 liczył 254 - o 34% więcej. Anthropic w dokumentacji podaje ok. 30% dla tekstu ogólnie. Dlatego przy tej samej cenie za token Haiku wychodzi o ok. 60% drożej niż Luna.
  • Myślenie też jest płatne. Na ustawieniu max Haiku 5.5 zużywa według Artificial Analysis ok. 162 tys. tokenów wyjścia na zadanie, trzy razy więcej niż Luna. U mnie na effort „low” myślał przez 12,4 tys. tokenów na 13 zadań.
  • Cena Gemini 3.8 Flash jest promocyjna do 31 grudnia 2026. Po tej dacie Google może ją zmienić.

Haiku ma za to najtańszy cache: odczyt kosztuje 0,01 USD za milion tokenów. Jeśli wysyłasz ten sam długi system prompt tysiące razy, ta pozycja potrafi zjeść różnicę w tokenizerze.

Szybkość

Mierzę czas 9 zadań tekstowych z tego samego zestawu, przez OpenRouter, czyli z realnym narzutem sieci i kolejek.

ModelCzas 9 zadań
GPT-6 Luna39 s
Gemini 3.8 Flash69 s
Claude Haiku 5.573 s
DeepSeek V4.1 Flash365 s

Luna jest prawie dwa razy szybsza od Haiku 5.5, bo krócej myśli i pisze zwięźlej. Haiku 5.5 generował średnio 164 tokeny na sekundę (Haiku 4.5 - 101, Sonnet 5.5 - 98), ale tokenów na sekundę nie porównuję między firmami, bo każda ma inny tokenizer. DeepSeek V4.1 Flash przy tym ruchu na OpenRouterze był zdecydowanie najwolniejszy - do czatu na żywo bym go nie brał.

Benchmarki producentów i pomiary niezależne

Mój test mierzy polszczyznę. Do pracy agentowej trzeba patrzeć gdzie indziej:

  • OSWorld 2.1 (obsługa komputera, dane Anthropic): Haiku 5.5 72,4%, Luna 48,9%.
  • Terminal-Bench 4.0 (kod w terminalu, dane Anthropic): Haiku 5.5 39,2%, Luna 16,4%.
  • Indeks Artificial Analysis: Haiku 5.5 43 pkt (na max), Gemini 3.8 Flash 41, Luna 38.
  • Halucynacje w AA-Omniscience: Haiku 5.5 40%, Luna 77% - Haiku znacznie częściej przyznaje, że czegoś nie wie.

To liczby producenta i jednej niezależnej firmy, nie moje. Ale kierunek jest jasny: Luna lepiej pisze po polsku, Haiku lepiej działa jako agent.

Który tani model do czego - 5 scenariuszy

  1. Masowe polskie teksty (opisy, posty, newslettery) - GPT-6 Luna. Najwyższy wynik, najniższy rachunek za 1000 zapytań i najszybsza odpowiedź. Jedyny słaby punkt to opisy produktów - tam daj jej przykład stylu w poleceniu. Więcej w tekście o GPT-6 Luna.
  2. Agent w przeglądarce, podagenci w Claude Code, automatyzacje z narzędziami - Claude Haiku 5.5. Wyraźna przewaga w OSWorld i Terminal-Bench, okno 1 mln tokenów i mniej zmyślania. Jak ustawić go w Claude Code, opisałem w tekście Haiku 5.5 za darmo i w Claude Code.
  3. Korekta, fakty, treści, w których błąd kosztuje - Gemini 3.8 Flash. 30/30 w trudnej korekcie i 48/48 w quizie o Polsce. Jest najdroższy z czwórki, ale nadal prawie 5 razy tańszy od Sonneta 5.5. Szczegóły w przewodniku po Gemini.
  4. Firma już na API Anthropic: klasyfikacja, wyciąganie danych, routing - Claude Haiku 5.5. Przepięcie z Haiku 4.5 to jedna zmiana identyfikatora i rachunek niższy o 75-90%. Nie trzeba nowej umowy, nowego klucza ani przepisywania integracji.
  5. Otwarte wagi, własny serwer, praca wsadowa bez pośpiechu - DeepSeek V4.1 Flash. Bezbłędna korekta i 47/48 w quizie, a do tego model z otwartymi wagami. Wolny przez API, więc tylko tam, gdzie czas odpowiedzi nie gra roli. Więcej w tekście o DeepSeek.

Za darmo w czacie

  • Claude Haiku 5.5 - w darmowym planie Claude (strona, iOS, Android), z wyborem modelu.
  • Gemini 3.8 Flash - w aplikacji Gemini.
  • GPT-6 Luna - w API, w ChatGPT Work i w Codex. Darmowego dostępu w czacie nie potwierdziłem.
  • DeepSeek V4.1 Flash - przez API i OpenRouter.

Mój wybór

Do polskich tekstów w dużej skali biorę Lunę - jest lepsza i tańsza. Haiku 5.5 to dla mnie model do pracy agentowej i do wszystkiego, co już stoi na Claude: podagenci, porządkowanie danych, długie dokumenty w oknie 1 mln tokenów. Gemini 3.8 Flash trzymam do korekty i sprawdzania faktów. Przed wdrożeniem i tak policz koszt na 50-100 własnych zapytaniach - przy polskim tekście różnica w tokenizerze potrafi odwrócić kolejność z cennika.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła

Sprawdziłem 8 października 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Który tani model AI najlepiej pisze po polsku - Haiku 5.5, GPT-6 Luna czy Gemini 3.8 Flash?

Najlepiej po polsku wypadła GPT-6 Luna z wynikiem 82,8 pkt na 100 w teście 13 zadań. Gemini 3.8 Flash uzyskał 79,4 pkt, a Claude Haiku 5.5 - 76,8 pkt.

Dlaczego Claude Haiku 5.5 jest droższy w praktyce niż wynika z cennika?

Haiku 5.5 ma gorszy tokenizer dla polskiego tekstu - generuje 341 tokenów tam, gdzie Luna potrzebuje 210, czyli o 34% więcej niż nawet poprzedni Haiku 4.5. Przy identycznej cenie za token (0,10/0,50 USD za milion) Haiku 5.5 wychodzi ok. 60% drożej niż Luna przy polskich zapytaniach.

Do jakich zadań Claude Haiku 5.5 jest lepszy od GPT-6 Luna?

Haiku 5.5 wyraźnie wyprzedza Lunę w pracy agentowej: w benchmarku OSWorld 2.1 osiąga 72,4% wobec 48,9% Luny, a w Terminal-Bench 4.0 - 39,2% wobec 16,4%. Haiku 5.5 rzadziej też halucynuje - wskaźnik w AA-Omniscience wynosi 40% wobec 77% u Luny.

Czy Gemini 3.8 Flash będzie droższy po 31 grudnia 2026 roku?

Aktualna cena Gemini 3.8 Flash (0,75/3,75 USD za milion tokenów) jest promocyjna do 31 grudnia 2026 - po tej dacie Google może ją zmienić. Już teraz jest to najdroższa opcja z czwórki: 1000 polskich zapytań kosztuje ok. 3,39 USD wobec 0,50 USD za Lunę.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›