Haiku 5.5 vs GPT-6 Luna vs Gemini 3.8 Flash: który tani model wybrać
Trzy tanie modele na tych samych 13 zadaniach po polsku, realny koszt polskiego tekstu, szybkość i 5 scenariuszy, który wybrać.

👁 131 przeczytań
- Spośród trzech tanich modeli najlepszy wynik po polsku osiągnął GPT-6 Luna z 82,8 pkt na 100 w teście 13 zadań.
- Luna jest też najtańsza przy 1000 polskich zapytań - ok. 0,50 USD, bo jej tokenizer generuje tylko 210 tokenów tam, gdzie Haiku 5.5 produkuje 341.
- Claude Haiku 5.5 wyraźnie prowadzi w pracy agentowej: OSWorld 2.1 - 72,4% wobec 48,9% Luny, a Terminal-Bench 4.0 - 39,2% wobec 16,4%.
Claude Haiku 5.5, GPT-6 Luna i Gemini 3.8 Flash to dziś trzy najciekawsze tanie modele AI. Wszystkie puściłem przez te same 13 zadań po polsku w moim Laboratorium: wygrała Luna (82,8 pkt), przed Gemini 3.8 Flash (79,4) i Haiku 5.5 (76,8). Ale wynik w teście to nie wszystko - liczy się też rachunek za polski tekst, szybkość i to, do czego model ma służyć. Pełny opis nowego modelu Anthropic jest w przewodniku Claude Haiku 5.5, a tu zestawiam go z konkurencją i podpowiadam, który wybrać.
Stan na 8 października 2026
- Najlepszy po polsku: GPT-6 Luna - 82,8 pkt na 100.
- Najtańszy za 1000 polskich zapytań: GPT-6 Luna - ok. 0,50 USD; Haiku 5.5 - ok. 0,81 USD; Gemini 3.8 Flash - ok. 3,39 USD.
- Najlepszy w pracy agentowej (obsługa komputera, podagenci): Claude Haiku 5.5.
- Najdokładniejszy w korekcie i faktach o Polsce: Gemini 3.8 Flash (30/30 i 48/48).
- Haczyk Haiku 5.5: ten sam polski tekst to u niego o 34% więcej tokenów niż w Haiku 4.5.
Wyniki z Laboratorium: 13 zadań po polsku
Test robię zawsze tak samo: 13 poleceń (artykuł, opis produktu, mail, post na LinkedIn, opowiadanie, tytuły, streszczenie, tłumaczenie, dwie korekty i dwa quizy o Polsce), te same limity tokenów, dostęp przez OpenRouter. Odpowiedzi oceniają sędziowie z innych firm niż testowany model (GPT-6 Sol i Gemini 3.1 Pro), a wynik kalibruję stałymi modelami-kotwicami, żeby rundy z różnych dni dało się porównać. Haiku 5.5 sprawdziłem 8 października, dzień po premierze.

| Model | Wynik (na 100) | Trudna korekta | Trudny quiz o Polsce | Koszt 13 zadań |
|---|---|---|---|---|
| GPT-6 Luna | 82,8 | 29/30 | 48/48 | 0,004 USD |
| Gemini 3.8 Flash | 79,4 | 30/30 | 48/48 | 0,036 USD |
| Claude Haiku 5.5 | 76,8 | 26/30 | 43/48 | 0,011 USD |
| DeepSeek V4.1 Flash | 72,9 | 30/30 | 47/48 | 0,023 USD |
| Claude Haiku 4.5 (dla porównania) | 59,2 | 23/30 | 40/48 | 0,069 USD |
Co z tego wynika:
- Haiku 5.5 zrobił największy skok w historii linii: +17,6 pkt wobec Haiku 4.5. Mail, post na LinkedIn i opowiadanie dostały od sędziów po 8,2-8,3 pkt na 10.
- Najsłabiej wypadło streszczenie w 5 punktach (5,8 pkt): Haiku przekroczył limit 80 słów i zrobił błąd składni, który wytknęli obaj sędziowie.
- Luna wygrywa ogólnym wynikiem, ale ma najsłabsze zadanie z całej czwórki: opis produktu ocenili na 5,3 pkt.
- Gemini 3.8 Flash i DeepSeek V4.1 Flash nie zrobiły ani jednego błędu w trudnej korekcie. Haiku 5.5 przepuścił 4 z 30.
Pełną tabelę modeli prowadzę w Laboratorium Promptowego, a odpowiedzi obok siebie przeczytasz w Arenie modeli AI po polsku.
Ceny: cennik to nie rachunek
Na papierze Haiku 5.5 i Luna kosztują identycznie: 0,10 USD za milion tokenów wejścia i 0,50 USD za milion wyjścia. Gemini 3.8 Flash jest 7,5 razy droższy. W praktyce różnice robi tokenizer, czyli to, na ile kawałków model tnie polski tekst.
| Model | Cena API (1 mln tokenów) | Tokeny na ten sam polski tekst* | 1000 polskich zapytań | Okno |
|---|---|---|---|---|
| GPT-6 Luna | 0,10 / 0,50 USD | 210 | ok. 0,50 USD | 1,05 mln |
| Claude Haiku 5.5 | 0,10 / 0,50 USD | 341 | ok. 0,81 USD | 1 mln |
| DeepSeek V4.1 Flash | 0,30 / 1,20 USD | 225 | ok. 1,31 USD | 1 mln |
| Gemini 3.8 Flash | 0,75 / 3,75 USD | 192 | ok. 3,39 USD | 1 mln |
| Claude Haiku 4.5 | 1 / 5 USD | 254 | ok. 5,98 USD | 200 tys. |
* Ten sam fragment polskiego tekstu, który w GPT po angielsku zajmuje 144 tokeny. Koszt 1000 zapytań liczę w Rankingu cen AI dla typowego zapytania: 400 tokenów polecenia i 600 tokenów odpowiedzi (w przeliczeniu na angielski), pomnożone przez polski współczynnik danego modelu. Ceny bez VAT, z 8 października 2026.
Trzy rzeczy, o których łatwo zapomnieć:
- Polski tokenizer Haiku 5.5. Zmierzyłem 341 tokenów tam, gdzie Haiku 4.5 liczył 254 - o 34% więcej. Anthropic w dokumentacji podaje ok. 30% dla tekstu ogólnie. Dlatego przy tej samej cenie za token Haiku wychodzi o ok. 60% drożej niż Luna.
- Myślenie też jest płatne. Na ustawieniu max Haiku 5.5 zużywa według Artificial Analysis ok. 162 tys. tokenów wyjścia na zadanie, trzy razy więcej niż Luna. U mnie na effort „low” myślał przez 12,4 tys. tokenów na 13 zadań.
- Cena Gemini 3.8 Flash jest promocyjna do 31 grudnia 2026. Po tej dacie Google może ją zmienić.
Haiku ma za to najtańszy cache: odczyt kosztuje 0,01 USD za milion tokenów. Jeśli wysyłasz ten sam długi system prompt tysiące razy, ta pozycja potrafi zjeść różnicę w tokenizerze.
Szybkość
Mierzę czas 9 zadań tekstowych z tego samego zestawu, przez OpenRouter, czyli z realnym narzutem sieci i kolejek.
| Model | Czas 9 zadań |
|---|---|
| GPT-6 Luna | 39 s |
| Gemini 3.8 Flash | 69 s |
| Claude Haiku 5.5 | 73 s |
| DeepSeek V4.1 Flash | 365 s |
Luna jest prawie dwa razy szybsza od Haiku 5.5, bo krócej myśli i pisze zwięźlej. Haiku 5.5 generował średnio 164 tokeny na sekundę (Haiku 4.5 - 101, Sonnet 5.5 - 98), ale tokenów na sekundę nie porównuję między firmami, bo każda ma inny tokenizer. DeepSeek V4.1 Flash przy tym ruchu na OpenRouterze był zdecydowanie najwolniejszy - do czatu na żywo bym go nie brał.
Benchmarki producentów i pomiary niezależne
Mój test mierzy polszczyznę. Do pracy agentowej trzeba patrzeć gdzie indziej:
- OSWorld 2.1 (obsługa komputera, dane Anthropic): Haiku 5.5 72,4%, Luna 48,9%.
- Terminal-Bench 4.0 (kod w terminalu, dane Anthropic): Haiku 5.5 39,2%, Luna 16,4%.
- Indeks Artificial Analysis: Haiku 5.5 43 pkt (na max), Gemini 3.8 Flash 41, Luna 38.
- Halucynacje w AA-Omniscience: Haiku 5.5 40%, Luna 77% - Haiku znacznie częściej przyznaje, że czegoś nie wie.
To liczby producenta i jednej niezależnej firmy, nie moje. Ale kierunek jest jasny: Luna lepiej pisze po polsku, Haiku lepiej działa jako agent.
Który tani model do czego - 5 scenariuszy
- Masowe polskie teksty (opisy, posty, newslettery) - GPT-6 Luna. Najwyższy wynik, najniższy rachunek za 1000 zapytań i najszybsza odpowiedź. Jedyny słaby punkt to opisy produktów - tam daj jej przykład stylu w poleceniu. Więcej w tekście o GPT-6 Luna.
- Agent w przeglądarce, podagenci w Claude Code, automatyzacje z narzędziami - Claude Haiku 5.5. Wyraźna przewaga w OSWorld i Terminal-Bench, okno 1 mln tokenów i mniej zmyślania. Jak ustawić go w Claude Code, opisałem w tekście Haiku 5.5 za darmo i w Claude Code.
- Korekta, fakty, treści, w których błąd kosztuje - Gemini 3.8 Flash. 30/30 w trudnej korekcie i 48/48 w quizie o Polsce. Jest najdroższy z czwórki, ale nadal prawie 5 razy tańszy od Sonneta 5.5. Szczegóły w przewodniku po Gemini.
- Firma już na API Anthropic: klasyfikacja, wyciąganie danych, routing - Claude Haiku 5.5. Przepięcie z Haiku 4.5 to jedna zmiana identyfikatora i rachunek niższy o 75-90%. Nie trzeba nowej umowy, nowego klucza ani przepisywania integracji.
- Otwarte wagi, własny serwer, praca wsadowa bez pośpiechu - DeepSeek V4.1 Flash. Bezbłędna korekta i 47/48 w quizie, a do tego model z otwartymi wagami. Wolny przez API, więc tylko tam, gdzie czas odpowiedzi nie gra roli. Więcej w tekście o DeepSeek.
Za darmo w czacie
- Claude Haiku 5.5 - w darmowym planie Claude (strona, iOS, Android), z wyborem modelu.
- Gemini 3.8 Flash - w aplikacji Gemini.
- GPT-6 Luna - w API, w ChatGPT Work i w Codex. Darmowego dostępu w czacie nie potwierdziłem.
- DeepSeek V4.1 Flash - przez API i OpenRouter.
Mój wybór
Do polskich tekstów w dużej skali biorę Lunę - jest lepsza i tańsza. Haiku 5.5 to dla mnie model do pracy agentowej i do wszystkiego, co już stoi na Claude: podagenci, porządkowanie danych, długie dokumenty w oknie 1 mln tokenów. Gemini 3.8 Flash trzymam do korekty i sprawdzania faktów. Przed wdrożeniem i tak policz koszt na 50-100 własnych zapytaniach - przy polskim tekście różnica w tokenizerze potrafi odwrócić kolejność z cennika.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Źródła
- Test własny: Laboratorium promptowy.com, 13 zadań, sędziowie GPT-6 Sol i Gemini 3.1 Pro, runda Haiku 5.5 z 8 października 2026.
- Ceny i współczynniki tokenów: Ranking cen AI, aktualizacja z 8 października 2026.
- Anthropic, Introducing Claude Haiku 5.5 - ceny i benchmarki (deklaracje producenta).
- Anthropic, Claude Haiku 5.5 - dokumentacja - tokenizer, okno, effort.
- Artificial Analysis o Claude Haiku 5.5 - indeks, zużycie tokenów, halucynacje.
Sprawdziłem 8 października 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który tani model AI najlepiej pisze po polsku - Haiku 5.5, GPT-6 Luna czy Gemini 3.8 Flash?
Najlepiej po polsku wypadła GPT-6 Luna z wynikiem 82,8 pkt na 100 w teście 13 zadań. Gemini 3.8 Flash uzyskał 79,4 pkt, a Claude Haiku 5.5 - 76,8 pkt.
Dlaczego Claude Haiku 5.5 jest droższy w praktyce niż wynika z cennika?
Haiku 5.5 ma gorszy tokenizer dla polskiego tekstu - generuje 341 tokenów tam, gdzie Luna potrzebuje 210, czyli o 34% więcej niż nawet poprzedni Haiku 4.5. Przy identycznej cenie za token (0,10/0,50 USD za milion) Haiku 5.5 wychodzi ok. 60% drożej niż Luna przy polskich zapytaniach.
Do jakich zadań Claude Haiku 5.5 jest lepszy od GPT-6 Luna?
Haiku 5.5 wyraźnie wyprzedza Lunę w pracy agentowej: w benchmarku OSWorld 2.1 osiąga 72,4% wobec 48,9% Luny, a w Terminal-Bench 4.0 - 39,2% wobec 16,4%. Haiku 5.5 rzadziej też halucynuje - wskaźnik w AA-Omniscience wynosi 40% wobec 77% u Luny.
Czy Gemini 3.8 Flash będzie droższy po 31 grudnia 2026 roku?
Aktualna cena Gemini 3.8 Flash (0,75/3,75 USD za milion tokenów) jest promocyjna do 31 grudnia 2026 - po tej dacie Google może ją zmienić. Już teraz jest to najdroższa opcja z czwórki: 1000 polskich zapytań kosztuje ok. 3,39 USD wobec 0,50 USD za Lunę.
