🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 8 szt. albo Pro na rok 464 zł Kup teraz →
Przejdź do treści
Artykuły

Który model AI pisze najlepiej po polsku? Zmierzyłem dziesięć. Zwycięzca kosztuje 32 razy mniej niż drugi zwycięzca

5 min czytania
Punkty kontra koszt: dziesiec modeli AI na szesciu zadaniach z polskiej gramatyki

👁 116 przeczytań

// w skrócie
  • GLM 5.3 Flash wygrał test polszczyzny z kompletem 6 na 6 punktów i kosztem 0,00092 USD, czyli 32 razy taniej niż Claude Fable 5.1 z tym samym wynikiem.
  • Najtrudniejszym zadaniem okazał się liczebnik zbiorowy - trzy modele podały błędne formy 'pięciu dzieci' lub 'pięć dzieci' zamiast poprawnego 'pięcioro dzieci'.
  • Llama 4 Maverick i Ministral 14B zdobyły po 3 punkty na 6, przy czym Llama gubiła ogonki, pisząc np. 'tysiacem' i 'Wloszech' zamiast poprawnych form.

Pytanie „który model AI jest najlepszy po polsku” pada wszędzie i wszędzie dostaje odpowiedź w postaci opinii. Postanowiłem je zmierzyć. Wybrałem sześć zadań, w których jest jedna poprawna odpowiedź, więc ocena nie zależy od niczyjego gustu, i puściłem je przez dziesięć modeli. Wynik jest zaskakujący nie tym, kto wygrał, tylko tym, ile ta wygrana kosztowała.

Model, który zdobył komplet punktów, kosztował 0,00092 dolara. Drugi z kompletem punktów kosztował 0,02948, czyli trzydzieści dwa razy więcej.

Wyniki

Model Punkty Koszt testu Czas łącznie
GLM 5.3 Flash 6 / 6 0,00092 USD 40,4 s
GPT-6 Astra 6 / 6 0,02371 USD 18,3 s
Claude Fable 5.1 6 / 6 0,02948 USD 40,4 s
Kimi K3 6 / 6 0,02685 USD 43,7 s
Gemini 3.8 Flash 5 / 6 0,00862 USD 42,5 s
DeepSeek V4 Flash 5 / 6 0,00080 USD 48,4 s
Claude Haiku 4.5 4 / 6 0,00188 USD 8,9 s
Qwen3.8 27B 4 / 6 0,00962 USD 136,2 s
Ministral 14B 3 / 6 0,00013 USD 5,3 s
Llama 4 Maverick 3 / 6 0,00019 USD 25,4 s

Co dokładnie sprawdzałem

Zadania dobrałem tak, żeby każde miało jedną poprawną odpowiedź, którą da się sprawdzić maszynowo. Żadnych ocen w rodzaju „brzmi naturalnie”.

  1. Dopełniacz liczby mnogiej od słowa „skrzypce”. Poprawnie: skrzypiec.
  2. Narzędnik od słowa „tysiąc”. Poprawnie: tysiącem.
  3. Miejscownik od nazwy „Włochy”. Poprawnie: we Włoszech.
  4. Liczebnik zbiorowy: pięć plus dzieci. Poprawnie: pięcioro dzieci.
  5. Kwota słownie: 2347 złotych. Poprawnie: dwa tysiące trzysta czterdzieści siedem.
  6. Wykonanie polecenia: wyjaśnienie w dokładnie trzech zdaniach, bez listy i bez wstępu. Liczyłem kropki.

Gdzie modele się wykładają

Liczebnik zbiorowy to najtrudniejsze zadanie w całym zestawie. Trzy modele podały „pięciu dzieci” albo „pięć dzieci” zamiast „pięcioro dzieci”. To jest forma, którą Polacy znają odruchowo, a modele trenowane głównie na angielskim gubią, bo w angielskim nie ma czego zgubić.

Ogonki. Llama 4 Maverick napisała „tysiacem”, „Wloszech” i „piecioro”. Formy gramatyczne były poprawne, zapis nie. Punktu nie przyznałem, bo polszczyzna bez ogonków to polszczyzna z błędami, ale warto wiedzieć, że to inny rodzaj potknięcia niż nieznajomość odmiany. Claude Haiku 4.5 pogubił ogonki w części odpowiedzi, choć w innych je stawiał.

Ministral 14B napisał „Dwie tysiące trzysta czterdzieści siedem złotych”. To jedyny błąd w tym zadaniu w całej dziesiątce.

Trzy modele oddały pustą odpowiedź

To osobne zjawisko, które warto opisać, bo w praktyce boli bardziej niż błąd gramatyczny. promptowy.com/google-deepmind-gemini-3-8-flash-i-flash-cyber/">Gemini 3.8 Flash, DeepSeek V4 Flash i Qwen3.8 27B w jednym zadaniu każdy zwróciły status 200 i pustą treść. Nie błąd, nie komunikat, po prostu nic.

Przyczyna jest niemal na pewno ta sama we wszystkich trzech przypadkach: modele z rozumowaniem przepaliły cały przydzielony budżet tokenów na myślenie i zabrakło im miejsca na odpowiedź. Limit wynosił 1 600 tokenów, co przy zwykłym zadaniu jest z zapasem, a przy modelu, który myśli na głos, potrafi się skończyć w połowie.

Tych przypadków nie policzyłem jako błędów merytorycznych, tylko jako brak odpowiedzi. Dlatego Gemini i DeepSeek mają 5 na 6, a nie 5 z jednym błędem. W kodzie, który ma działać bez nadzoru, taka pusta odpowiedź jest jednak awarią i trzeba ją obsłużyć.

Najciekawsza liczba: cena za ten sam wynik

Cztery modele zdobyły komplet punktów. Różnica w rachunku między nimi wygląda tak:

  • GLM 5.3 Flash: 0,00092 USD
  • GPT-6 Astra: 0,02371 USD, czyli 26 razy więcej
  • Kimi K3: 0,02685 USD, czyli 29 razy więcej
  • Claude Fable 5.1: 0,02948 USD, czyli 32 razy więcej

Przy jednym zapytaniu to różnica bez znaczenia. Przy automacie, który wykonuje tysiąc takich zestawów dziennie, przez miesiąc robi się z tego 27,60 dolara przy GLM 5.3 Flash i 884 dolary przy Fable 5.1, przy identycznej poprawności na tych zadaniach.

Zastrzeżenie, które trzeba dopisać uczciwie: sześć zadań gramatycznych to nie jest pełna ocena modelu. Sprawdziłem poprawność polszczyzny i wykonanie polecenia, a nie rozumowanie, wiedzę czy pisanie długich tekstów. Przy trudniejszych zadaniach droższe modele mogą odjechać i zwykle odjeżdżają. Ale jeśli Twoje zadanie to poprawna polszczyzna i trzymanie się instrukcji, płacenie trzydzieści razy więcej nie kupuje nic.

Najszybszy nie znaczy najlepszy

Claude Haiku 4.5 zrobił cały zestaw w 8,9 sekundy, czyli dwa razy szybciej niż GPT-6 Astra i piętnaście razy szybciej niż Qwen3.8 27B, któremu zajęło to 136 sekund. Zapłacił za to dwoma błędami.

To jest realny wybór, przed którym staje się przy budowaniu czegokolwiek: model szybki i tani, który myli się co trzecie zadanie, albo model wolniejszy z kompletem punktów. Przy podpowiedziach w interfejsie wybrałbym pierwszy, przy generowaniu tekstu, który idzie do publikacji, drugi.

Który wybrać do czego

Do polskiego tekstu bez nadzoru: GLM 5.3 Flash. Komplet punktów przy najniższym rachunku w całej stawce z kompletem. Uwaga na jedną rzecz: w tym modelu nie da się wyłączyć rozumowania, co rozpisałem w osobnym tekście o GLM 5.3.

Do zadań, gdzie liczy się czas odpowiedzi: GPT-6 Astra. Komplet punktów i najlepszy czas wśród modeli bezbłędnych. Szczegóły w przewodniku po GPT-6 Astra.

Do najtańszego przetwarzania masowego: DeepSeek V4 Flash. Pięć punktów na sześć za 0,0008 dolara, przy czym brakujący punkt to pusta odpowiedź, nie błąd.

Czego bym nie brał do polskiego tekstu: Llamy 4 Maverick i Ministrala 14B. Trzy punkty na sześć to za mało, a gubienie ogonków dyskwalifikuje przy czymkolwiek, co ma trafić do czytelnika.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Jak to powtórzyć

Wszystkie zapytania poszły przez jednego pośrednika, z tym samym poleceniem i limitem 1 600 tokenów, po jednym podejściu na zadanie. Koszty odczytałem z pola rozliczeniowego zwracanego przez interfejs programistyczny, a nie z cennika, bo cena z karty modelu potrafi się rozminąć z rachunkiem nawet czternastokrotnie.

Jedno podejście na zadanie to za mało, żeby mówić o pewnym rankingu, i tego nie twierdzę. Twierdzę, że przy pierwszym podejściu wyszło tak, jak wyszło, i że różnica trzydziestu dwóch razy w cenie za ten sam wynik jest zbyt duża, żeby ją zignorować.

Kolejne pomiary dokładam na bieżąco w benchmarkach, a dane techniczne modeli trzymam w atlasie.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Który model AI najlepiej pisze po polsku?

Cztery modele zdobyły komplet 6 na 6 punktów: GLM 5.3 Flash, GPT-6 Astra, Claude Fable 5.1 i Kimi K3. Najtańszy spośród nich to GLM 5.3 Flash z kosztem 0,00092 USD za cały zestaw testów.

Ile kosztuje przetwarzanie polskich tekstów przez AI przy dużej skali?

Przy tysiącu zestawów zadań dziennie przez miesiąc GLM 5.3 Flash kosztuje 27,60 USD, a Claude Fable 5.1 - 884 USD, przy identycznej poprawności na tych zadaniach. Różnica między najtańszym a najdroższym modelem z kompletem punktów wynosi 32 razy.

Dlaczego niektóre modele AI zwróciły pustą odpowiedź zamiast błędu?

Gemini 3.8 Flash, DeepSeek V4 Flash i Qwen3.8 27B zwróciły status 200 z pustą treścią, bo modele z rozumowaniem przepaliły cały budżet 1 600 tokenów na myślenie. Zabrakło im miejsca na wygenerowanie właściwej odpowiedzi.

Który model AI jest najszybszy w przetwarzaniu polskich zadań?

Claude Haiku 4.5 wykonał cały zestaw w 8,9 sekundy, czyli dwa razy szybciej niż GPT-6 Astra i 15 razy szybciej niż Qwen3.8 27B, który potrzebował 136 sekund. Haiku zdobył jednak tylko 4 punkty na 6, bo gubił ogonki w części odpowiedzi.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro 440 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie