Który model AI pisze najlepiej po polsku? Zmierzyłem dziesięć. Zwycięzca kosztuje 32 razy mniej niż drugi zwycięzca
👁 116 przeczytań
- GLM 5.3 Flash wygrał test polszczyzny z kompletem 6 na 6 punktów i kosztem 0,00092 USD, czyli 32 razy taniej niż Claude Fable 5.1 z tym samym wynikiem.
- Najtrudniejszym zadaniem okazał się liczebnik zbiorowy - trzy modele podały błędne formy 'pięciu dzieci' lub 'pięć dzieci' zamiast poprawnego 'pięcioro dzieci'.
- Llama 4 Maverick i Ministral 14B zdobyły po 3 punkty na 6, przy czym Llama gubiła ogonki, pisząc np. 'tysiacem' i 'Wloszech' zamiast poprawnych form.
Pytanie „który model AI jest najlepszy po polsku” pada wszędzie i wszędzie dostaje odpowiedź w postaci opinii. Postanowiłem je zmierzyć. Wybrałem sześć zadań, w których jest jedna poprawna odpowiedź, więc ocena nie zależy od niczyjego gustu, i puściłem je przez dziesięć modeli. Wynik jest zaskakujący nie tym, kto wygrał, tylko tym, ile ta wygrana kosztowała.
Model, który zdobył komplet punktów, kosztował 0,00092 dolara. Drugi z kompletem punktów kosztował 0,02948, czyli trzydzieści dwa razy więcej.
Wyniki
| Model | Punkty | Koszt testu | Czas łącznie |
|---|---|---|---|
| GLM 5.3 Flash | 6 / 6 | 0,00092 USD | 40,4 s |
| GPT-6 Astra | 6 / 6 | 0,02371 USD | 18,3 s |
| Claude Fable 5.1 | 6 / 6 | 0,02948 USD | 40,4 s |
| Kimi K3 | 6 / 6 | 0,02685 USD | 43,7 s |
| Gemini 3.8 Flash | 5 / 6 | 0,00862 USD | 42,5 s |
| DeepSeek V4 Flash | 5 / 6 | 0,00080 USD | 48,4 s |
| Claude Haiku 4.5 | 4 / 6 | 0,00188 USD | 8,9 s |
| Qwen3.8 27B | 4 / 6 | 0,00962 USD | 136,2 s |
| Ministral 14B | 3 / 6 | 0,00013 USD | 5,3 s |
| Llama 4 Maverick | 3 / 6 | 0,00019 USD | 25,4 s |
Co dokładnie sprawdzałem
Zadania dobrałem tak, żeby każde miało jedną poprawną odpowiedź, którą da się sprawdzić maszynowo. Żadnych ocen w rodzaju „brzmi naturalnie”.
- Dopełniacz liczby mnogiej od słowa „skrzypce”. Poprawnie: skrzypiec.
- Narzędnik od słowa „tysiąc”. Poprawnie: tysiącem.
- Miejscownik od nazwy „Włochy”. Poprawnie: we Włoszech.
- Liczebnik zbiorowy: pięć plus dzieci. Poprawnie: pięcioro dzieci.
- Kwota słownie: 2347 złotych. Poprawnie: dwa tysiące trzysta czterdzieści siedem.
- Wykonanie polecenia: wyjaśnienie w dokładnie trzech zdaniach, bez listy i bez wstępu. Liczyłem kropki.
Gdzie modele się wykładają
Liczebnik zbiorowy to najtrudniejsze zadanie w całym zestawie. Trzy modele podały „pięciu dzieci” albo „pięć dzieci” zamiast „pięcioro dzieci”. To jest forma, którą Polacy znają odruchowo, a modele trenowane głównie na angielskim gubią, bo w angielskim nie ma czego zgubić.
Ogonki. Llama 4 Maverick napisała „tysiacem”, „Wloszech” i „piecioro”. Formy gramatyczne były poprawne, zapis nie. Punktu nie przyznałem, bo polszczyzna bez ogonków to polszczyzna z błędami, ale warto wiedzieć, że to inny rodzaj potknięcia niż nieznajomość odmiany. Claude Haiku 4.5 pogubił ogonki w części odpowiedzi, choć w innych je stawiał.
Ministral 14B napisał „Dwie tysiące trzysta czterdzieści siedem złotych”. To jedyny błąd w tym zadaniu w całej dziesiątce.
Trzy modele oddały pustą odpowiedź
To osobne zjawisko, które warto opisać, bo w praktyce boli bardziej niż błąd gramatyczny. promptowy.com/google-deepmind-gemini-3-8-flash-i-flash-cyber/">Gemini 3.8 Flash, DeepSeek V4 Flash i Qwen3.8 27B w jednym zadaniu każdy zwróciły status 200 i pustą treść. Nie błąd, nie komunikat, po prostu nic.
Przyczyna jest niemal na pewno ta sama we wszystkich trzech przypadkach: modele z rozumowaniem przepaliły cały przydzielony budżet tokenów na myślenie i zabrakło im miejsca na odpowiedź. Limit wynosił 1 600 tokenów, co przy zwykłym zadaniu jest z zapasem, a przy modelu, który myśli na głos, potrafi się skończyć w połowie.
Tych przypadków nie policzyłem jako błędów merytorycznych, tylko jako brak odpowiedzi. Dlatego Gemini i DeepSeek mają 5 na 6, a nie 5 z jednym błędem. W kodzie, który ma działać bez nadzoru, taka pusta odpowiedź jest jednak awarią i trzeba ją obsłużyć.
Najciekawsza liczba: cena za ten sam wynik
Cztery modele zdobyły komplet punktów. Różnica w rachunku między nimi wygląda tak:
- GLM 5.3 Flash: 0,00092 USD
- GPT-6 Astra: 0,02371 USD, czyli 26 razy więcej
- Kimi K3: 0,02685 USD, czyli 29 razy więcej
- Claude Fable 5.1: 0,02948 USD, czyli 32 razy więcej
Przy jednym zapytaniu to różnica bez znaczenia. Przy automacie, który wykonuje tysiąc takich zestawów dziennie, przez miesiąc robi się z tego 27,60 dolara przy GLM 5.3 Flash i 884 dolary przy Fable 5.1, przy identycznej poprawności na tych zadaniach.
Zastrzeżenie, które trzeba dopisać uczciwie: sześć zadań gramatycznych to nie jest pełna ocena modelu. Sprawdziłem poprawność polszczyzny i wykonanie polecenia, a nie rozumowanie, wiedzę czy pisanie długich tekstów. Przy trudniejszych zadaniach droższe modele mogą odjechać i zwykle odjeżdżają. Ale jeśli Twoje zadanie to poprawna polszczyzna i trzymanie się instrukcji, płacenie trzydzieści razy więcej nie kupuje nic.
Najszybszy nie znaczy najlepszy
Claude Haiku 4.5 zrobił cały zestaw w 8,9 sekundy, czyli dwa razy szybciej niż GPT-6 Astra i piętnaście razy szybciej niż Qwen3.8 27B, któremu zajęło to 136 sekund. Zapłacił za to dwoma błędami.
To jest realny wybór, przed którym staje się przy budowaniu czegokolwiek: model szybki i tani, który myli się co trzecie zadanie, albo model wolniejszy z kompletem punktów. Przy podpowiedziach w interfejsie wybrałbym pierwszy, przy generowaniu tekstu, który idzie do publikacji, drugi.
Który wybrać do czego
Do polskiego tekstu bez nadzoru: GLM 5.3 Flash. Komplet punktów przy najniższym rachunku w całej stawce z kompletem. Uwaga na jedną rzecz: w tym modelu nie da się wyłączyć rozumowania, co rozpisałem w osobnym tekście o GLM 5.3.
Do zadań, gdzie liczy się czas odpowiedzi: GPT-6 Astra. Komplet punktów i najlepszy czas wśród modeli bezbłędnych. Szczegóły w przewodniku po GPT-6 Astra.
Do najtańszego przetwarzania masowego: DeepSeek V4 Flash. Pięć punktów na sześć za 0,0008 dolara, przy czym brakujący punkt to pusta odpowiedź, nie błąd.
Czego bym nie brał do polskiego tekstu: Llamy 4 Maverick i Ministrala 14B. Trzy punkty na sześć to za mało, a gubienie ogonków dyskwalifikuje przy czymkolwiek, co ma trafić do czytelnika.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Jak to powtórzyć
Wszystkie zapytania poszły przez jednego pośrednika, z tym samym poleceniem i limitem 1 600 tokenów, po jednym podejściu na zadanie. Koszty odczytałem z pola rozliczeniowego zwracanego przez interfejs programistyczny, a nie z cennika, bo cena z karty modelu potrafi się rozminąć z rachunkiem nawet czternastokrotnie.
Jedno podejście na zadanie to za mało, żeby mówić o pewnym rankingu, i tego nie twierdzę. Twierdzę, że przy pierwszym podejściu wyszło tak, jak wyszło, i że różnica trzydziestu dwóch razy w cenie za ten sam wynik jest zbyt duża, żeby ją zignorować.
Kolejne pomiary dokładam na bieżąco w benchmarkach, a dane techniczne modeli trzymam w atlasie.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który model AI najlepiej pisze po polsku?
Cztery modele zdobyły komplet 6 na 6 punktów: GLM 5.3 Flash, GPT-6 Astra, Claude Fable 5.1 i Kimi K3. Najtańszy spośród nich to GLM 5.3 Flash z kosztem 0,00092 USD za cały zestaw testów.
Ile kosztuje przetwarzanie polskich tekstów przez AI przy dużej skali?
Przy tysiącu zestawów zadań dziennie przez miesiąc GLM 5.3 Flash kosztuje 27,60 USD, a Claude Fable 5.1 - 884 USD, przy identycznej poprawności na tych zadaniach. Różnica między najtańszym a najdroższym modelem z kompletem punktów wynosi 32 razy.
Dlaczego niektóre modele AI zwróciły pustą odpowiedź zamiast błędu?
Gemini 3.8 Flash, DeepSeek V4 Flash i Qwen3.8 27B zwróciły status 200 z pustą treścią, bo modele z rozumowaniem przepaliły cały budżet 1 600 tokenów na myślenie. Zabrakło im miejsca na wygenerowanie właściwej odpowiedzi.
Który model AI jest najszybszy w przetwarzaniu polskich zadań?
Claude Haiku 4.5 wykonał cały zestaw w 8,9 sekundy, czyli dwa razy szybciej niż GPT-6 Astra i 15 razy szybciej niż Qwen3.8 27B, który potrzebował 136 sekund. Haiku zdobył jednak tylko 4 punkty na 6, bo gubił ogonki w części odpowiedzi.
