Ranking AI do pisania po polsku: 16 modeli, 9 zadań i ślepa ocena
Claude Opus 5.5 wygrał z wynikiem 90,1, ale GPT-6 Luna zrobiła 9 zadań za mniej niż grosz. Pełna tabela, cytaty z odpowiedzi i dokładna metodologia.

👁 117 przeczytań
- Claude Opus 5.5 wygrał ranking 16 modeli AI do pisania po polsku, zdobywając 90,1 na 100 punktów i najwyższą średnią sędziów wynoszącą 8,98 na 10.
- Najlepszy stosunek wyniku do ceny osiągnęła GPT-6 Luna: 82,8 pkt za 0,002 USD, czyli ok. 0,8 grosza za wszystkie 9 zadań pisarskich.
- Najsłabsze wyniki uzyskały Claude Haiku 4.5 (59,2 pkt), GLM-5.3 (64,4 pkt) i Mistral Medium 3.5 (68,0 pkt), który trzykrotnie oddał pustą odpowiedź.
Ranking AI do pisania po polsku odpowiada na pytanie, który model pisze najlepiej w naszym języku. 26 września 2026 roku dałem 16 modelom językowym te same 9 zadań pisarskich, od artykułu blogowego po przekład firmowego newslettera, a odpowiedzi ocenili trzej ślepi sędziowie i zestaw automatycznych reguł. Wygrał Claude Opus 5.5 z wynikiem 90,1 na 100. Najwięcej mówi jednak piąte miejsce: GPT-6 Luna zrobiła wszystkie dziewięć zadań za 0,002 USD, czyli za mniej niż grosz. Tym razem oceniali sędziowie, bo w tekstach nie ma jednej poprawnej odpowiedzi; poprzedni pomiar na zadaniach z jedną poprawną odpowiedzią objął 10 modeli.
W skrócie
Claude Opus 5.5 zdobył 90,1 pkt i najwyższą średnią sędziów (8,98 na 10), a w pięciu z dziewięciu zadań dostał najwyższą ocenę (w opowiadaniu ex aequo z GPT-6 Sol). Drugi GPT-6 Sol (86,4 pkt) kosztował prawie 7 razy mniej: 0,0358 USD wobec 0,2479 USD za 9 zadań. Najlepszy stosunek wyniku do ceny ma GPT-6 Luna: 82,8 pkt za 0,002 USD. Opus ma sens, gdy tekst ma wyjść bez poprawek; Sol i Luna, gdy piszesz dużo przez API. Do pisania po polsku nie wybrałbym Claude Haiku 4.5 (59,2 pkt), GLM-5.3 (64,4) ani Mistral Medium 3.5 (68,0), który przy okazji trzy razy oddał pustą odpowiedź.
Jak wyglądał test
Każdy z 16 modeli dostał te same polecenia przez OpenRouter, z tym samym ustawieniem rozumowania (effort=low) i domyślną temperaturą. Każde zadanie wykonał raz; tylko przy pustej odpowiedzi powtarzałem próbę z wyższym limitem. Oto dziewięć zadań pisarskich:
- T1 Artykuł - ok. 500 słów o obniżaniu rachunku za prąd w bloku, min. 3 śródtytuły, zakaz zmyślania cen.
- T2 Opis produktu - czajnik Nordvik K17, akapit 120-150 słów i 5 korzyści, wyłącznie z karty produktu.
- T3 Mail - odpowiedź na skargę klienta, do 120 słów, nowy termin 3 października i kod PRZEPRASZAMY10.
- T4 LinkedIn - post 120-160 słów o roku prowadzenia sklepu z ceramiką, bez emoji, najwyżej 3 hashtagi na końcu.
- T5 Opowiadanie - 300-350 słów, realizm magiczny, blok z wielkiej płyty, bez słowa „nagle”.
- T6 Tytuły SEO - 10 tytułów do 60 znaków z dokładną frazą „odkurzacz bezworkowy”.
- T7 Streszczenie - notatka z zarządu w dokładnie 5 punktach, do 80 słów, bez dopisków.
- T8 Prosto - inflacja dla dwunastolatka, 100-130 słów, bez „PKB” i „stóp procentowych”.
- T9 Tłumaczenie - angielski newsletter pełen idiomów, bez tłumaczenia ich dosłownie.
W tym samym przebiegu modele robiły też korektę dwóch tekstów i quiz o Polsce. Te wyniki opisałem osobno: test korekty i 94 pytania o Polskę. Całą serię zbiera Laboratorium Promptowego.
Ranking: pełna tabela
Wynik łączny to w 70% średnia ocen sędziów, w 20% odsetek spełnionych reguł z polecenia i w 10% higiena tekstu (długie pauzy i wata słowna). Koszt i czas dotyczą 9 zadań pisarskich, przeliczenie po kursie NBP 3,857 zł za dolara.
| # | Model | Wynik | Sędziowie (1-10) | Poprawność | Naturalność | Wykonanie | Reguły | Koszt USD | Koszt zł | Czas (s) |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 | 90,1 | 8,98 | 9,89 | 8,50 | 8,56 | 25/26 | 0,2479 | 0,96 | 132,6 |
| 2 | GPT-6 Sol | 86,4 | 8,50 | 9,61 | 7,56 | 8,33 | 26/26 | 0,0358 | 0,14 | 70,2 |
| 3 | GPT-6 Astra | 85,3 | 8,52 | 9,56 | 7,56 | 8,44 | 25/26 | 0,2004 | 0,77 | 105,9 |
| 4 | Claude Fable 5.1 | 83,9 | 8,59 | 9,67 | 8,17 | 7,94 | 25/26 | 0,3583 | 1,38 | 155,0 |
| 5 | GPT-6 Luna | 82,8 | 8,20 | 9,50 | 7,50 | 7,61 | 24/26 | 0,0020 | 0,01 | 38,9 |
| 6 | Gemini 3.8 Flash | 79,4 | 7,67 | 9,00 | 6,78 | 7,22 | 26/26 | 0,0229 | 0,09 | 69,0 |
| 7 | Kimi K3 | 78,5 | 8,04 | 8,63 | 7,70 | 7,78 | 26/26 | 0,0765 | 0,30 | 95,3 |
| 8 | Gemini 3.1 Pro | 77,8 | 7,00 | 8,33 | 5,94 | 6,72 | 26/26 | 0,2570 | 0,99 | 163,6 |
| 9 | Grok 4.7 | 77,4 | 7,49 | 8,15 | 6,63 | 7,70 | 23/26 | 0,0730 | 0,28 | 179,9 |
| 10 | Qwen 3.8 Max | 75,9 | 7,68 | 8,93 | 7,00 | 7,11 | 26/26 | 0,1749 | 0,67 | 571,7 |
| 11 | DeepSeek V4 Pro | 74,1 | 7,56 | 8,59 | 6,81 | 7,26 | 24/26 | 0,0357 | 0,14 | 252,4 |
| 12 | DeepSeek V4.1 Flash | 72,9 | 7,09 | 8,44 | 5,74 | 7,07 | 23/26 | 0,0130 | 0,05 | 365,2 |
| 13 | Claude Sonnet 5 | 71,9 | 7,17 | 8,44 | 6,56 | 6,50 | 25/26 | 0,0573 | 0,22 | 95,5 |
| 14 | Mistral Medium 3.5 | 68,0 | 6,06 | 7,33 | 5,30 | 5,56 | 24/26 | 0,4394 | 1,69 | 554,6 |
| 15 | GLM-5.3 | 64,4 | 6,46 | 7,00 | 6,11 | 6,26 | 23/26 | 0,0176 | 0,07 | 27,3 |
| 16 | Claude Haiku 4.5 | 59,2 | 5,54 | 6,94 | 5,00 | 4,67 | 22/26 | 0,0422 | 0,16 | 80,1 |
Koszty Mistrala i Qwena obejmują tylko drugie, udane próby. Puste pierwsze podejścia kosztowały dodatkowo 0,1361 USD (Mistral) i 0,0366 USD (Qwen).
Najlepszy i najsłabszy w każdym zadaniu
Oceny to średnia trzech kryteriów u sędziów z innych firm niż oceniany model. Cytaty pochodzą z odpowiedzi modeli albo z uwag sędziów.
| Zadanie | Najlepszy | Najsłabszy | Z odpowiedzi i uwag sędziów |
|---|---|---|---|
| T1 Artykuł | Claude Opus 5.5 (9,33) | Claude Haiku 4.5 (3,67) | Sędzia Gemini 3.1 Pro o Opusie: „prawidłowymi obliczeniami”; sędzia GPT-6 Sol o Haiku: „Liczne błędy językowe i fałszywe uogólnienia o ogrzewaniu w polskich blokach”. |
| T2 Opis produktu | Claude Opus 5.5 (7,83) | DeepSeek V4.1 Flash (3,33) | Sędzia Claude Opus 5.5 o DeepSeeku: „Tekst urywa się w pół zdania, dosłownie powtarza te same informacje i nie ma listy korzyści”. |
| T3 Mail | GPT-6 Luna (9,17) | Kimi K3 (6,00) | Kimi: „ta sytuacja nie powinna miała miejsca” - błąd wytknięty przez wszystkich trzech sędziów. |
| T4 LinkedIn | Claude Fable 5.1 (9,50) | Claude Haiku 4.5 (5,00) | Fable zaczyna: „Przez pierwsze pół roku sprzedałem więcej kubków rodzinie niż obcym ludziom.” Haiku kończy hashtagiem „#MałaBiznes”. |
| T5 Opowiadanie | GPT-6 Sol i Claude Opus 5.5 (9,33) | Claude Haiku 4.5 (2,00) | Sol: „Sąsiad wrócił przed obiadem, z błotem na kolanach i smakiem zielonych jabłek w ustach.” Haiku: „ze słowami napisanymi raniną linią tekstu”. |
| T6 Tytuły SEO | GPT-6 Astra (9,67) | DeepSeek V4 Pro (4,67) | Astra: „Kupujesz odkurzacz bezworkowy? Unikaj tych błędów”. DeepSeek: „Może mocy powinien mieć dobry odkurzacz bezworkowy”. |
| T7 Streszczenie | Claude Opus 5.5 (9,67) | Qwen 3.8 Max (6,22) | Sędzia GPT-6 Sol o Opusie: „Wiernie i zwięźle streszcza notatkę”. Qwen pominął różnicę między ofertami i napisał „termin wdrożenia nie ustalono”. |
| T8 Inflacja | Claude Fable 5.1 (9,33) | Claude Haiku 4.5 (5,17) | Fable: „kiedyś kupiłbyś pięć batoników, a teraz tylko cztery”. Haiku: „można za nich kupić mniej rzeczy”. |
| T9 Tłumaczenie | Claude Opus 5.5 (8,83) | GLM-5.3 (3,33) | Opus: „wdrażanie nowych klientów to żadna filozofia”. GLM: „za długo trzymaliśmy się po dachu” i „W zeszłym kwartalele”. |
Najlepszy za złotówkę
GPT-6 Luna wykonała 9 zadań za 0,002 USD, czyli ok. 0,8 grosza, i zdobyła 82,8 pkt. Opus kosztował 125 razy więcej (0,2479 USD) za 7,3 pkt przewagi. Między nimi jest GPT-6 Sol: drugie miejsce za 0,0358 USD, czyli ok. 14 groszy. Najdroższy okazał się Mistral Medium 3.5: 0,4394 USD (1,69 zł) za 14. miejsce, bo przepalał tysiące tokenów na rozumowanie. Szczegóły w tekście o modelach, które myślą za długo, a więcej o samej Lunie w osobnym przewodniku.
Co wygrywa
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Opus 5.5 ma najwyższą średnią poprawności (9,89) i naturalności (8,50) i w żadnym zadaniu nie spadł poniżej 7,83. Jedyną niespełnioną regułę dała mu data spotkania przepisana jako „22.09”, której automat nie znalazł w notatce. To raczej luka automatu niż błąd modelu. GPT-6 Sol i Gemini 3.8 Flash spełniły wszystkie 26 reguł, ale sędziowie ocenili ich naturalność niżej: 7,56 i 6,78.
Sędziowie nagradzali konkret. Najwyżej oceniony post na LinkedIn (Fable 5.1, 9,50) opiera się na szczegółach: zdjęcie kubka na szarym tle kontra kubek z kawą na drewnianym stole. Karali za to schemat. Trzy modele (GPT-6 Astra, GPT-6 Luna i DeepSeek V4.1 Flash) tak gorliwie oznaczały liczby w artykule jako przykłady, że sędziowie obniżyli im naturalność, a DeepSeekowi aż do 3,67. Sędzia GPT-6 Sol napisał o tym tekście: „Ciągłe dopowiadanie, że liczby są przykładami, nadaje tekstowi sztuczny rytm”.
Gdzie modele się wykładają
- Opis produktu z karty (T2). Najtrudniejsze zadanie: średnia 6,16, nikt powyżej 7,83. Sędziowie wskazali dopisywanie cech, których w karcie nie było: „elegancki wygląd” (Kimi K3), „ergonomiczny uchwyt” (Haiku 4.5), herbata, kawa i „cała rodzina” (Mistral, GLM). Automatyczny licznik liczb spoza karty złapał tylko Astrę i Groka, a te „nowe” liczby to wyliczone temperatury 50, 60, 70, 80 i 90 °C. Formalnie wynikają z karty, ale sędziowie dali tym opisom naturalność 4,0 i 2,0.
- Streszczenie (T7). Żaden z 16 modeli nie dopisał daty wdrożenia, ale Claude Sonnet 5 napisał: „Termin wdrożenia i szkolenia przeniesiono na później”. W notatce stało, że terminu nie ustalono. GLM-5.3, Grok 4.7 i Qwen 3.8 Max napisały „termin wdrożenia nie ustalono”, bez dopełniacza.
- Długie pauzy. W odpowiedziach na 9 zadań policzyłem 264 znaki „długiej” lub „średniej” pauzy na 24 088 słów. Pojawiły się w 77 ze 144 odpowiedzi i u każdego z 16 modeli. Najwięcej na 1000 słów: GLM-5.3 (21,4), Qwen 3.8 Max (18,3) i Kimi K3 (18,1), najmniej Gemini 3.1 Pro (3,1). Licznik łapie też półpauzę w zakresach typu 40-100.
- Kalki idiomów (T9). Cztery modele napisały dosłownie „piłka jest po naszej stronie”: DeepSeek V4.1 Flash, DeepSeek V4 Pro, GLM-5.3 i Grok 4.7. Sędzia Claude Opus 5.5 wytknął podobną kalkę Sonnetowi 5 („piłeczka”), a Gemini 3.1 Pro zostawił „follow-up”, „onboarding” i „kick-off”.
- Fleksja. „Połowa sukcesy” (Sonnet 5), „był jeden zdanie” (Grok 4.7), „w ramach przeprosiny” (GLM-5.3), „kusí” z czeskim znakiem (Kimi K3). Każdy z tych czterech błędów wytknęli w uwagach wszyscy trzej sędziowie.
Niezawodność: puste i ucięte odpowiedzi
W pierwszym podejściu z limitem 6000 tokenów Mistral Medium 3.5 trzy razy (opis, mail, streszczenie), a Qwen 3.8 Max raz (opis) oddały pustą odpowiedź, bo cały limit poszedł na rozumowanie. Powtórzyłem je z limitem 30 000 i do oceny poszły drugie próby. Dwie odpowiedzi urwały się w pół zdania i zostały ocenione tak, jak przyszły: opis od DeepSeek V4.1 Flash (5857 z 6000 tokenów na rozumowanie, ocena 3,33) i post od Mistrala (ocena 5,11). Liczby opisuję w tekście o rozumowaniu, które zjada limit. Podobny problem widziałem wcześniej w teście chińskich modeli.
Metodologia
- Modele: 16 modeli od 9 firm (Anthropic 4, OpenAI 3, Google 2, DeepSeek 2, po jednym xAI, Mistral, Alibaba, Zhipu, Moonshot), wszystkie przez OpenRouter, reasoning effort=low, temperatura domyślna, jedno polecenie bez instrukcji systemowej.
- Limity tokenów: 9000 dla artykułu, 8000 dla opowiadania, 6000 dla pozostałych zadań pisarskich, 30 000 w czterech powtórkach.
- Sędziowie: Claude Opus 5.5, GPT-6 Sol i Gemini 3.1 Pro. Każdy dostał wszystkie odpowiedzi na dane zadanie pod losowymi kodami, w innej kolejności, i ocenił je w skali 1-10: poprawność językową, naturalność i wykonanie polecenia, plus jedno zdanie uwag.
- Bez ocen „swoich”: ocenę sędziego z tej samej firmy co model odrzucałem. Modele Anthropic, OpenAI i Google oceniło więc dwóch sędziów, pozostałe trzech. Do rankingu weszło 351 ocen.
- Reguły automatyczne: 26 na model, np. długość, liczba punktów, obecność kodu PRZEPRASZAMY10, brak emoji, fraza w każdym tytule, brak dosłownych kalek. Łącznie modele spełniły 393 z 416 reguł.
- Wynik: 0,7 × średnia sędziów × 10 + 0,2 × procent reguł + 0,1 × higiena, gdzie higiena = 100 minus 4 punkty za każdą pauzę na 1000 słów i minus 5 za każdy zwrot-watę („warto zauważyć”, „kluczowy”, „w dzisiejszych czasach” i podobne), nie mniej niż 0.
- Poprawki klucza: po teście poprawiłem klucz w 3 miejscach korekty i quizu (najniższy punkt Polski to według GUS z 2022 roku Marzęcino, a zapisy „5-osobowy” i „założyłem kurtkę” są poprawne według Poradni Językowej PWN) i przeliczyłem wszystkie odpowiedzi. Ranking pisania się nie zmienił, bo te pytania do niego nie wchodzą.
- Zgodność sędziów: korelacja rang Spearmana między parami sędziów wyniosła 0,82-0,95 na poziomie modeli i 0,59-0,82 na poziomie pojedynczych odpowiedzi. Sędziowie zgadzają się więc co do kolejności modeli bardziej niż co do każdej odpowiedzi z osobna.
Ograniczenia testu
- Jedna próba na zadanie. Przy innym losowaniu model mógłby napisać lepiej albo gorzej. Różnice rzędu 1-2 pkt w wyniku łącznym nie przesądzają o kolejności.
- Sędziowie to też modele. Najłagodniejszy był Gemini 3.1 Pro (średnio 7,97 na 144 odpowiedzi), najsurowszy Opus 5.5 (7,15), Sol pośrodku (7,67).
- Effort=low. Mierzyłem tani, szybki tryb. Przy wyższym poziomie rozumowania wyniki mogą być inne.
- Różni dostawcy. Modele otwarte (DeepSeek, GLM, Kimi) OpenRouter kierował do różnych firm hostujących, a to może wpływać na jakość i czas.
- Powtórki oceniane w mniejszej grupie. Cztery drugie próby sędziowie widzieli w zestawach po dwie odpowiedzi, a nie po szesnaście.
Najczęstsze pytania
Który AI pisze najlepiej po polsku?
W teście z 26 września 2026 roku wygrał Claude Opus 5.5: 90,1 pkt na 100 i średnia sędziów 8,98 na 10 w dziewięciu zadaniach pisarskich. Drugi był GPT-6 Sol (86,4), trzeci GPT-6 Astra (85,3).
Jaki tani model AI dobrze pisze po polsku?
GPT-6 Luna: 82,8 pkt i piąte miejsce na 16 modeli przy koszcie 0,002 USD za 9 zadań. GPT-6 Sol był drugi za 0,0358 USD.
Czy w czacie wyniki będą takie same?
Niekoniecznie. Test szedł przez API z niskim poziomem rozumowania i bez instrukcji systemowej, a aplikacje czatu mają własne ustawienia. Kolejność modeli powinna być podobna, ale pojedyncze teksty mogą się różnić. To opinia redakcji.
Czy sędziowie-modele nie faworyzują swoich?
Oceny sędziego z tej samej firmy co oceniany model odrzucałem. Opusa 5.5 oceniali więc tylko GPT-6 Sol i Gemini 3.1 Pro, a odpowiedzi były anonimowe i w losowej kolejności.
Ile kosztował cały test?
6,12 USD (ok. 23,60 zł): 3,19 USD odpowiedzi 16 modeli w 13 zadaniach, 2,75 USD oceny sędziów i 0,18 USD nieudane pierwsze próby.
Źródła i data sprawdzenia
Wszystkie liczby pochodzą z własnego testu redakcji przeprowadzonego 26 września 2026 roku przez OpenRouter: 208 odpowiedzi (16 modeli × 13 zadań), 4 puste pierwsze próby, 1 dodatkowa próba DeepSeek V4.1 Flash, oceny trzech sędziów i pomiary automatyczne. Metodologia jest zapisana w skryptach run.py, auto.py, sedziowie.py i ranking.py. Surowe dane (odpowiedzi, oceny, skrypty) są dostępne na życzenie oraz w paczce do pobrania: 2026-09-pisanie-po-polsku.zip. Przeliczenia po kursie NBP 3,857 zł za 1 USD (tabela 186/A/NBP/2026 z 24.09.2026). Sprawdzone 26 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który model AI najlepiej pisze po polsku?
Najlepiej wypadł Claude Opus 5.5 z wynikiem 90,1 na 100, uzyskując najwyższą średnią sędziów 8,98 na 10. Zwyciężył w pięciu z dziewięciu zadań i w żadnym nie spadł poniżej oceny 7,83.
Który model AI do pisania po polsku jest najtańszy?
GPT-6 Luna wykonała wszystkie 9 zadań pisarskich za 0,002 USD, czyli ok. 0,8 grosza. Dla porównania Claude Opus 5.5 kosztował 0,2479 USD, czyli 125 razy więcej.
Jak oceniano modele w tym rankingu AI do pisania?
Wynik łączny składał się w 70% ze średniej ocen trzech ślepych sędziów, w 20% z odsetka spełnionych reguł z polecenia i w 10% z higieny tekstu. Każdy model wykonał te same 9 zadań przez OpenRouter z ustawieniem rozumowania effort=low i domyślną temperaturą.
Który model AI popełnia najwięcej błędów przy pisaniu po polsku?
Claude Haiku 4.5 uzyskał najniższy wynik - 59,2 pkt - i był najsłabszy w trzech zadaniach: artykule, poście na LinkedIn oraz opowiadaniu, gdzie dostał zaledwie 2,00 od sędziów. Mistral Medium 3.5 dodatkowo trzykrotnie oddał pustą odpowiedź i kosztował najwięcej ze wszystkich - 0,4394 USD za 9 zadań.
