Przejdź do treści
Artykuły

Ranking AI do pisania po polsku: 16 modeli, 9 zadań i ślepa ocena

Claude Opus 5.5 wygrał z wynikiem 90,1, ale GPT-6 Luna zrobiła 9 zadań za mniej niż grosz. Pełna tabela, cytaty z odpowiedzi i dokładna metodologia.

10 min czytania
Ranking AI do pisania po polsku: 16 modeli, 9 zadań i ślepa ocena

👁 117 przeczytań

// w skrócie
  • Claude Opus 5.5 wygrał ranking 16 modeli AI do pisania po polsku, zdobywając 90,1 na 100 punktów i najwyższą średnią sędziów wynoszącą 8,98 na 10.
  • Najlepszy stosunek wyniku do ceny osiągnęła GPT-6 Luna: 82,8 pkt za 0,002 USD, czyli ok. 0,8 grosza za wszystkie 9 zadań pisarskich.
  • Najsłabsze wyniki uzyskały Claude Haiku 4.5 (59,2 pkt), GLM-5.3 (64,4 pkt) i Mistral Medium 3.5 (68,0 pkt), który trzykrotnie oddał pustą odpowiedź.

Ranking AI do pisania po polsku odpowiada na pytanie, który model pisze najlepiej w naszym języku. 26 września 2026 roku dałem 16 modelom językowym te same 9 zadań pisarskich, od artykułu blogowego po przekład firmowego newslettera, a odpowiedzi ocenili trzej ślepi sędziowie i zestaw automatycznych reguł. Wygrał Claude Opus 5.5 z wynikiem 90,1 na 100. Najwięcej mówi jednak piąte miejsce: GPT-6 Luna zrobiła wszystkie dziewięć zadań za 0,002 USD, czyli za mniej niż grosz. Tym razem oceniali sędziowie, bo w tekstach nie ma jednej poprawnej odpowiedzi; poprzedni pomiar na zadaniach z jedną poprawną odpowiedzią objął 10 modeli.

W skrócie

Claude Opus 5.5 zdobył 90,1 pkt i najwyższą średnią sędziów (8,98 na 10), a w pięciu z dziewięciu zadań dostał najwyższą ocenę (w opowiadaniu ex aequo z GPT-6 Sol). Drugi GPT-6 Sol (86,4 pkt) kosztował prawie 7 razy mniej: 0,0358 USD wobec 0,2479 USD za 9 zadań. Najlepszy stosunek wyniku do ceny ma GPT-6 Luna: 82,8 pkt za 0,002 USD. Opus ma sens, gdy tekst ma wyjść bez poprawek; Sol i Luna, gdy piszesz dużo przez API. Do pisania po polsku nie wybrałbym Claude Haiku 4.5 (59,2 pkt), GLM-5.3 (64,4) ani Mistral Medium 3.5 (68,0), który przy okazji trzy razy oddał pustą odpowiedź.

90,1punktów Claude Opus 5.5, najwyższy wynik
0,002 USDkoszt 9 zadań w GPT-6 Luna (82,8 pkt)
16modeli, te same polecenia i ustawienia
4puste odpowiedzi w pierwszym podejściu

Jak wyglądał test

Każdy z 16 modeli dostał te same polecenia przez OpenRouter, z tym samym ustawieniem rozumowania (effort=low) i domyślną temperaturą. Każde zadanie wykonał raz; tylko przy pustej odpowiedzi powtarzałem próbę z wyższym limitem. Oto dziewięć zadań pisarskich:

  • T1 Artykuł - ok. 500 słów o obniżaniu rachunku za prąd w bloku, min. 3 śródtytuły, zakaz zmyślania cen.
  • T2 Opis produktu - czajnik Nordvik K17, akapit 120-150 słów i 5 korzyści, wyłącznie z karty produktu.
  • T3 Mail - odpowiedź na skargę klienta, do 120 słów, nowy termin 3 października i kod PRZEPRASZAMY10.
  • T4 LinkedIn - post 120-160 słów o roku prowadzenia sklepu z ceramiką, bez emoji, najwyżej 3 hashtagi na końcu.
  • T5 Opowiadanie - 300-350 słów, realizm magiczny, blok z wielkiej płyty, bez słowa „nagle”.
  • T6 Tytuły SEO - 10 tytułów do 60 znaków z dokładną frazą „odkurzacz bezworkowy”.
  • T7 Streszczenie - notatka z zarządu w dokładnie 5 punktach, do 80 słów, bez dopisków.
  • T8 Prosto - inflacja dla dwunastolatka, 100-130 słów, bez „PKB” i „stóp procentowych”.
  • T9 Tłumaczenie - angielski newsletter pełen idiomów, bez tłumaczenia ich dosłownie.

W tym samym przebiegu modele robiły też korektę dwóch tekstów i quiz o Polsce. Te wyniki opisałem osobno: test korekty i 94 pytania o Polskę. Całą serię zbiera Laboratorium Promptowego.

Ranking: pełna tabela

Wynik łączny to w 70% średnia ocen sędziów, w 20% odsetek spełnionych reguł z polecenia i w 10% higiena tekstu (długie pauzy i wata słowna). Koszt i czas dotyczą 9 zadań pisarskich, przeliczenie po kursie NBP 3,857 zł za dolara.

#ModelWynikSędziowie (1-10)PoprawnośćNaturalnośćWykonanieRegułyKoszt USDKoszt złCzas (s)
1Claude Opus 5.590,18,989,898,508,5625/260,24790,96132,6
2GPT-6 Sol86,48,509,617,568,3326/260,03580,1470,2
3GPT-6 Astra85,38,529,567,568,4425/260,20040,77105,9
4Claude Fable 5.183,98,599,678,177,9425/260,35831,38155,0
5GPT-6 Luna82,88,209,507,507,6124/260,00200,0138,9
6Gemini 3.8 Flash79,47,679,006,787,2226/260,02290,0969,0
7Kimi K378,58,048,637,707,7826/260,07650,3095,3
8Gemini 3.1 Pro77,87,008,335,946,7226/260,25700,99163,6
9Grok 4.777,47,498,156,637,7023/260,07300,28179,9
10Qwen 3.8 Max75,97,688,937,007,1126/260,17490,67571,7
11DeepSeek V4 Pro74,17,568,596,817,2624/260,03570,14252,4
12DeepSeek V4.1 Flash72,97,098,445,747,0723/260,01300,05365,2
13Claude Sonnet 571,97,178,446,566,5025/260,05730,2295,5
14Mistral Medium 3.568,06,067,335,305,5624/260,43941,69554,6
15GLM-5.364,46,467,006,116,2623/260,01760,0727,3
16Claude Haiku 4.559,25,546,945,004,6722/260,04220,1680,1

Koszty Mistrala i Qwena obejmują tylko drugie, udane próby. Puste pierwsze podejścia kosztowały dodatkowo 0,1361 USD (Mistral) i 0,0366 USD (Qwen).

Wynik łączny pisania (0-100)
Claude Opus 5.590,1
GPT-6 Sol86,4
GPT-6 Astra85,3
Claude Fable 5.183,9
GPT-6 Luna82,8
Gemini 3.8 Flash79,4
Kimi K378,5
Gemini 3.1 Pro77,8
Grok 4.777,4
Qwen 3.8 Max75,9
DeepSeek V4 Pro74,1
DeepSeek V4.1 Flash72,9
Claude Sonnet 571,9
Mistral Medium 3.568,0
GLM-5.364,4
Claude Haiku 4.559,2

Najlepszy i najsłabszy w każdym zadaniu

Oceny to średnia trzech kryteriów u sędziów z innych firm niż oceniany model. Cytaty pochodzą z odpowiedzi modeli albo z uwag sędziów.

ZadanieNajlepszyNajsłabszyZ odpowiedzi i uwag sędziów
T1 ArtykułClaude Opus 5.5 (9,33)Claude Haiku 4.5 (3,67)Sędzia Gemini 3.1 Pro o Opusie: „prawidłowymi obliczeniami”; sędzia GPT-6 Sol o Haiku: „Liczne błędy językowe i fałszywe uogólnienia o ogrzewaniu w polskich blokach”.
T2 Opis produktuClaude Opus 5.5 (7,83)DeepSeek V4.1 Flash (3,33)Sędzia Claude Opus 5.5 o DeepSeeku: „Tekst urywa się w pół zdania, dosłownie powtarza te same informacje i nie ma listy korzyści”.
T3 MailGPT-6 Luna (9,17)Kimi K3 (6,00)Kimi: „ta sytuacja nie powinna miała miejsca” - błąd wytknięty przez wszystkich trzech sędziów.
T4 LinkedInClaude Fable 5.1 (9,50)Claude Haiku 4.5 (5,00)Fable zaczyna: „Przez pierwsze pół roku sprzedałem więcej kubków rodzinie niż obcym ludziom.” Haiku kończy hashtagiem „#MałaBiznes”.
T5 OpowiadanieGPT-6 Sol i Claude Opus 5.5 (9,33)Claude Haiku 4.5 (2,00)Sol: „Sąsiad wrócił przed obiadem, z błotem na kolanach i smakiem zielonych jabłek w ustach.” Haiku: „ze słowami napisanymi raniną linią tekstu”.
T6 Tytuły SEOGPT-6 Astra (9,67)DeepSeek V4 Pro (4,67)Astra: „Kupujesz odkurzacz bezworkowy? Unikaj tych błędów”. DeepSeek: „Może mocy powinien mieć dobry odkurzacz bezworkowy”.
T7 StreszczenieClaude Opus 5.5 (9,67)Qwen 3.8 Max (6,22)Sędzia GPT-6 Sol o Opusie: „Wiernie i zwięźle streszcza notatkę”. Qwen pominął różnicę między ofertami i napisał „termin wdrożenia nie ustalono”.
T8 InflacjaClaude Fable 5.1 (9,33)Claude Haiku 4.5 (5,17)Fable: „kiedyś kupiłbyś pięć batoników, a teraz tylko cztery”. Haiku: „można za nich kupić mniej rzeczy”.
T9 TłumaczenieClaude Opus 5.5 (8,83)GLM-5.3 (3,33)Opus: „wdrażanie nowych klientów to żadna filozofia”. GLM: „za długo trzymaliśmy się po dachu” i „W zeszłym kwartalele”.

Najlepszy za złotówkę

GPT-6 Luna wykonała 9 zadań za 0,002 USD, czyli ok. 0,8 grosza, i zdobyła 82,8 pkt. Opus kosztował 125 razy więcej (0,2479 USD) za 7,3 pkt przewagi. Między nimi jest GPT-6 Sol: drugie miejsce za 0,0358 USD, czyli ok. 14 groszy. Najdroższy okazał się Mistral Medium 3.5: 0,4394 USD (1,69 zł) za 14. miejsce, bo przepalał tysiące tokenów na rozumowanie. Szczegóły w tekście o modelach, które myślą za długo, a więcej o samej Lunie w osobnym przewodniku.

Koszt 9 zadań pisarskich w groszach
Claude Opus 5.595,6 gr
GPT-6 Sol13,8 gr
GPT-6 Astra77,3 gr
Claude Fable 5.1138,2 gr
GPT-6 Luna0,8 gr
Gemini 3.8 Flash8,8 gr
Kimi K329,5 gr
Gemini 3.1 Pro99,1 gr
Grok 4.728,2 gr
Qwen 3.8 Max67,5 gr
DeepSeek V4 Pro13,8 gr
DeepSeek V4.1 Flash5,0 gr
Claude Sonnet 522,1 gr
Mistral Medium 3.5169,5 gr
GLM-5.36,8 gr
Claude Haiku 4.516,3 gr

Co wygrywa

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Opus 5.5 ma najwyższą średnią poprawności (9,89) i naturalności (8,50) i w żadnym zadaniu nie spadł poniżej 7,83. Jedyną niespełnioną regułę dała mu data spotkania przepisana jako „22.09”, której automat nie znalazł w notatce. To raczej luka automatu niż błąd modelu. GPT-6 Sol i Gemini 3.8 Flash spełniły wszystkie 26 reguł, ale sędziowie ocenili ich naturalność niżej: 7,56 i 6,78.

Sędziowie nagradzali konkret. Najwyżej oceniony post na LinkedIn (Fable 5.1, 9,50) opiera się na szczegółach: zdjęcie kubka na szarym tle kontra kubek z kawą na drewnianym stole. Karali za to schemat. Trzy modele (GPT-6 Astra, GPT-6 Luna i DeepSeek V4.1 Flash) tak gorliwie oznaczały liczby w artykule jako przykłady, że sędziowie obniżyli im naturalność, a DeepSeekowi aż do 3,67. Sędzia GPT-6 Sol napisał o tym tekście: „Ciągłe dopowiadanie, że liczby są przykładami, nadaje tekstowi sztuczny rytm”.

Gdzie modele się wykładają

  • Opis produktu z karty (T2). Najtrudniejsze zadanie: średnia 6,16, nikt powyżej 7,83. Sędziowie wskazali dopisywanie cech, których w karcie nie było: „elegancki wygląd” (Kimi K3), „ergonomiczny uchwyt” (Haiku 4.5), herbata, kawa i „cała rodzina” (Mistral, GLM). Automatyczny licznik liczb spoza karty złapał tylko Astrę i Groka, a te „nowe” liczby to wyliczone temperatury 50, 60, 70, 80 i 90 °C. Formalnie wynikają z karty, ale sędziowie dali tym opisom naturalność 4,0 i 2,0.
  • Streszczenie (T7). Żaden z 16 modeli nie dopisał daty wdrożenia, ale Claude Sonnet 5 napisał: „Termin wdrożenia i szkolenia przeniesiono na później”. W notatce stało, że terminu nie ustalono. GLM-5.3, Grok 4.7 i Qwen 3.8 Max napisały „termin wdrożenia nie ustalono”, bez dopełniacza.
  • Długie pauzy. W odpowiedziach na 9 zadań policzyłem 264 znaki „długiej” lub „średniej” pauzy na 24 088 słów. Pojawiły się w 77 ze 144 odpowiedzi i u każdego z 16 modeli. Najwięcej na 1000 słów: GLM-5.3 (21,4), Qwen 3.8 Max (18,3) i Kimi K3 (18,1), najmniej Gemini 3.1 Pro (3,1). Licznik łapie też półpauzę w zakresach typu 40-100.
  • Kalki idiomów (T9). Cztery modele napisały dosłownie „piłka jest po naszej stronie”: DeepSeek V4.1 Flash, DeepSeek V4 Pro, GLM-5.3 i Grok 4.7. Sędzia Claude Opus 5.5 wytknął podobną kalkę Sonnetowi 5 („piłeczka”), a Gemini 3.1 Pro zostawił „follow-up”, „onboarding” i „kick-off”.
  • Fleksja. „Połowa sukcesy” (Sonnet 5), „był jeden zdanie” (Grok 4.7), „w ramach przeprosiny” (GLM-5.3), „kusí” z czeskim znakiem (Kimi K3). Każdy z tych czterech błędów wytknęli w uwagach wszyscy trzej sędziowie.

Niezawodność: puste i ucięte odpowiedzi

W pierwszym podejściu z limitem 6000 tokenów Mistral Medium 3.5 trzy razy (opis, mail, streszczenie), a Qwen 3.8 Max raz (opis) oddały pustą odpowiedź, bo cały limit poszedł na rozumowanie. Powtórzyłem je z limitem 30 000 i do oceny poszły drugie próby. Dwie odpowiedzi urwały się w pół zdania i zostały ocenione tak, jak przyszły: opis od DeepSeek V4.1 Flash (5857 z 6000 tokenów na rozumowanie, ocena 3,33) i post od Mistrala (ocena 5,11). Liczby opisuję w tekście o rozumowaniu, które zjada limit. Podobny problem widziałem wcześniej w teście chińskich modeli.

Metodologia

  • Modele: 16 modeli od 9 firm (Anthropic 4, OpenAI 3, Google 2, DeepSeek 2, po jednym xAI, Mistral, Alibaba, Zhipu, Moonshot), wszystkie przez OpenRouter, reasoning effort=low, temperatura domyślna, jedno polecenie bez instrukcji systemowej.
  • Limity tokenów: 9000 dla artykułu, 8000 dla opowiadania, 6000 dla pozostałych zadań pisarskich, 30 000 w czterech powtórkach.
  • Sędziowie: Claude Opus 5.5, GPT-6 Sol i Gemini 3.1 Pro. Każdy dostał wszystkie odpowiedzi na dane zadanie pod losowymi kodami, w innej kolejności, i ocenił je w skali 1-10: poprawność językową, naturalność i wykonanie polecenia, plus jedno zdanie uwag.
  • Bez ocen „swoich”: ocenę sędziego z tej samej firmy co model odrzucałem. Modele Anthropic, OpenAI i Google oceniło więc dwóch sędziów, pozostałe trzech. Do rankingu weszło 351 ocen.
  • Reguły automatyczne: 26 na model, np. długość, liczba punktów, obecność kodu PRZEPRASZAMY10, brak emoji, fraza w każdym tytule, brak dosłownych kalek. Łącznie modele spełniły 393 z 416 reguł.
  • Wynik: 0,7 × średnia sędziów × 10 + 0,2 × procent reguł + 0,1 × higiena, gdzie higiena = 100 minus 4 punkty za każdą pauzę na 1000 słów i minus 5 za każdy zwrot-watę („warto zauważyć”, „kluczowy”, „w dzisiejszych czasach” i podobne), nie mniej niż 0.
  • Poprawki klucza: po teście poprawiłem klucz w 3 miejscach korekty i quizu (najniższy punkt Polski to według GUS z 2022 roku Marzęcino, a zapisy „5-osobowy” i „założyłem kurtkę” są poprawne według Poradni Językowej PWN) i przeliczyłem wszystkie odpowiedzi. Ranking pisania się nie zmienił, bo te pytania do niego nie wchodzą.
  • Zgodność sędziów: korelacja rang Spearmana między parami sędziów wyniosła 0,82-0,95 na poziomie modeli i 0,59-0,82 na poziomie pojedynczych odpowiedzi. Sędziowie zgadzają się więc co do kolejności modeli bardziej niż co do każdej odpowiedzi z osobna.

Ograniczenia testu

  • Jedna próba na zadanie. Przy innym losowaniu model mógłby napisać lepiej albo gorzej. Różnice rzędu 1-2 pkt w wyniku łącznym nie przesądzają o kolejności.
  • Sędziowie to też modele. Najłagodniejszy był Gemini 3.1 Pro (średnio 7,97 na 144 odpowiedzi), najsurowszy Opus 5.5 (7,15), Sol pośrodku (7,67).
  • Effort=low. Mierzyłem tani, szybki tryb. Przy wyższym poziomie rozumowania wyniki mogą być inne.
  • Różni dostawcy. Modele otwarte (DeepSeek, GLM, Kimi) OpenRouter kierował do różnych firm hostujących, a to może wpływać na jakość i czas.
  • Powtórki oceniane w mniejszej grupie. Cztery drugie próby sędziowie widzieli w zestawach po dwie odpowiedzi, a nie po szesnaście.

Najczęstsze pytania

Który AI pisze najlepiej po polsku?

W teście z 26 września 2026 roku wygrał Claude Opus 5.5: 90,1 pkt na 100 i średnia sędziów 8,98 na 10 w dziewięciu zadaniach pisarskich. Drugi był GPT-6 Sol (86,4), trzeci GPT-6 Astra (85,3).

Jaki tani model AI dobrze pisze po polsku?

GPT-6 Luna: 82,8 pkt i piąte miejsce na 16 modeli przy koszcie 0,002 USD za 9 zadań. GPT-6 Sol był drugi za 0,0358 USD.

Czy w czacie wyniki będą takie same?

Niekoniecznie. Test szedł przez API z niskim poziomem rozumowania i bez instrukcji systemowej, a aplikacje czatu mają własne ustawienia. Kolejność modeli powinna być podobna, ale pojedyncze teksty mogą się różnić. To opinia redakcji.

Czy sędziowie-modele nie faworyzują swoich?

Oceny sędziego z tej samej firmy co oceniany model odrzucałem. Opusa 5.5 oceniali więc tylko GPT-6 Sol i Gemini 3.1 Pro, a odpowiedzi były anonimowe i w losowej kolejności.

Ile kosztował cały test?

6,12 USD (ok. 23,60 zł): 3,19 USD odpowiedzi 16 modeli w 13 zadaniach, 2,75 USD oceny sędziów i 0,18 USD nieudane pierwsze próby.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

Wszystkie liczby pochodzą z własnego testu redakcji przeprowadzonego 26 września 2026 roku przez OpenRouter: 208 odpowiedzi (16 modeli × 13 zadań), 4 puste pierwsze próby, 1 dodatkowa próba DeepSeek V4.1 Flash, oceny trzech sędziów i pomiary automatyczne. Metodologia jest zapisana w skryptach run.py, auto.py, sedziowie.py i ranking.py. Surowe dane (odpowiedzi, oceny, skrypty) są dostępne na życzenie oraz w paczce do pobrania: 2026-09-pisanie-po-polsku.zip. Przeliczenia po kursie NBP 3,857 zł za 1 USD (tabela 186/A/NBP/2026 z 24.09.2026). Sprawdzone 26 września 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Który model AI najlepiej pisze po polsku?

Najlepiej wypadł Claude Opus 5.5 z wynikiem 90,1 na 100, uzyskując najwyższą średnią sędziów 8,98 na 10. Zwyciężył w pięciu z dziewięciu zadań i w żadnym nie spadł poniżej oceny 7,83.

Który model AI do pisania po polsku jest najtańszy?

GPT-6 Luna wykonała wszystkie 9 zadań pisarskich za 0,002 USD, czyli ok. 0,8 grosza. Dla porównania Claude Opus 5.5 kosztował 0,2479 USD, czyli 125 razy więcej.

Jak oceniano modele w tym rankingu AI do pisania?

Wynik łączny składał się w 70% ze średniej ocen trzech ślepych sędziów, w 20% z odsetka spełnionych reguł z polecenia i w 10% z higieny tekstu. Każdy model wykonał te same 9 zadań przez OpenRouter z ustawieniem rozumowania effort=low i domyślną temperaturą.

Który model AI popełnia najwięcej błędów przy pisaniu po polsku?

Claude Haiku 4.5 uzyskał najniższy wynik - 59,2 pkt - i był najsłabszy w trzech zadaniach: artykule, poście na LinkedIn oraz opowiadaniu, gdzie dostał zaledwie 2,00 od sędziów. Mistral Medium 3.5 dodatkowo trzykrotnie oddał pustą odpowiedź i kosztował najwięcej ze wszystkich - 0,4394 USD za 9 zadań.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›