Który AI najlepiej poprawia polski tekst? Test korekty 16 modeli
22 łatwe i 30 trudnych błędów: pleonazmy, bynajmniej, półtorej roku. Trzy modele zrobiły komplet bez zbędnych zmian, jeden zamieniał słowa na synonimy.

👁 117 przeczytań
- W trudnym tekście z 30 błędami komplet poprawiło 8 z 16 modeli, a Claude Opus 5.5, Claude Fable 5.1 i Grok 4.7 nie zmieniły przy tym ani jednego słowa ponad wzorzec.
- Do taniej i szybkiej korekty wystarczy Gemini 3.8 Flash, który poprawił wszystkie 30 błędów w 6,5 sekundy za 0,0036 USD.
- Najsłabiej wypadły Claude Sonnet 5 i Claude Haiku 4.5 - oba uzyskały 23/30, przy czym Sonnet zamieniał słowa na synonimy wbrew poleceniu.
Który AI najlepiej poprawia polski tekst? Dałem 16 modelom do korekty dwa teksty: łatwy z 22 błędami i trudny z 30, pełen pleonazmów, „bynajmniej” zamiast „przynajmniej” i „półtorej roku”. Łatwy okazał się sufitem: 10 modeli oddało tekst identyczny ze wzorcem. W trudnym osiem modeli poprawiło wszystkie 30 błędów, trzy z nich bez jednej zmiany ponad wzorzec, a kilka innych przy okazji przepisało zdania, czego polecenie wprost zabraniało.
W skrócie
W trudnym tekście 30 z 30 błędów poprawiło 8 modeli: Claude Opus 5.5, Claude Fable 5.1, Grok 4.7, GPT-6 Sol, Gemini 3.1 Pro, Gemini 3.8 Flash, Qwen 3.8 Max i DeepSeek V4.1 Flash. Opus, Fable i Grok nie zmieniły przy tym ani jednego słowa ponad wzorzec. Najsłabiej wypadły Claude Sonnet 5 i Claude Haiku 4.5, oba 23/30: pierwszy zamieniał słowa na synonimy, drugi zostawił m.in. „przekonywujący” i „na przeciwko”. Do szybkiej i taniej korekty wystarczy Gemini 3.8 Flash (6,5 s, 0,0036 USD); do tekstów, w których nie wolno ruszyć stylu, wybrałbym model z zerem zmian ponad wzorzec.
Jak wyglądał test korekty
Oba teksty dostały to samo polecenie: popraw błędy ortograficzne, interpunkcyjne, gramatyczne i językowe, nie przeredagowuj zdań, nie zmieniaj słów na synonimy, niczego nie dopisuj i zwróć sam tekst. W trudnej wersji dopisałem do listy błędy frazeologiczne, stylistyczne i pleonazmy. To część większego testu: ranking pisania 16 modeli i quiz o Polsce szły w tym samym przebiegu.
Każdy błąd miał w kluczu formę błędną i poprawną. Skrypt zaliczał poprawkę, gdy w odpowiedzi była forma poprawna, a nie było błędnej. Osobno liczył różnice słów względem wzorca poprawionego tekstu. Ta liczba łapie niepoprawione błędy, zmiany, o które nikt nie prosił, i poprawne warianty inne niż we wzorcu. Po teście poprawiłem klucz w dwóch miejscach: uznaje teraz także zapis „5-osobowy” i „założyłem kurtkę”, które Poradnia Językowa PWN uznaje za poprawne, a wszystkie odpowiedzi przeliczyłem. Trzecia poprawka dotyczyła quizu.
Łatwy tekst: 22 błędy i sufit
Dziesięć modeli poprawiło 22 z 22 błędów i oddało tekst słowo w słowo zgodny ze wzorcem: GPT-6 Astra, Sol i Luna, Claude Opus 5.5 i Fable 5.1, Gemini 3.1 Pro i 3.8 Flash, Grok 4.7 oraz oba DeepSeeki. Pomyłki pozostałych sześciu:
- „w każdym bądź razie” zostawiły GLM-5.3, Kimi K3 i Claude Sonnet 5 (21/22),
- „Poszłem” zostawiły Qwen 3.8 Max (21/22) i Claude Haiku 4.5, który pominął też przecinek w „Jeżeli ktoś zostanie dłużej, musi” (20/22),
- Mistral Medium 3.5 zostawił „tą książkę” i zamienił poprawne „We wtorek” na błędne „W wtorek” (20/22).
Taki tekst nie różnicuje czołówki, dlatego przygotowałem drugi.
Trudny tekst: 30 błędów
Wyniki według poprawionego klucza. Czas to czas odpowiedzi na trudny tekst.
| Model | Łatwy (22) | Trudny (30) | Pominięte lub zepsute | Różnice słów vs wzorzec | Czas (s) |
|---|---|---|---|---|---|
| Claude Opus 5.5 | 22 | 30 | - | 0 | 14,0 |
| Claude Fable 5.1 | 22 | 30 | - | 0 | 11,0 |
| Grok 4.7 | 22 | 30 | - | 0 | 36,2 |
| DeepSeek V4.1 Flash | 22 | 30 | - | 1 | 83,0 |
| Gemini 3.8 Flash | 22 | 30 | - | 1 | 6,5 |
| Qwen 3.8 Max | 21 | 30 | - | 1 | 53,1 |
| Gemini 3.1 Pro | 22 | 30 | - | 2 | 18,5 |
| GPT-6 Sol | 22 | 30 | - | 2 | 11,7 |
| GPT-6 Astra | 22 | 29 | „powtórzył to.” zamiast „powtórzył to samo.” | 2 | 9,6 |
| GPT-6 Luna | 22 | 29 | przecinki przy wtrąceniu „szczerze mówiąc” | 1 | 8,7 |
| Mistral Medium 3.5 | 20 | 29 | „ubrałem kurtkę”; usunięte „przed czasem” | 4 | 45,3 |
| DeepSeek V4 Pro | 22 | 29 | „Pięciu pracowników”; dopisane „kierownicę” i „ziemć” | 9 | 115,0 |
| Kimi K3 | 21 | 28 | „przekonywujący”, „z przed” | 3 | 117,4 |
| GLM-5.3 | 21 | 26 | wtrącenie, „pięset”, usunięte „Bynajmniej”, „ubrałem” | 4 | 2,3 |
| Claude Sonnet 5 | 21 | 23 | „Na codziennie”, wtrącenie, „Ostatecznie”, synonimy | 9 | 9,1 |
| Claude Haiku 4.5 | 20 | 23 | „półtorej roku”, „przekonywujący”, „na przeciw”, „na przeciwko” i 3 inne | 11 | 15,9 |
Który błąd przechodzi najczęściej
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Najczęściej pomijane błędy w trudnym tekście:
- Przecinki przy wtrąceniu („plan, który, szczerze mówiąc, nie był”) - 4 modele: GLM-5.3, Claude Haiku 4.5, GPT-6 Luna, Claude Sonnet 5.
- „Bynajmniej” zamiast „przynajmniej” - 3 modele. Haiku wstawił „W każdym razie”, Sonnet „Ostatecznie”, a GLM po prostu usunął to słowo.
- „Ubrałem kurtkę” - 3 modele (GLM-5.3, Haiku 4.5, Mistral Medium 3.5).
- „Przekonywujący” - 2 modele (Kimi K3, Haiku 4.5).
Pleonazmy poszły modelom dobrze. „Wróciłem z powrotem” poprawiło wszystkie 16, „cofnął się do tyłu” 15 (Sonnet zamienił to na „wrócił”), „półtorej roku” też 15, bo pominął je tylko Haiku.
Nadgorliwość: gdy korektor przepisuje tekst
Polecenie zabraniało zmiany słów na synonimy. Claude Sonnet 5 i tak zamiast „w ogóle” napisał „wcale”, zamiast „cofnął się” napisał „wrócił”, a zamiast „sprzed tygodnia” napisał „z zeszłego tygodnia”. Każda z tych zamian usuwała błąd, ale zmieniała tekst autora. Na dodatek zepsuł pierwsze zdanie: z „Na codzień” zrobił „Na codziennie pracuję w dziale sprzedaży”.
DeepSeek V4 Pro myślał nad korektą 6571 tokenów i 115 sekund, po czym zamienił „kierowniczkę” na „kierownicę”, „Pięciu pracownic” na „Pięciu pracowników”, a „łatwo ją znaleźć” na „łatwo ją ziemć”. Razem z Mistralem usunął też „przed czasem” ze zdania, w którym nie było pleonazmu. GLM-5.3 poprawił „złoty” na „złotych”, ale przy okazji napisał „pięset”. Dla porównania Claude Fable 5.1 poprawił wszystko w 11 sekund bez żadnego rozumowania. O tym, ile modele myślą i co z tego wynika, piszę w tekście o rozumowaniu, które zjada limit.
Jak prosić AI o korektę
- Zawsze porównuj wersje. Wynik wklej obok oryginału w narzędziu do porównywania dokumentów, np. w Wordzie. Zakaz synonimów w poleceniu nie zatrzymał Sonneta 5.
- Sprawdź ręcznie trzy miejsca: przecinki przy wtrąceniach, „bynajmniej” i czasowniki od ubrań. Tu modele myliły się najczęściej.
- Nie ufaj długiemu myśleniu. Najdłużej myślące modele (DeepSeek V4 Pro, Kimi K3) nie były najlepsze, a Fable 5.1 bez rozumowania zrobił komplet.
- Dobierz model do ryzyka. Jeśli styl autora jest nietykalny, wybierz model, który w tym teście nie zmienił ani słowa ponad wzorzec. To opinia redakcji.
Więcej o samym procesie: jak sprawdzić tekst pod kątem błędów z AI i test edycji komentarzem, w którym poprawki też zmieniały coś jeszcze.
Najczęstsze pytania
Który AI najlepiej poprawia polski tekst?
W teście z 26 września 2026 roku wszystkie 30 błędów trudnego tekstu poprawiło 8 z 16 modeli. Claude Opus 5.5, Claude Fable 5.1 i Grok 4.7 nie zmieniły przy tym ani jednego słowa ponad wzorzec.
Czy AI poprawia pleonazmy?
Tak, najczęściej. „Wróciłem z powrotem” poprawiło 16 z 16 modeli, „cofnął się do tyłu” i „półtorej roku” po 15. Gorzej z przecinkami przy wtrąceniach, które pominęły 4 modele.
Czy AI zmienia tekst przy korekcie?
Część modeli tak, mimo zakazu. Claude Sonnet 5 zamieniał słowa na synonimy, a DeepSeek V4 Pro wprowadził nowe błędy, np. „kierownicę” zamiast „kierowniczkę”.
Jaki tani model AI nadaje się do korekty?
Gemini 3.8 Flash poprawił 30 z 30 błędów w 6,5 sekundy za 0,0036 USD. GPT-6 Luna zrobił 29 z 30 za 0,0006 USD.
Źródła i data sprawdzenia
Wyniki pochodzą z własnego testu redakcji z 26 września 2026 roku: 16 modeli przez OpenRouter (reasoning effort=low), teksty korekta.json (22 błędy) i korekta2.json (30 błędów) z kluczem i wzorcem, pomiar automatyczny w auto.py po poprawce klucza. Podstawa poprawki klucza (zapis „5-osobowy” i „założyć kurtkę”) w Poradni Językowej PWN: zapis cyfrowo-słowny i włożyć, założyć. Surowe dane (odpowiedzi, klucze, skrypty) są dostępne na życzenie oraz w paczce: 2026-09-pisanie-po-polsku.zip. Sprawdzone 26 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który model AI najlepiej poprawia polski tekst?
W teście z 26 września 2026 roku wszystkie 30 błędów trudnego tekstu poprawiło 8 modeli: Claude Opus 5.5, Claude Fable 5.1, Grok 4.7, GPT-6 Sol, Gemini 3.1 Pro, Gemini 3.8 Flash, Qwen 3.8 Max i DeepSeek V4.1 Flash. Spośród nich Opus, Fable i Grok nie wprowadziły żadnej zmiany ponad wzorzec.
Czy AI poprawia pleonazmy w polskim tekście?
Tak, w teście pleonazmy poszły modelom dobrze - "wróciłem z powrotem" poprawiło 16 z 16 modeli, a "cofnął się do tyłu" i "półtorej roku" po 15. Najtrudniejsze okazały się przecinki przy wtrąceniach, które pominęły 4 modele.
Czy AI zmienia tekst autora podczas korekty?
Część modeli tak, mimo wyraźnego zakazu w poleceniu. Claude Sonnet 5 zamieniał słowa na synonimy, np. "w ogóle" na "wcale", a DeepSeek V4 Pro po 115 sekundach myślenia wprowadził nowe błędy, zamieniając "kierowniczkę" na "kierownicę".
Jaki tani model AI nadaje się do korekty polskiego tekstu?
Gemini 3.8 Flash poprawił 30 z 30 błędów w 6,5 sekundy za 0,0036 USD, co czyni go najtańszą opcją z pełnym wynikiem. GPT-6 Luna uzyskał 29 z 30 za 0,0006 USD, ale pominął przecinki przy wtrąceniu.
