Przejdź do treści
Artykuły

Który AI najlepiej poprawia polski tekst? Test korekty 16 modeli

22 łatwe i 30 trudnych błędów: pleonazmy, bynajmniej, półtorej roku. Trzy modele zrobiły komplet bez zbędnych zmian, jeden zamieniał słowa na synonimy.

6 min czytania
Który AI najlepiej poprawia polski tekst? Test korekty 16 modeli

👁 117 przeczytań

// w skrócie
  • W trudnym tekście z 30 błędami komplet poprawiło 8 z 16 modeli, a Claude Opus 5.5, Claude Fable 5.1 i Grok 4.7 nie zmieniły przy tym ani jednego słowa ponad wzorzec.
  • Do taniej i szybkiej korekty wystarczy Gemini 3.8 Flash, który poprawił wszystkie 30 błędów w 6,5 sekundy za 0,0036 USD.
  • Najsłabiej wypadły Claude Sonnet 5 i Claude Haiku 4.5 - oba uzyskały 23/30, przy czym Sonnet zamieniał słowa na synonimy wbrew poleceniu.

Który AI najlepiej poprawia polski tekst? Dałem 16 modelom do korekty dwa teksty: łatwy z 22 błędami i trudny z 30, pełen pleonazmów, „bynajmniej” zamiast „przynajmniej” i „półtorej roku”. Łatwy okazał się sufitem: 10 modeli oddało tekst identyczny ze wzorcem. W trudnym osiem modeli poprawiło wszystkie 30 błędów, trzy z nich bez jednej zmiany ponad wzorzec, a kilka innych przy okazji przepisało zdania, czego polecenie wprost zabraniało.

W skrócie

W trudnym tekście 30 z 30 błędów poprawiło 8 modeli: Claude Opus 5.5, Claude Fable 5.1, Grok 4.7, GPT-6 Sol, Gemini 3.1 Pro, Gemini 3.8 Flash, Qwen 3.8 Max i DeepSeek V4.1 Flash. Opus, Fable i Grok nie zmieniły przy tym ani jednego słowa ponad wzorzec. Najsłabiej wypadły Claude Sonnet 5 i Claude Haiku 4.5, oba 23/30: pierwszy zamieniał słowa na synonimy, drugi zostawił m.in. „przekonywujący” i „na przeciwko”. Do szybkiej i taniej korekty wystarczy Gemini 3.8 Flash (6,5 s, 0,0036 USD); do tekstów, w których nie wolno ruszyć stylu, wybrałbym model z zerem zmian ponad wzorzec.

Jak wyglądał test korekty

Oba teksty dostały to samo polecenie: popraw błędy ortograficzne, interpunkcyjne, gramatyczne i językowe, nie przeredagowuj zdań, nie zmieniaj słów na synonimy, niczego nie dopisuj i zwróć sam tekst. W trudnej wersji dopisałem do listy błędy frazeologiczne, stylistyczne i pleonazmy. To część większego testu: ranking pisania 16 modeli i quiz o Polsce szły w tym samym przebiegu.

Każdy błąd miał w kluczu formę błędną i poprawną. Skrypt zaliczał poprawkę, gdy w odpowiedzi była forma poprawna, a nie było błędnej. Osobno liczył różnice słów względem wzorca poprawionego tekstu. Ta liczba łapie niepoprawione błędy, zmiany, o które nikt nie prosił, i poprawne warianty inne niż we wzorcu. Po teście poprawiłem klucz w dwóch miejscach: uznaje teraz także zapis „5-osobowy” i „założyłem kurtkę”, które Poradnia Językowa PWN uznaje za poprawne, a wszystkie odpowiedzi przeliczyłem. Trzecia poprawka dotyczyła quizu.

Łatwy tekst: 22 błędy i sufit

Dziesięć modeli poprawiło 22 z 22 błędów i oddało tekst słowo w słowo zgodny ze wzorcem: GPT-6 Astra, Sol i Luna, Claude Opus 5.5 i Fable 5.1, Gemini 3.1 Pro i 3.8 Flash, Grok 4.7 oraz oba DeepSeeki. Pomyłki pozostałych sześciu:

  • „w każdym bądź razie” zostawiły GLM-5.3, Kimi K3 i Claude Sonnet 5 (21/22),
  • „Poszłem” zostawiły Qwen 3.8 Max (21/22) i Claude Haiku 4.5, który pominął też przecinek w „Jeżeli ktoś zostanie dłużej, musi” (20/22),
  • Mistral Medium 3.5 zostawił „tą książkę” i zamienił poprawne „We wtorek” na błędne „W wtorek” (20/22).

Taki tekst nie różnicuje czołówki, dlatego przygotowałem drugi.

Trudny tekst: 30 błędów

Wyniki według poprawionego klucza. Czas to czas odpowiedzi na trudny tekst.

ModelŁatwy (22)Trudny (30)Pominięte lub zepsuteRóżnice słów vs wzorzecCzas (s)
Claude Opus 5.52230-014,0
Claude Fable 5.12230-011,0
Grok 4.72230-036,2
DeepSeek V4.1 Flash2230-183,0
Gemini 3.8 Flash2230-16,5
Qwen 3.8 Max2130-153,1
Gemini 3.1 Pro2230-218,5
GPT-6 Sol2230-211,7
GPT-6 Astra2229„powtórzył to.” zamiast „powtórzył to samo.”29,6
GPT-6 Luna2229przecinki przy wtrąceniu „szczerze mówiąc”18,7
Mistral Medium 3.52029„ubrałem kurtkę”; usunięte „przed czasem”445,3
DeepSeek V4 Pro2229„Pięciu pracowników”; dopisane „kierownicę” i „ziemć”9115,0
Kimi K32128„przekonywujący”, „z przed”3117,4
GLM-5.32126wtrącenie, „pięset”, usunięte „Bynajmniej”, „ubrałem”42,3
Claude Sonnet 52123„Na codziennie”, wtrącenie, „Ostatecznie”, synonimy99,1
Claude Haiku 4.52023„półtorej roku”, „przekonywujący”, „na przeciw”, „na przeciwko” i 3 inne1115,9
Trudny tekst: poprawione błędy (na 30)
Claude Opus 5.530
Claude Fable 5.130
Grok 4.730
DeepSeek V4.1 Flash30
Gemini 3.8 Flash30
Qwen 3.8 Max30
Gemini 3.1 Pro30
GPT-6 Sol30
GPT-6 Astra29
GPT-6 Luna29
Mistral Medium 3.529
DeepSeek V4 Pro29
Kimi K328
GLM-5.326
Claude Sonnet 523
Claude Haiku 4.523

Który błąd przechodzi najczęściej

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Najczęściej pomijane błędy w trudnym tekście:

  • Przecinki przy wtrąceniu („plan, który, szczerze mówiąc, nie był”) - 4 modele: GLM-5.3, Claude Haiku 4.5, GPT-6 Luna, Claude Sonnet 5.
  • „Bynajmniej” zamiast „przynajmniej” - 3 modele. Haiku wstawił „W każdym razie”, Sonnet „Ostatecznie”, a GLM po prostu usunął to słowo.
  • „Ubrałem kurtkę” - 3 modele (GLM-5.3, Haiku 4.5, Mistral Medium 3.5).
  • „Przekonywujący” - 2 modele (Kimi K3, Haiku 4.5).

Pleonazmy poszły modelom dobrze. „Wróciłem z powrotem” poprawiło wszystkie 16, „cofnął się do tyłu” 15 (Sonnet zamienił to na „wrócił”), „półtorej roku” też 15, bo pominął je tylko Haiku.

Nadgorliwość: gdy korektor przepisuje tekst

Polecenie zabraniało zmiany słów na synonimy. Claude Sonnet 5 i tak zamiast „w ogóle” napisał „wcale”, zamiast „cofnął się” napisał „wrócił”, a zamiast „sprzed tygodnia” napisał „z zeszłego tygodnia”. Każda z tych zamian usuwała błąd, ale zmieniała tekst autora. Na dodatek zepsuł pierwsze zdanie: z „Na codzień” zrobił „Na codziennie pracuję w dziale sprzedaży”.

DeepSeek V4 Pro myślał nad korektą 6571 tokenów i 115 sekund, po czym zamienił „kierowniczkę” na „kierownicę”, „Pięciu pracownic” na „Pięciu pracowników”, a „łatwo ją znaleźć” na „łatwo ją ziemć”. Razem z Mistralem usunął też „przed czasem” ze zdania, w którym nie było pleonazmu. GLM-5.3 poprawił „złoty” na „złotych”, ale przy okazji napisał „pięset”. Dla porównania Claude Fable 5.1 poprawił wszystko w 11 sekund bez żadnego rozumowania. O tym, ile modele myślą i co z tego wynika, piszę w tekście o rozumowaniu, które zjada limit.

Jak prosić AI o korektę

  • Zawsze porównuj wersje. Wynik wklej obok oryginału w narzędziu do porównywania dokumentów, np. w Wordzie. Zakaz synonimów w poleceniu nie zatrzymał Sonneta 5.
  • Sprawdź ręcznie trzy miejsca: przecinki przy wtrąceniach, „bynajmniej” i czasowniki od ubrań. Tu modele myliły się najczęściej.
  • Nie ufaj długiemu myśleniu. Najdłużej myślące modele (DeepSeek V4 Pro, Kimi K3) nie były najlepsze, a Fable 5.1 bez rozumowania zrobił komplet.
  • Dobierz model do ryzyka. Jeśli styl autora jest nietykalny, wybierz model, który w tym teście nie zmienił ani słowa ponad wzorzec. To opinia redakcji.

Więcej o samym procesie: jak sprawdzić tekst pod kątem błędów z AI i test edycji komentarzem, w którym poprawki też zmieniały coś jeszcze.

Najczęstsze pytania

Który AI najlepiej poprawia polski tekst?

W teście z 26 września 2026 roku wszystkie 30 błędów trudnego tekstu poprawiło 8 z 16 modeli. Claude Opus 5.5, Claude Fable 5.1 i Grok 4.7 nie zmieniły przy tym ani jednego słowa ponad wzorzec.

Czy AI poprawia pleonazmy?

Tak, najczęściej. „Wróciłem z powrotem” poprawiło 16 z 16 modeli, „cofnął się do tyłu” i „półtorej roku” po 15. Gorzej z przecinkami przy wtrąceniach, które pominęły 4 modele.

Czy AI zmienia tekst przy korekcie?

Część modeli tak, mimo zakazu. Claude Sonnet 5 zamieniał słowa na synonimy, a DeepSeek V4 Pro wprowadził nowe błędy, np. „kierownicę” zamiast „kierowniczkę”.

Jaki tani model AI nadaje się do korekty?

Gemini 3.8 Flash poprawił 30 z 30 błędów w 6,5 sekundy za 0,0036 USD. GPT-6 Luna zrobił 29 z 30 za 0,0006 USD.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

Wyniki pochodzą z własnego testu redakcji z 26 września 2026 roku: 16 modeli przez OpenRouter (reasoning effort=low), teksty korekta.json (22 błędy) i korekta2.json (30 błędów) z kluczem i wzorcem, pomiar automatyczny w auto.py po poprawce klucza. Podstawa poprawki klucza (zapis „5-osobowy” i „założyć kurtkę”) w Poradni Językowej PWN: zapis cyfrowo-słowny i włożyć, założyć. Surowe dane (odpowiedzi, klucze, skrypty) są dostępne na życzenie oraz w paczce: 2026-09-pisanie-po-polsku.zip. Sprawdzone 26 września 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Który model AI najlepiej poprawia polski tekst?

W teście z 26 września 2026 roku wszystkie 30 błędów trudnego tekstu poprawiło 8 modeli: Claude Opus 5.5, Claude Fable 5.1, Grok 4.7, GPT-6 Sol, Gemini 3.1 Pro, Gemini 3.8 Flash, Qwen 3.8 Max i DeepSeek V4.1 Flash. Spośród nich Opus, Fable i Grok nie wprowadziły żadnej zmiany ponad wzorzec.

Czy AI poprawia pleonazmy w polskim tekście?

Tak, w teście pleonazmy poszły modelom dobrze - "wróciłem z powrotem" poprawiło 16 z 16 modeli, a "cofnął się do tyłu" i "półtorej roku" po 15. Najtrudniejsze okazały się przecinki przy wtrąceniach, które pominęły 4 modele.

Czy AI zmienia tekst autora podczas korekty?

Część modeli tak, mimo wyraźnego zakazu w poleceniu. Claude Sonnet 5 zamieniał słowa na synonimy, np. "w ogóle" na "wcale", a DeepSeek V4 Pro po 115 sekundach myślenia wprowadził nowe błędy, zamieniając "kierowniczkę" na "kierownicę".

Jaki tani model AI nadaje się do korekty polskiego tekstu?

Gemini 3.8 Flash poprawił 30 z 30 błędów w 6,5 sekundy za 0,0036 USD, co czyni go najtańszą opcją z pełnym wynikiem. GPT-6 Luna uzyskał 29 z 30 za 0,0006 USD, ale pominął przecinki przy wtrąceniu.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›