Test polszczyzny modeli AI - czerwiec 2026. Autorski benchmark
Benchmarki mierzą matematykę i kod - nikt nie mierzy polszczyzny. Autorski test: 10 identycznych zadań po polsku, te same kryteria, ocena redakcyjna. Pierwsza edycja.

👁 162 przeczytań
- W czerwcowej edycji autorskiego benchmarku polszczyzny najlepiej wypadł Claude Fable 591, zdobywając 91 punktów na 100 za ironię, rejestr i frazeologię.
- GPT-5.5 z wynikiem 82/100 popełnia błąd polegający na używaniu angielskich kalek jak "adresować problem" czy "dedykowany zespół", co zdradza maszynowe pochodzenie tekstu.
- Gemini 3.1 Pro (74/100) paradoksalnie radzi sobie najlepiej z fleksją, w tym odmianą liczebników, ale jednocześnie zajął ostatnie miejsce w kategorii naturalności i ironii.
Intelligence Index mierzy rozumowanie, matematykę i kod. Nie mierzy tego, co dla polskiego użytkownika najważniejsze: czy model pisze po polsku jak człowiek, czy jak tłumacz Google z 2015 roku. Dlatego robię własny test - ten sam zestaw zadań, te same kryteria, co miesiąc.
Metodologia
Każdy model dostaje identyczny zestaw 10 zadań:
- List formalny - pismo do urzędu z odwołaniem (rejestr urzędowy)
- Mail do klienta - odmowa rabatu bez palenia relacji (dyplomacja)
- Post na LinkedIn - bez korpomowy i „dostarczania wartości”
- Streszczenie - 2000 słów ustawy → 150 słów po ludzku
- Ironia - felietonowy akapit z drugim dnem
- Odmiana - tekst nasycony trudną fleksją (nazwiska, liczebniki, „w Zakopanem”)
- Frazeologia - naturalne użycie idiomów bez kalk z angielskiego
- Rejestr potoczny - wiadomość do kumpla, która nie brzmi jak od HR-u
- Korekta - tekst z 10 ukrytymi błędami do znalezienia
- Styl autora - kontynuacja akapitu w zadanym stylu
Ocena: 0-10 pkt za zadanie (poprawność 40%, naturalność 40%, wierność poleceniu 20%). To moja ocena autorska - subiektywna z definicji, ale konsekwentna: te same zadania, ten sam oceniający (ja), co miesiąc.
Wyniki - edycja I (czerwiec 2026)
| Model | Wynik /100 | Najmocniejsze | Najsłabsze |
|---|---|---|---|
| Claude Fable 5 | 91 | ironia, rejestr, frazeologia | - |
| Claude Opus 4.8 | 87 | listy formalne, korekta | rejestr potoczny |
| GPT-5.5 | 82 | streszczenia, styl autora | frazeologia (kalki) |
| Gemini 3.1 Pro | 74 | poprawność, korekta | ironia, naturalność |
| Grok 4.3 | 68 | rejestr potoczny | listy formalne, odmiana |
| DeepSeek V4 Pro | 61 | streszczenia | frazeologia, składnia |
Najciekawsze obserwacje
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Ironia to najtwardszy orzech. Tylko Claude konsekwentnie pisze ironię, która nie wymaga emotikonu, żeby ją rozpoznać. GPT-5.5 sygnalizuje żart zbyt mocno; Gemini bierze wszystko dosłownie.
Kalki zdradzają każdego. „Dostarczać wartość”, „adresować problem”, „dedykowany zespół” - GPT-5.5 i DeepSeek wciąż wpadają w te pułapki przy dłuższych tekstach. To pierwszy sygnał, że tekst pisała maszyna.
Odmiana nazwisk i liczebników - wszyscy radzą sobie z „Nowakiem”, ale „dwoma tysiącami pięciuset” łamie połowę stawki. Gemini paradoksalnie najlepszy w czystej fleksji, najgorszy w naturalności.
Rejestr potoczny - Grok zaskakuje: jego luźne teksty brzmią najnaturalniej po Claude. Problem w tym, że luz włącza też tam, gdzie go nie proszono.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
- Piszesz na publikację → Claude, różnica jest klasowa, nie kosmetyczna
- Teksty wewnętrzne, streszczenia → GPT-5.5 w zupełności wystarczy
- Masowe przetwarzanie → DeepSeek, ale z redakcją przed publikacją
Następna edycja: lipiec 2026. Pełne benchmarki techniczne: ranking modeli. Masz pomysł na zadanie do testu? Napisz.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który model AI najlepiej pisze po polsku według testu z czerwca 2026?
Najlepszy wynik uzyskał Claude Fable 591 z 91 punktami na 100. Jego przewaga nad pozostałymi modelami jest określona jako "klasowa, nie kosmetyczna", szczególnie w zadaniach wymagających ironii i naturalnego rejestru.
Jakie zadania sprawdza autorski benchmark polszczyzny modeli AI?
Test składa się z 10 zadań, w tym pisania listów formalnych, maili do klientów, postów na LinkedIn, streszczeń ustaw, tekstów ironicznych i potocznych oraz korekty tekstu z 10 ukrytymi błędami. Każde zadanie jest oceniane w skali 0-10 punktów według kryteriów: poprawność 40%, naturalność 40%, wierność poleceniu 20%.
Który model AI najlepiej radzi sobie z odmianą polskich nazwisk i liczebników?
Najlepszy w czystej fleksji okazał się Gemini 3.1 Pro, mimo że równocześnie wypadł najgorzej w kategorii naturalności. Połowa testowanych modeli miała problem z poprawną odmianą form takich jak "dwoma tysiącami pięciuset".
Do jakich zastosowań polecany jest DeepSeek V4 Pro przy pracy z polskim tekstem?
DeepSeek V4 Pro (61/100) jest polecany wyłącznie do masowego przetwarzania tekstu, ale z obowiązkową redakcją przed publikacją. Model wypada słabo w frazeologii i składni, a w dłuższych tekstach regularnie stosuje angielskie kalki.


