🔥 -20% na wszystkokod NAIMANdo 18.09, do północy Odbierz →
Przejdź do treści
Benchmarki

Test polszczyzny modeli AI - czerwiec 2026. Autorski benchmark

Benchmarki mierzą matematykę i kod - nikt nie mierzy polszczyzny. Autorski test: 10 identycznych zadań po polsku, te same kryteria, ocena redakcyjna. Pierwsza edycja.

2 min czytania
Ostatnia aktualizacja:
Test polszczyzny modeli AI - czerwiec 2026. Autorski benchmark

👁 162 przeczytań

// w skrócie
  • W czerwcowej edycji autorskiego benchmarku polszczyzny najlepiej wypadł Claude Fable 591, zdobywając 91 punktów na 100 za ironię, rejestr i frazeologię.
  • GPT-5.5 z wynikiem 82/100 popełnia błąd polegający na używaniu angielskich kalek jak "adresować problem" czy "dedykowany zespół", co zdradza maszynowe pochodzenie tekstu.
  • Gemini 3.1 Pro (74/100) paradoksalnie radzi sobie najlepiej z fleksją, w tym odmianą liczebników, ale jednocześnie zajął ostatnie miejsce w kategorii naturalności i ironii.

Intelligence Index mierzy rozumowanie, matematykę i kod. Nie mierzy tego, co dla polskiego użytkownika najważniejsze: czy model pisze po polsku jak człowiek, czy jak tłumacz Google z 2015 roku. Dlatego robię własny test - ten sam zestaw zadań, te same kryteria, co miesiąc.

Metodologia

Każdy model dostaje identyczny zestaw 10 zadań:

  1. List formalny - pismo do urzędu z odwołaniem (rejestr urzędowy)
  2. Mail do klienta - odmowa rabatu bez palenia relacji (dyplomacja)
  3. Post na LinkedIn - bez korpomowy i „dostarczania wartości”
  4. Streszczenie - 2000 słów ustawy → 150 słów po ludzku
  5. Ironia - felietonowy akapit z drugim dnem
  6. Odmiana - tekst nasycony trudną fleksją (nazwiska, liczebniki, „w Zakopanem”)
  7. Frazeologia - naturalne użycie idiomów bez kalk z angielskiego
  8. Rejestr potoczny - wiadomość do kumpla, która nie brzmi jak od HR-u
  9. Korekta - tekst z 10 ukrytymi błędami do znalezienia
  10. Styl autora - kontynuacja akapitu w zadanym stylu

Ocena: 0-10 pkt za zadanie (poprawność 40%, naturalność 40%, wierność poleceniu 20%). To moja ocena autorska - subiektywna z definicji, ale konsekwentna: te same zadania, ten sam oceniający (ja), co miesiąc.

Wyniki - edycja I (czerwiec 2026)

ModelWynik /100NajmocniejszeNajsłabsze
Claude Fable 591ironia, rejestr, frazeologia-
Claude Opus 4.887listy formalne, korektarejestr potoczny
GPT-5.582streszczenia, styl autorafrazeologia (kalki)
Gemini 3.1 Pro74poprawność, korektaironia, naturalność
Grok 4.368rejestr potocznylisty formalne, odmiana
DeepSeek V4 Pro61streszczeniafrazeologia, składnia

Najciekawsze obserwacje

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Ironia to najtwardszy orzech. Tylko Claude konsekwentnie pisze ironię, która nie wymaga emotikonu, żeby ją rozpoznać. GPT-5.5 sygnalizuje żart zbyt mocno; Gemini bierze wszystko dosłownie.

Kalki zdradzają każdego. „Dostarczać wartość”, „adresować problem”, „dedykowany zespół” - GPT-5.5 i DeepSeek wciąż wpadają w te pułapki przy dłuższych tekstach. To pierwszy sygnał, że tekst pisała maszyna.

Odmiana nazwisk i liczebników - wszyscy radzą sobie z „Nowakiem”, ale „dwoma tysiącami pięciuset” łamie połowę stawki. Gemini paradoksalnie najlepszy w czystej fleksji, najgorszy w naturalności.

Rejestr potoczny - Grok zaskakuje: jego luźne teksty brzmią najnaturalniej po Claude. Problem w tym, że luz włącza też tam, gdzie go nie proszono.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

  • Piszesz na publikację → Claude, różnica jest klasowa, nie kosmetyczna
  • Teksty wewnętrzne, streszczenia → GPT-5.5 w zupełności wystarczy
  • Masowe przetwarzanie → DeepSeek, ale z redakcją przed publikacją

Następna edycja: lipiec 2026. Pełne benchmarki techniczne: ranking modeli. Masz pomysł na zadanie do testu? Napisz.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Który model AI najlepiej pisze po polsku według testu z czerwca 2026?

Najlepszy wynik uzyskał Claude Fable 591 z 91 punktami na 100. Jego przewaga nad pozostałymi modelami jest określona jako "klasowa, nie kosmetyczna", szczególnie w zadaniach wymagających ironii i naturalnego rejestru.

Jakie zadania sprawdza autorski benchmark polszczyzny modeli AI?

Test składa się z 10 zadań, w tym pisania listów formalnych, maili do klientów, postów na LinkedIn, streszczeń ustaw, tekstów ironicznych i potocznych oraz korekty tekstu z 10 ukrytymi błędami. Każde zadanie jest oceniane w skali 0-10 punktów według kryteriów: poprawność 40%, naturalność 40%, wierność poleceniu 20%.

Który model AI najlepiej radzi sobie z odmianą polskich nazwisk i liczebników?

Najlepszy w czystej fleksji okazał się Gemini 3.1 Pro, mimo że równocześnie wypadł najgorzej w kategorii naturalności. Połowa testowanych modeli miała problem z poprawną odmianą form takich jak "dwoma tysiącami pięciuset".

Do jakich zastosowań polecany jest DeepSeek V4 Pro przy pracy z polskim tekstem?

DeepSeek V4 Pro (61/100) jest polecany wyłącznie do masowego przetwarzania tekstu, ale z obowiązkową redakcją przed publikacją. Model wypada słabo w frazeologii i składni, a w dłuższych tekstach regularnie stosuje angielskie kalki.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie