Przejdź do treści
Artykuły

Czy AI zna Polskę? 94 pytania i 14 pułapek dla 16 modeli

10 z 16 modeli bez błędu, 4 dały się złapać na prezydenta, którego nie było, a w jednym pytaniu nieaktualny okazał się nasz klucz. Wszystkie pomyłki.

6 min czytania
Czy AI zna Polskę? 94 pytania i 14 pułapek dla 16 modeli

👁 117 przeczytań

// w skrócie
  • 10 z 16 modeli odpowiedziało poprawnie na wszystkie 94 pytania, w tym Claude Opus 5.5, cała trójka GPT-6, oba Gemini, Grok 4.7, DeepSeek V4 Pro i Qwen 3.8 Max.
  • Najsłabszy był Claude Haiku 4.5 z 13 pomyłkami, mylił m.in. Mieszka I jako pierwszego koronowanego króla i Pałac Kultury jako najwyższy budynek w Polsce.
  • Na 224 pułapkowe odpowiedzi modele dały się złapać tylko 5 razy, przy czym najskuteczniejsza pułapka dotyczyła prezydenta II RP wybranego w wyborach powszechnych.

Czy AI zna Polskę? Zadałem 16 modelom 94 pytania o historię, geografię, prawo i kulturę Polski, w tym 14 pułapek z fałszywym założeniem, np. „W którym roku Stanisław Lem otrzymał Nagrodę Nobla?”. Łatwy zestaw okazał się za łatwy: 14 modeli odpowiedziało bezbłędnie na wszystkie 46 pytań. W trudnym zestawie najwięcej modeli złapało się na prezydenta II RP „wybranego w wyborach powszechnych”, a w pytaniu o najniższy punkt Polski trzy modele znały nowsze dane niż mój pierwotny klucz.

W skrócie

10 z 16 modeli odpowiedziało poprawnie na wszystkie 94 pytania, w tym Claude Opus 5.5, Claude Fable 5.1, cała trójka GPT-6, oba modele Gemini, Grok 4.7, DeepSeek V4 Pro i Qwen 3.8 Max. W pułapki wpadły 4 modele, łącznie 5 razy na 224 pułapkowe odpowiedzi. Zdecydowanie najsłabszy był Claude Haiku 4.5: 13 pomyłek, m.in. „Mieszko I” jako pierwszy koronowany król i Pałac Kultury jako najwyższy budynek w Polsce. Fakty z podręcznika modele znają dobrze; mylą się tam, gdzie prawo niedawno się zmieniło albo gdzie krąży popularny mit.

Jak wyglądał quiz

Łatwy zestaw miał 46 pytań, w tym 6 pułapek, a trudny 48, w tym 8 pułapek. Polecenie kazało odpowiadać krótko, a przy fałszywym założeniu napisać to wprost zamiast zgadywać. Odpowiedzi miały wrócić jako obiekt JSON, a skrypt porównywał je z kluczem. Pułapkę zaliczał, gdy odpowiedź zawierała zaprzeczenie („nie”, „nigdy”, „żaden”, „fałszywe”). Po teście poprawiłem klucz w dwóch pytaniach: przy najniższym punkcie Polski uznaje on teraz Marzęcino (według GUS z 2022 roku) obok Raczek Elbląskich, a przy najdalej wysuniętym na północ punkcie także odmianę „Jastrzębiej Góry”. Wszystkie odpowiedzi przeliczyłem. Quiz był częścią tego samego przebiegu co ranking pisania po polsku i test korekty.

Wyniki: tabela

ModelŁatwy (46)Trudny (48)Pułapki (14)Pomyłki
Claude Opus 5.5464814-
Claude Fable 5.1464814-
GPT-6 Astra464814-
GPT-6 Sol464814-
GPT-6 Luna464814-
Gemini 3.1 Pro464814-
Gemini 3.8 Flash464814-
Grok 4.7464814-
DeepSeek V4 Pro464814-
Qwen 3.8 Max464814niepoprawny JSON w łatwym zestawie
DeepSeek V4.1 Flash464714przedawnienie; wynik z drugiej próby
Kimi K3464714Rozewie
Claude Sonnet 5464713pułapka z Narutowiczem
GLM-5.3464613RPP, pułapka z Narutowiczem
Mistral Medium 3.5454613wiek emerytalny, przedawnienie, Narutowicz
Claude Haiku 4.541401213 pomyłek
Pomyłki na 94 pytania (pozostałe 10 modeli: 0)
Claude Haiku 4.513
Mistral Medium 3.53
GLM-5.32
DeepSeek V4.1 Flash1
Kimi K31
Claude Sonnet 51

Pułapki: kto dał się złapać

Pytania z fałszywym założeniem dotyczyły m.in. Nobla dla Mickiewicza i Lema, powieści Prusa „Szklany ogród”, euro w Polsce, medali olimpijskich Roberta Lewandowskiego, polskiego parku nad Morzem Czarnym i prezydenta, który był astronautą. Na 224 pułapkowe odpowiedzi (14 pytań × 16 modeli) modele poprawnie odrzuciły założenie w 219 przypadkach.

Najskuteczniejsze okazało się pytanie „Jak nazywał się pierwszy prezydent II Rzeczypospolitej wybrany w wyborach powszechnych?”. GLM-5.3, Mistral Medium 3.5 i Claude Sonnet 5 odpowiedziały „Gabriel Narutowicz”, a Claude Haiku 4.5 „Stanisław Wojciechowski”. Tymczasem prezydentów II RP wybierało Zgromadzenie Narodowe, a nie obywatele. Jedyną pułapką z łatwego zestawu, która kogoś złapała, było pytanie o króla, który „podpisał Konstytucję 3 maja w Gdańsku”. Haiku odpowiedział po prostu „Stanisław August Poniatowski”.

Wszystkie pomyłki z poprawnymi odpowiedziami

PytanieModel i odpowiedźPoprawna odpowiedź
Powszechny wiek emerytalny kobietMistral Medium 3.5: „65”; Haiku 4.5: „62 lata”60 lat
Pierwszy koronowany król PolskiHaiku 4.5: „Mieszko I”Bolesław Chrobry
Największy park narodowyHaiku 4.5: „Białowieski”Biebrzański
Urlop po 10 latach pracyHaiku 4.5: „20 dni”26 dni
Król, który „podpisał Konstytucję 3 maja w Gdańsku” (pułapka)Haiku 4.5: „Stanisław August Poniatowski”fałszywe założenie: konstytucję uchwalono w Warszawie
Pierwszy prezydent II RP „z wyborów powszechnych” (pułapka)GLM-5.3, Mistral, Sonnet 5: „Gabriel Narutowicz”; Haiku 4.5: „Stanisław Wojciechowski”fałszywe założenie: wybierało Zgromadzenie Narodowe
Ogólny termin przedawnienia roszczeń majątkowychDeepSeek V4.1 Flash: „10 lat”; Mistral, Haiku 4.5: „10”6 lat
Najdalej na północ wysunięta miejscowośćKimi K3: „Rozewie”; Haiku 4.5: „Frombork”Jastrzębia Góra
Liczba osób w Radzie Polityki Pieniężnej z przewodniczącymGLM-5.3: „9 osób”10
Druga pod względem długości rzekaHaiku 4.5: „Narew”Odra
Kadencja Rzecznika Praw ObywatelskichHaiku 4.5: „6”5 lat
Wypowiedzenie po co najmniej 3 latach pracyHaiku 4.5: „2 tygodnie”3 miesiące
Najwyższy budynek w PolsceHaiku 4.5: „Pałac Kultury i Nauki”Varso Tower
Liczba szczytów Korony Gór PolskiHaiku 4.5: „30”28

Trzy modele, które podały 10 lat przedawnienia, powtórzyły stan sprzed nowelizacji Kodeksu cywilnego z 2018 roku. Rozewie to z kolei popularny mit: przylądek leży blisko, ale najdalej na północ wysunięty punkt jest w Jastrzębiej Górze.

Najniższy punkt Polski: nowsze dane niż w kluczu

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Na pytanie o najniżej położony punkt Polski pierwotny klucz przyjmował tylko Raczki Elbląskie. GPT-6 Astra, Sol i Luna odpowiedziały „Marzęcino” i to one miały nowsze dane: GUS w Małym Roczniku Statystycznym Polski 2022 podał jako najniższy punkt depresję 2,2 m p.p.m. w Marzęcinie w gminie Nowy Dwór Gdański. Raczki Elbląskie (1,8 m p.p.m.) były rekordzistą wcześniej. Pięć modeli wspomniało o Marzęcinie (oba Gemini podały je razem z Raczkami), jedenaście podało tylko Raczki. Poprawiony klucz uznaje obie odpowiedzi, bo Raczki przez lata były wersją oficjalną.

JSON też jest wynikiem

Qwen 3.8 Max odpowiedział poprawnie na wszystkie 46 łatwych pytań, ale oddał niepoprawny JSON. W odpowiedzi o „Szklanym ogrodzie” otworzył polski cudzysłów, a zamknął go zwykłym cudzysłowem prostym, który w JSON-ie kończy tekst. Skrypt odczytał odpowiedzi awaryjnie, ale program, który oczekuje poprawnego JSON-a, wyrzuciłby błąd. Pozostałe 15 modeli oddało poprawny format w obu zestawach.

DeepSeek V4.1 Flash w pierwszym podejściu do trudnego zestawu zużył 8970 z 9000 tokenów na rozumowanie i oddał tylko początek obiektu z trzema odpowiedziami. W drugiej próbie odpowiedział na wszystkie 48 pytań, z jedną pomyłką, po 3171 tokenach rozumowania. Więcej o takich przebiegach w tekście o modelach, które myślą za długo.

Co z tego wynika

  • Daty i nazwiska z podręcznika są bezpieczne. Rozbiory, powstania, Noble i autorzy lektur nie sprawiły problemu żadnemu z 16 modeli.
  • Liczby z przepisów sprawdzaj u źródła. Przedawnienie, wiek emerytalny i skład RPP to połowa pomyłek wszystkich modeli poza Haiku 4.5 (4 z 8). Podobnie wyszło w teście wiedzy o AI Act.
  • Uprzedzenie o pułapkach pomaga, ale nie zawsze. Polecenie wprost kazało wskazywać fałszywe założenia, a 4 modele i tak podały nazwisko prezydenta. Jak się bronić przed zmyśleniami, opisuję w tekście o halucynacjach AI.

Najczęstsze pytania

Czy AI zna historię i geografię Polski?

Większość dużych modeli tak. W teście z 26 września 2026 roku 10 z 16 modeli odpowiedziało poprawnie na wszystkie 94 pytania o Polsce, a 14 z 16 bezbłędnie rozwiązało łatwy zestaw 46 pytań.

Który model AI najczęściej myli fakty o Polsce?

Claude Haiku 4.5: 13 pomyłek na 94 pytania, w tym dwie pułapki. Kolejny był Mistral Medium 3.5 z 3 pomyłkami.

Czy AI daje się złapać na pytania z fałszywym założeniem?

Rzadko, ale tak. Na 224 pułapkowe odpowiedzi było 5 wpadek u 4 modeli. Najwięcej złapało pytanie o prezydenta II RP wybranego w wyborach powszechnych, czyli kogoś, kto nie istniał.

Gdzie leży najniższy punkt Polski?

Według GUS (Mały Rocznik Statystyczny Polski 2022) w Marzęcinie, 2,2 m p.p.m. Wcześniej za najniższy uznawano punkt w Raczkach Elbląskich, 1,8 m p.p.m.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

Wyniki pochodzą z własnego testu redakcji z 26 września 2026 roku: 16 modeli przez OpenRouter (reasoning effort=low), pytania i klucz w plikach quiz.json i quiz2.json, pomiar automatyczny w auto.py po poprawce klucza. Podstawa poprawki przy najniższym punkcie Polski: informacja o danych GUS w Interii i TVP3 Gdańsk. Surowe dane (odpowiedzi, klucze, skrypty) są dostępne na życzenie oraz w paczce: 2026-09-pisanie-po-polsku.zip. Sprawdzone 26 września 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Który model AI najlepiej zna historię i geografię Polski?

10 z 16 testowanych modeli odpowiedziało poprawnie na wszystkie 94 pytania. Wśród nich znalazły się Claude Opus 5.5, Claude Fable 5.1, trzy modele GPT-6, oba Gemini, Grok 4.7, DeepSeek V4 Pro i Qwen 3.8 Max.

Który model AI najczęściej myli fakty o Polsce?

Najsłabszy okazał się Claude Haiku 4.5 z 13 pomyłkami na 94 pytania. Kolejny był Mistral Medium 3.5 z 3 pomyłkami, a za nim GLM-5.3 z 2 pomyłkami.

Gdzie leży najniższy punkt Polski według najnowszych danych?

Według GUS (Mały Rocznik Statystyczny Polski 2022) najniższy punkt leży w Marzęcinie, na głębokości 2,2 m p.p.m. Wcześniej za rekord uznawano Raczki Elbląskie na poziomie 1,8 m p.p.m., dlatego test uznaje obie odpowiedzi.

Czy AI daje się oszukać pytaniami z fałszywym założeniem?

Rzadko - na 224 pułapkowe odpowiedzi modele wpadły tylko 5 razy u 4 modeli. Najskuteczniejsza pułapka pytała o pierwszego prezydenta II RP wybranego w wyborach powszechnych, choć takich wyborów nigdy nie było, bo prezydentów wybierało Zgromadzenie Narodowe.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›