Czy AI zna Polskę? 94 pytania i 14 pułapek dla 16 modeli
10 z 16 modeli bez błędu, 4 dały się złapać na prezydenta, którego nie było, a w jednym pytaniu nieaktualny okazał się nasz klucz. Wszystkie pomyłki.

👁 117 przeczytań
- 10 z 16 modeli odpowiedziało poprawnie na wszystkie 94 pytania, w tym Claude Opus 5.5, cała trójka GPT-6, oba Gemini, Grok 4.7, DeepSeek V4 Pro i Qwen 3.8 Max.
- Najsłabszy był Claude Haiku 4.5 z 13 pomyłkami, mylił m.in. Mieszka I jako pierwszego koronowanego króla i Pałac Kultury jako najwyższy budynek w Polsce.
- Na 224 pułapkowe odpowiedzi modele dały się złapać tylko 5 razy, przy czym najskuteczniejsza pułapka dotyczyła prezydenta II RP wybranego w wyborach powszechnych.
Czy AI zna Polskę? Zadałem 16 modelom 94 pytania o historię, geografię, prawo i kulturę Polski, w tym 14 pułapek z fałszywym założeniem, np. „W którym roku Stanisław Lem otrzymał Nagrodę Nobla?”. Łatwy zestaw okazał się za łatwy: 14 modeli odpowiedziało bezbłędnie na wszystkie 46 pytań. W trudnym zestawie najwięcej modeli złapało się na prezydenta II RP „wybranego w wyborach powszechnych”, a w pytaniu o najniższy punkt Polski trzy modele znały nowsze dane niż mój pierwotny klucz.
W skrócie
10 z 16 modeli odpowiedziało poprawnie na wszystkie 94 pytania, w tym Claude Opus 5.5, Claude Fable 5.1, cała trójka GPT-6, oba modele Gemini, Grok 4.7, DeepSeek V4 Pro i Qwen 3.8 Max. W pułapki wpadły 4 modele, łącznie 5 razy na 224 pułapkowe odpowiedzi. Zdecydowanie najsłabszy był Claude Haiku 4.5: 13 pomyłek, m.in. „Mieszko I” jako pierwszy koronowany król i Pałac Kultury jako najwyższy budynek w Polsce. Fakty z podręcznika modele znają dobrze; mylą się tam, gdzie prawo niedawno się zmieniło albo gdzie krąży popularny mit.
Jak wyglądał quiz
Łatwy zestaw miał 46 pytań, w tym 6 pułapek, a trudny 48, w tym 8 pułapek. Polecenie kazało odpowiadać krótko, a przy fałszywym założeniu napisać to wprost zamiast zgadywać. Odpowiedzi miały wrócić jako obiekt JSON, a skrypt porównywał je z kluczem. Pułapkę zaliczał, gdy odpowiedź zawierała zaprzeczenie („nie”, „nigdy”, „żaden”, „fałszywe”). Po teście poprawiłem klucz w dwóch pytaniach: przy najniższym punkcie Polski uznaje on teraz Marzęcino (według GUS z 2022 roku) obok Raczek Elbląskich, a przy najdalej wysuniętym na północ punkcie także odmianę „Jastrzębiej Góry”. Wszystkie odpowiedzi przeliczyłem. Quiz był częścią tego samego przebiegu co ranking pisania po polsku i test korekty.
Wyniki: tabela
| Model | Łatwy (46) | Trudny (48) | Pułapki (14) | Pomyłki |
|---|---|---|---|---|
| Claude Opus 5.5 | 46 | 48 | 14 | - |
| Claude Fable 5.1 | 46 | 48 | 14 | - |
| GPT-6 Astra | 46 | 48 | 14 | - |
| GPT-6 Sol | 46 | 48 | 14 | - |
| GPT-6 Luna | 46 | 48 | 14 | - |
| Gemini 3.1 Pro | 46 | 48 | 14 | - |
| Gemini 3.8 Flash | 46 | 48 | 14 | - |
| Grok 4.7 | 46 | 48 | 14 | - |
| DeepSeek V4 Pro | 46 | 48 | 14 | - |
| Qwen 3.8 Max | 46 | 48 | 14 | niepoprawny JSON w łatwym zestawie |
| DeepSeek V4.1 Flash | 46 | 47 | 14 | przedawnienie; wynik z drugiej próby |
| Kimi K3 | 46 | 47 | 14 | Rozewie |
| Claude Sonnet 5 | 46 | 47 | 13 | pułapka z Narutowiczem |
| GLM-5.3 | 46 | 46 | 13 | RPP, pułapka z Narutowiczem |
| Mistral Medium 3.5 | 45 | 46 | 13 | wiek emerytalny, przedawnienie, Narutowicz |
| Claude Haiku 4.5 | 41 | 40 | 12 | 13 pomyłek |
Pułapki: kto dał się złapać
Pytania z fałszywym założeniem dotyczyły m.in. Nobla dla Mickiewicza i Lema, powieści Prusa „Szklany ogród”, euro w Polsce, medali olimpijskich Roberta Lewandowskiego, polskiego parku nad Morzem Czarnym i prezydenta, który był astronautą. Na 224 pułapkowe odpowiedzi (14 pytań × 16 modeli) modele poprawnie odrzuciły założenie w 219 przypadkach.
Najskuteczniejsze okazało się pytanie „Jak nazywał się pierwszy prezydent II Rzeczypospolitej wybrany w wyborach powszechnych?”. GLM-5.3, Mistral Medium 3.5 i Claude Sonnet 5 odpowiedziały „Gabriel Narutowicz”, a Claude Haiku 4.5 „Stanisław Wojciechowski”. Tymczasem prezydentów II RP wybierało Zgromadzenie Narodowe, a nie obywatele. Jedyną pułapką z łatwego zestawu, która kogoś złapała, było pytanie o króla, który „podpisał Konstytucję 3 maja w Gdańsku”. Haiku odpowiedział po prostu „Stanisław August Poniatowski”.
Wszystkie pomyłki z poprawnymi odpowiedziami
| Pytanie | Model i odpowiedź | Poprawna odpowiedź |
|---|---|---|
| Powszechny wiek emerytalny kobiet | Mistral Medium 3.5: „65”; Haiku 4.5: „62 lata” | 60 lat |
| Pierwszy koronowany król Polski | Haiku 4.5: „Mieszko I” | Bolesław Chrobry |
| Największy park narodowy | Haiku 4.5: „Białowieski” | Biebrzański |
| Urlop po 10 latach pracy | Haiku 4.5: „20 dni” | 26 dni |
| Król, który „podpisał Konstytucję 3 maja w Gdańsku” (pułapka) | Haiku 4.5: „Stanisław August Poniatowski” | fałszywe założenie: konstytucję uchwalono w Warszawie |
| Pierwszy prezydent II RP „z wyborów powszechnych” (pułapka) | GLM-5.3, Mistral, Sonnet 5: „Gabriel Narutowicz”; Haiku 4.5: „Stanisław Wojciechowski” | fałszywe założenie: wybierało Zgromadzenie Narodowe |
| Ogólny termin przedawnienia roszczeń majątkowych | DeepSeek V4.1 Flash: „10 lat”; Mistral, Haiku 4.5: „10” | 6 lat |
| Najdalej na północ wysunięta miejscowość | Kimi K3: „Rozewie”; Haiku 4.5: „Frombork” | Jastrzębia Góra |
| Liczba osób w Radzie Polityki Pieniężnej z przewodniczącym | GLM-5.3: „9 osób” | 10 |
| Druga pod względem długości rzeka | Haiku 4.5: „Narew” | Odra |
| Kadencja Rzecznika Praw Obywatelskich | Haiku 4.5: „6” | 5 lat |
| Wypowiedzenie po co najmniej 3 latach pracy | Haiku 4.5: „2 tygodnie” | 3 miesiące |
| Najwyższy budynek w Polsce | Haiku 4.5: „Pałac Kultury i Nauki” | Varso Tower |
| Liczba szczytów Korony Gór Polski | Haiku 4.5: „30” | 28 |
Trzy modele, które podały 10 lat przedawnienia, powtórzyły stan sprzed nowelizacji Kodeksu cywilnego z 2018 roku. Rozewie to z kolei popularny mit: przylądek leży blisko, ale najdalej na północ wysunięty punkt jest w Jastrzębiej Górze.
Najniższy punkt Polski: nowsze dane niż w kluczu
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Na pytanie o najniżej położony punkt Polski pierwotny klucz przyjmował tylko Raczki Elbląskie. GPT-6 Astra, Sol i Luna odpowiedziały „Marzęcino” i to one miały nowsze dane: GUS w Małym Roczniku Statystycznym Polski 2022 podał jako najniższy punkt depresję 2,2 m p.p.m. w Marzęcinie w gminie Nowy Dwór Gdański. Raczki Elbląskie (1,8 m p.p.m.) były rekordzistą wcześniej. Pięć modeli wspomniało o Marzęcinie (oba Gemini podały je razem z Raczkami), jedenaście podało tylko Raczki. Poprawiony klucz uznaje obie odpowiedzi, bo Raczki przez lata były wersją oficjalną.
JSON też jest wynikiem
Qwen 3.8 Max odpowiedział poprawnie na wszystkie 46 łatwych pytań, ale oddał niepoprawny JSON. W odpowiedzi o „Szklanym ogrodzie” otworzył polski cudzysłów, a zamknął go zwykłym cudzysłowem prostym, który w JSON-ie kończy tekst. Skrypt odczytał odpowiedzi awaryjnie, ale program, który oczekuje poprawnego JSON-a, wyrzuciłby błąd. Pozostałe 15 modeli oddało poprawny format w obu zestawach.
DeepSeek V4.1 Flash w pierwszym podejściu do trudnego zestawu zużył 8970 z 9000 tokenów na rozumowanie i oddał tylko początek obiektu z trzema odpowiedziami. W drugiej próbie odpowiedział na wszystkie 48 pytań, z jedną pomyłką, po 3171 tokenach rozumowania. Więcej o takich przebiegach w tekście o modelach, które myślą za długo.
Co z tego wynika
- Daty i nazwiska z podręcznika są bezpieczne. Rozbiory, powstania, Noble i autorzy lektur nie sprawiły problemu żadnemu z 16 modeli.
- Liczby z przepisów sprawdzaj u źródła. Przedawnienie, wiek emerytalny i skład RPP to połowa pomyłek wszystkich modeli poza Haiku 4.5 (4 z 8). Podobnie wyszło w teście wiedzy o AI Act.
- Uprzedzenie o pułapkach pomaga, ale nie zawsze. Polecenie wprost kazało wskazywać fałszywe założenia, a 4 modele i tak podały nazwisko prezydenta. Jak się bronić przed zmyśleniami, opisuję w tekście o halucynacjach AI.
Najczęstsze pytania
Czy AI zna historię i geografię Polski?
Większość dużych modeli tak. W teście z 26 września 2026 roku 10 z 16 modeli odpowiedziało poprawnie na wszystkie 94 pytania o Polsce, a 14 z 16 bezbłędnie rozwiązało łatwy zestaw 46 pytań.
Który model AI najczęściej myli fakty o Polsce?
Claude Haiku 4.5: 13 pomyłek na 94 pytania, w tym dwie pułapki. Kolejny był Mistral Medium 3.5 z 3 pomyłkami.
Czy AI daje się złapać na pytania z fałszywym założeniem?
Rzadko, ale tak. Na 224 pułapkowe odpowiedzi było 5 wpadek u 4 modeli. Najwięcej złapało pytanie o prezydenta II RP wybranego w wyborach powszechnych, czyli kogoś, kto nie istniał.
Gdzie leży najniższy punkt Polski?
Według GUS (Mały Rocznik Statystyczny Polski 2022) w Marzęcinie, 2,2 m p.p.m. Wcześniej za najniższy uznawano punkt w Raczkach Elbląskich, 1,8 m p.p.m.
Źródła i data sprawdzenia
Wyniki pochodzą z własnego testu redakcji z 26 września 2026 roku: 16 modeli przez OpenRouter (reasoning effort=low), pytania i klucz w plikach quiz.json i quiz2.json, pomiar automatyczny w auto.py po poprawce klucza. Podstawa poprawki przy najniższym punkcie Polski: informacja o danych GUS w Interii i TVP3 Gdańsk. Surowe dane (odpowiedzi, klucze, skrypty) są dostępne na życzenie oraz w paczce: 2026-09-pisanie-po-polsku.zip. Sprawdzone 26 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który model AI najlepiej zna historię i geografię Polski?
10 z 16 testowanych modeli odpowiedziało poprawnie na wszystkie 94 pytania. Wśród nich znalazły się Claude Opus 5.5, Claude Fable 5.1, trzy modele GPT-6, oba Gemini, Grok 4.7, DeepSeek V4 Pro i Qwen 3.8 Max.
Który model AI najczęściej myli fakty o Polsce?
Najsłabszy okazał się Claude Haiku 4.5 z 13 pomyłkami na 94 pytania. Kolejny był Mistral Medium 3.5 z 3 pomyłkami, a za nim GLM-5.3 z 2 pomyłkami.
Gdzie leży najniższy punkt Polski według najnowszych danych?
Według GUS (Mały Rocznik Statystyczny Polski 2022) najniższy punkt leży w Marzęcinie, na głębokości 2,2 m p.p.m. Wcześniej za rekord uznawano Raczki Elbląskie na poziomie 1,8 m p.p.m., dlatego test uznaje obie odpowiedzi.
Czy AI daje się oszukać pytaniami z fałszywym założeniem?
Rzadko - na 224 pułapkowe odpowiedzi modele wpadły tylko 5 razy u 4 modeli. Najskuteczniejsza pułapka pytała o pierwszego prezydenta II RP wybranego w wyborach powszechnych, choć takich wyborów nigdy nie było, bo prezydentów wybierało Zgromadzenie Narodowe.
