Test modeli AI 16.09.2026: 7 modeli, 4 zadania, pełne wyniki
Przebieg z 16.09.2026: 7 modeli, te same 3 zadania (redakcja bez zmiany liczb, tabela z PDF, kod PESEL w piaskownicy) plus test kontekstu. Komplet zaliczyło 5 z 7. Pełne prompty i surowe odpowiedzi do wglądu.
👁 115 przeczytań
- Wszystkie 7 modeli zaliczyły redakcję tekstu bez zmiany liczb, ale przy walidatorze PESEL DeepSeek V4 Pro i Qwen 3.8 Max zwróciły brak odpowiedzi.
- Jedynym modelem, który zaliczył wszystkie próby testu kontekstu przy 8k, 32k i 128k tokenach, był Kimi K3 oraz DeepSeek V4 Pro, oba z wynikiem 2/2 na każdym poziomie.
Ten wpis to surowy zapis jednego przebiegu protokołu testowego Promptowego (v1 (16.09.2026)). Każdy z 7 modeli dostał identyczne prompty w tej samej kolejności, temperatura 0, jedno wywołanie na zadanie, bez ponownych prób po złej odpowiedzi. Ocenia PHP, nie inny model: porównanie liczb, komórek tabeli i uruchomienie kodu na stałych wektorach. Poniżej tabela zbiorcza, potem każde zadanie z pełnym promptem i surową odpowiedzią każdego modelu. Porażki, puste odpowiedzi i przekroczenia czasu zostają w tabeli.
| Model | Redakcja bez zmiany liczb | Tabela z PDF do JSON | Kod: walidator PESEL z testami | Kontekst (igła w stogu) |
|---|---|---|---|---|
| Claude Opus 5anthropic/claude-opus-5 | zaliczone6.2 s | 8/8 wierszy5 s | 10/10 wektorów8 s | błąd @8k · błąd @32k · 1/1 @128k |
| GPT-6 Astraopenai/gpt-6-astra | zaliczone4.9 s | 8/8 wierszy7.4 s | 10/10 wektorów17.4 s | poza testem kontekstu |
| Gemini 3.1 Progoogle/gemini-3.1-pro-preview | zaliczone19 s | 8/8 wierszy16.8 s | 10/10 wektorów17 s | poza testem kontekstu |
| Kimi K3moonshotai/kimi-k3 | zaliczone59.3 s | 8/8 wierszy8.6 s | 10/10 wektorów155.1 s | 2/2 @8k · 2/2 @32k · 2/2 @128k |
| DeepSeek V4 Prodeepseek/deepseek-v4-pro | zaliczone40.2 s | 8/8 wierszy24.5 s | brak odpowiedzi170 s | 2/2 @8k · 2/2 @32k · 2/2 @128k |
| Grok 4.6x-ai/grok-4.6 | zaliczone27.9 s | 8/8 wierszy32 s | 10/10 wektorów45.8 s | poza testem kontekstu |
| Qwen 3.8 Maxqwen/qwen3.8-max-0902 | zaliczone105.8 s | 8/8 wierszy40.9 s | brak odpowiedzi170 s | poza testem kontekstu |
Redakcja bez zmiany liczb
Model dostaje tekst urzędowy z trzema literówkami i drętwymi zwrotami. Ma poprawić styl i literówki, nie ruszając ani jednej liczby, daty ani godziny. Oceniacz porównuje multizbiór liczb w oryginale i w odpowiedzi, sprawdza trzy literówki i format (sam tekst, bez nagłówków i list).
Pełny prompt (identyczny dla każdego modelu)
Popraw poniższy tekst pod względem stylu i literówek: usuń urzędowe zwroty, popraw błędy i literówki, zachowaj sens i wszystkie informacje. ZASADY: - nie zmieniaj żadnej liczby, daty ani godziny ani ich zapisu (cyfry zostają cyframi, nie zamieniaj liczb na słowa, nie dodawaj nowych liczb, nie usuwaj istniejących), - nie dodawaj nagłówków, list, komentarzy ani wyjaśnień, - zwróć wyłącznie poprawiony tekst jako jeden lub dwa akapity. TEKST: W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebódowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. W chwili obecnej radni zaplanowali na 2026 rok kwotę 16 mln zł, jednak skarbnik ostrzga, że przy inflacji na poziomie 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkanca przypada 1 146 zł wydatków drogowych. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1, a ich celem jest dokonanie ustalenia priorytetów na kolejne 4 lata.
Claude Opus 5 zaliczone6.2 s
- Liczby: wszystkie 18 zachowane co do znaku.
- Literówki: wszystkie 3 poprawione.
- Format: sam tekst, długość 98% oryginału.
W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebudowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. Obecnie radni zaplanowali na 2026 rok kwotę 16 mln zł, jednak skarbnik ostrzega, że przy inflacji na poziomie 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkańca przypada 1 146 zł wydatków drogowych. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1, a ich celem jest ustalenie priorytetów na kolejne 4 lata.
GPT-6 Astra zaliczone4.9 s
- Liczby: wszystkie 18 zachowane co do znaku.
- Literówki: wszystkie 3 poprawione.
- Format: sam tekst, długość 98% oryginału.
W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebudowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. Radni zaplanowali na 2026 rok wydatki w wysokości 16 mln zł, jednak skarbnik ostrzega, że przy inflacji na poziomie 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkańca przypada 1 146 zł wydatków na drogi. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1. Ich celem jest ustalenie priorytetów na kolejne 4 lata.
Gemini 3.1 Pro zaliczone19 s
- Liczby: wszystkie 18 zachowane co do znaku.
- Literówki: wszystkie 3 poprawione.
- Format: sam tekst, długość 97% oryginału.
W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebudowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. Obecnie radni zaplanowali na 2026 rok kwotę 16 mln zł, jednak skarbnik ostrzega, że przy inflacji na poziomie 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkańca przypada 1 146 zł wydatków drogowych. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1, a ich celem jest ustalenie priorytetów na kolejne 4 lata.
Kimi K3 zaliczone59.3 s
- Liczby: wszystkie 18 zachowane co do znaku.
- Literówki: wszystkie 3 poprawione.
- Format: sam tekst, długość 94% oryginału.
W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebudowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. Na 2026 rok radni zaplanowali 16 mln zł, jednak skarbnik ostrzega, że przy inflacji 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkańca przypada 1 146 zł wydatków drogowych. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1, a ich celem jest ustalenie priorytetów na kolejne 4 lata.
DeepSeek V4 Pro zaliczone40.2 s
- Liczby: wszystkie 18 zachowane co do znaku.
- Literówki: wszystkie 3 poprawione.
- Format: sam tekst, długość 96% oryginału.
W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebudowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. Obecnie radni zaplanowali na 2026 rok kwotę 16 mln zł, jednak skarbnik ostrzega, że przy inflacji 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkańca przypada 1 146 zł wydatków drogowych. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1, a ich celem jest ustalenie priorytetów na kolejne 4 lata.
Grok 4.6 zaliczone27.9 s
- Liczby: wszystkie 18 zachowane co do znaku.
- Literówki: wszystkie 3 poprawione.
- Format: sam tekst, długość 97% oryginału.
W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebudowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. Obecnie radni zaplanowali na 2026 rok kwotę 16 mln zł, jednak skarbnik ostrzega, że przy inflacji na poziomie 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkańca przypada 1 146 zł wydatków drogowych. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1, a ich celem jest ustalenie priorytetów na kolejne 4 lata.
Qwen 3.8 Max zaliczone105.8 s
- Liczby: wszystkie 18 zachowane co do znaku.
- Literówki: wszystkie 3 poprawione.
- Format: sam tekst, długość 92% oryginału.
W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebudowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. Radni zaplanowali na 2026 rok 16 mln zł, jednak skarbnik ostrzega, że przy inflacji 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkańca przypada 1 146 zł wydatków drogowych. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1, aby ustalić priorytety na kolejne 4 lata.
Tabela z PDF do JSON
Model dostaje warstwę tekstową cennika z PDF: dwa wiersze z nazwą przeniesioną do następnej linii, wiersz bez danych (kreski), usługa zwolniona z VAT z gwiazdką i przypisem. Ma zwrócić 8 wierszy jako JSON. Oceniacz porównuje każdą komórkę z wartością oczekiwaną; wiersz liczy się tylko w całości.
Pełny prompt (identyczny dla każdego modelu)
Poniżej tekst wyciągnięty z pliku PDF (warstwa tekstowa, kolumny rozdzielone spacjami, niektóre nazwy przeniesione do następnej linii).
Zwróć WYŁĄCZNIE JSON: tablicę 8 obiektów z kluczami:
- "lp" (liczba całkowita),
- "usluga" (pełna nazwa usługi, łącznie z częścią przeniesioną do następnej linii, bez gwiazdki),
- "netto" (liczba lub null, gdy brak),
- "vat" (stawka jako liczba, np. 23; tekst "zw." dla usługi zwolnionej; null, gdy brak),
- "brutto" (liczba lub null, gdy brak).
Bez komentarzy, bez markdownu, bez tekstu poza JSON-em.
TEKST Z PDF:
CENNIK USŁUG SERWISOWYCH obowiązuje od 1.03.2026
Lp. Usługa Cena netto VAT Cena brutto
1 Diagnostyka komputera 120,00 23% 147,60
2 Wymiana dysku SSD (bez części) 180,00 23% 221,40
3 Instalacja systemu operacyjnego 150,00 23% 184,50
4 Czyszczenie laptopa z wymianą
pasty termoprzewodzącej 210,00 23% 258,30
5 Odzyskiwanie danych (wycena
indywidualna) - - -
6 Konfiguracja routera 90,00 23% 110,70
7 Szkolenie z obsługi (1 godz.)* 100,00 zw. 100,00
8 Dojazd do klienta (za km) 2,50 23% 3,08
* usługa zwolniona z VAT na podstawie art. 43 ust. 1 pkt 29 ustawyClaude Opus 5 8/8 wierszy5 s
- Wszystkie 8 wierszy zgodne z tabelą, łącznie z nazwami łamanymi w PDF i wierszem bez danych.
[{"lp":1,"usluga":"Diagnostyka komputera","netto":120.00,"vat":23,"brutto":147.60},{"lp":2,"usluga":"Wymiana dysku SSD (bez części)","netto":180.00,"vat":23,"brutto":221.40},{"lp":3,"usluga":"Instalacja systemu operacyjnego","netto":150.00,"vat":23,"brutto":184.50},{"lp":4,"usluga":"Czyszczenie laptopa z wymianą pasty termoprzewodzącej","netto":210.00,"vat":23,"brutto":258.30},{"lp":5,"usluga":"Odzyskiwanie danych (wycena indywidualna)","netto":null,"vat":null,"brutto":null},{"lp":6,"usluga":"Konfiguracja routera","netto":90.00,"vat":23,"brutto":110.70},{"lp":7,"usluga":"Szkolenie z obsługi (1 godz.)","netto":100.00,"vat":"zw.","brutto":100.00},{"lp":8,"usluga":"Dojazd do klienta (za km)","netto":2.50,"vat":23,"brutto":3.08}]GPT-6 Astra 8/8 wierszy7.4 s
- Wszystkie 8 wierszy zgodne z tabelą, łącznie z nazwami łamanymi w PDF i wierszem bez danych.
[
{
"lp": 1,
"usluga": "Diagnostyka komputera",
"netto": 120.00,
"vat": 23,
"brutto": 147.60
},
{
"lp": 2,
"usluga": "Wymiana dysku SSD (bez części)",
"netto": 180.00,
"vat": 23,
"brutto": 221.40
},
{
"lp": 3,
"usluga": "Instalacja systemu operacyjnego",
"netto": 150.00,
"vat": 23,
"brutto": 184.50
},
{
"lp": 4,
"usluga": "Czyszczenie laptopa z wymianą pasty termoprzewodzącej",
"netto": 210.00,
"vat": 23,
"brutto": 258.30
},
{
"lp": 5,
"usluga": "Odzyskiwanie danych (wycena indywidualna)",
"netto": null,
"vat": null,
"brutto": null
},
{
"lp": 6,
"usluga": "Konfiguracja routera",
"netto": 90.00,
"vat": 23,
"brutto": 110.70
},
{
"lp": 7,
"usluga": "Szkolenie z obsługi (1 godz.)",
"netto": 100.00,
"vat": "zw.",
"brutto": 100.00
},
{
"lp": 8,
"usluga": "Dojazd do klienta (za km)",
"netto": 2.50,
"vat": 23,
"brutto": 3.08
}
]Gemini 3.1 Pro 8/8 wierszy16.8 s
- Wszystkie 8 wierszy zgodne z tabelą, łącznie z nazwami łamanymi w PDF i wierszem bez danych.
[
{
"lp": 1,
"usluga": "Diagnostyka komputera",
"netto": 120.00,
"vat": 23,
"brutto": 147.60
},
{
"lp": 2,
"usluga": "Wymiana dysku SSD (bez części)",
"netto": 180.00,
"vat": 23,
"brutto": 221.40
},
{
"lp": 3,
"usluga": "Instalacja systemu operacyjnego",
"netto": 150.00,
"vat": 23,
"brutto": 184.50
},
{
"lp": 4,
"usluga": "Czyszczenie laptopa z wymianą pasty termoprzewodzącej",
"netto": 210.00,
"vat": 23,
"brutto": 258.30
},
{
"lp": 5,
"usluga": "Odzyskiwanie danych (wycena indywidualna)",
"netto": null,
"vat": null,
"brutto": null
},
{
"lp": 6,
"usluga": "Konfiguracja routera",
"netto": 90.00,
"vat": 23,
"brutto": 110.70
},
{
"lp": 7,
"usluga": "Szkolenie z obsługi (1 godz.)",
"netto": 100.00,
"vat": "zw.",
"brutto": 100.00
},
{
"lp": 8,
"usluga": "Dojazd do klienta (za km)",
"netto": 2.50,
"vat": 23,
"brutto": 3.08
}
]Kimi K3 8/8 wierszy8.6 s
- Wszystkie 8 wierszy zgodne z tabelą, łącznie z nazwami łamanymi w PDF i wierszem bez danych.
[{"lp":1,"usluga":"Diagnostyka komputera","netto":120.00,"vat":23,"brutto":147.60},{"lp":2,"usluga":"Wymiana dysku SSD (bez części)","netto":180.00,"vat":23,"brutto":221.40},{"lp":3,"usluga":"Instalacja systemu operacyjnego","netto":150.00,"vat":23,"brutto":184.50},{"lp":4,"usluga":"Czyszczenie laptopa z wymianą pasty termoprzewodzącej","netto":210.00,"vat":23,"brutto":258.30},{"lp":5,"usluga":"Odzyskiwanie danych (wycena indywidualna)","netto":null,"vat":null,"brutto":null},{"lp":6,"usluga":"Konfiguracja routera","netto":90.00,"vat":23,"brutto":110.70},{"lp":7,"usluga":"Szkolenie z obsługi (1 godz.)","netto":100.00,"vat":"zw.","brutto":100.00},{"lp":8,"usluga":"Dojazd do klienta (za km)","netto":2.50,"vat":23,"brutto":3.08}]DeepSeek V4 Pro 8/8 wierszy24.5 s
- Wszystkie 8 wierszy zgodne z tabelą, łącznie z nazwami łamanymi w PDF i wierszem bez danych.
[
{
"lp": 1,
"usluga": "Diagnostyka komputera",
"netto": 120,
"vat": 23,
"brutto": 147.6
},
{
"lp": 2,
"usluga": "Wymiana dysku SSD (bez części)",
"netto": 180,
"vat": 23,
"brutto": 221.4
},
{
"lp": 3,
"usluga": "Instalacja systemu operacyjnego",
"netto": 150,
"vat": 23,
"brutto": 184.5
},
{
"lp": 4,
"usluga": "Czyszczenie laptopa z wymianą pasty termoprzewodzącej",
"netto": 210,
"vat": 23,
"brutto": 258.3
},
{
"lp": 5,
"usluga": "Odzyskiwanie danych (wycena indywidualna)",
"netto": null,
"vat": null,
"brutto": null
},
{
"lp": 6,
"usluga": "Konfiguracja routera",
"netto": 90,
"vat": 23,
"brutto": 110.7
},
{
"lp": 7,
"usluga": "Szkolenie z obsługi (1 godz.)",
"netto": 100,
"vat": "zw.",
"brutto": 100
},
{
"lp": 8,
"usluga": "Dojazd do klienta (za km)",
"netto": 2.5,
"vat": 23,
"brutto": 3.08
}
]Grok 4.6 8/8 wierszy32 s
- Wszystkie 8 wierszy zgodne z tabelą, łącznie z nazwami łamanymi w PDF i wierszem bez danych.
[{"lp":1,"usluga":"Diagnostyka komputera","netto":120,"vat":23,"brutto":147.6},{"lp":2,"usluga":"Wymiana dysku SSD (bez części)","netto":180,"vat":23,"brutto":221.4},{"lp":3,"usluga":"Instalacja systemu operacyjnego","netto":150,"vat":23,"brutto":184.5},{"lp":4,"usluga":"Czyszczenie laptopa z wymianą pasty termoprzewodzącej","netto":210,"vat":23,"brutto":258.3},{"lp":5,"usluga":"Odzyskiwanie danych (wycena indywidualna)","netto":null,"vat":null,"brutto":null},{"lp":6,"usluga":"Konfiguracja routera","netto":90,"vat":23,"brutto":110.7},{"lp":7,"usluga":"Szkolenie z obsługi (1 godz.)","netto":100,"vat":"zw.","brutto":100},{"lp":8,"usluga":"Dojazd do klienta (za km)","netto":2.5,"vat":23,"brutto":3.08}]Qwen 3.8 Max 8/8 wierszy40.9 s
- Wszystkie 8 wierszy zgodne z tabelą, łącznie z nazwami łamanymi w PDF i wierszem bez danych.
[
{
"lp": 1,
"usluga": "Diagnostyka komputera",
"netto": 120.00,
"vat": 23,
"brutto": 147.60
},
{
"lp": 2,
"usluga": "Wymiana dysku SSD (bez części)",
"netto": 180.00,
"vat": 23,
"brutto": 221.40
},
{
"lp": 3,
"usluga": "Instalacja systemu operacyjnego",
"netto": 150.00,
"vat": 23,
"brutto": 184.50
},
{
"lp": 4,
"usluga": "Czyszczenie laptopa z wymianą pasty termoprzewodzącej",
"netto": 210.00,
"vat": 23,
"brutto": 258.30
},
{
"lp": 5,
"usluga": "Odzyskiwanie danych (wycena indywidualna)",
"netto": null,
"vat": null,
"brutto": null
},
{
"lp": 6,
"usluga": "Konfiguracja routera",
"netto": 90.00,
"vat": 23,
"brutto": 110.70
},
{
"lp": 7,
"usluga": "Szkolenie z obsługi (1 godz.)",
"netto": 100.00,
"vat": "zw.",
"brutto": 100.00
},
{
"lp": 8,
"usluga": "Dojazd do klienta (za km)",
"netto": 2.50,
"vat": 23,
"brutto": 3.08
}
]Kod: walidator PESEL z testami
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Model pisze funkcję Python walidującą PESEL (suma kontrolna, kodowanie stulecia w miesiącu, poprawność daty, płeć). Kod jest uruchamiany w zewnętrznej piaskownicy (Compiler Explorer, Python 3.12) na 10 wektorach: 5 poprawnych numerów z różnych stuleci i 5 pułapek (zła suma, 31 lutego, 10 znaków, litera, pusty ciąg). Wynik to liczba zaliczonych wektorów.
Pełny prompt (identyczny dla każdego modelu)
Napisz w Pythonie 3 funkcję waliduj_pesel(pesel: str) -> dict.
Wymagania:
- wejście to dowolny ciąg znaków; poprawny PESEL ma dokładnie 11 cyfr,
- suma kontrolna: wagi 1,3,7,9,1,3,7,9,1,3 dla pierwszych 10 cyfr; cyfra kontrolna = (10 - suma mod 10) mod 10 i musi być równa 11. cyfrze,
- stulecie zakodowane w miesiącu: 1800-1899 miesiąc + 80, 1900-1999 bez zmian, 2000-2099 miesiąc + 20, 2100-2199 miesiąc + 40, 2200-2299 miesiąc + 60,
- data musi być poprawną datą kalendarzową (np. 31 lutego jest błędny),
- płeć z 10. cyfry: parzysta = 'K', nieparzysta = 'M'.
Zwracany słownik: {'poprawny': bool, 'data_urodzenia': 'RRRR-MM-DD' albo None, 'plec': 'K'/'M' albo None}. Dla niepoprawnego numeru: {'poprawny': False, 'data_urodzenia': None, 'plec': None}. Funkcja nie może rzucać wyjątków dla żadnego wejścia.
Zwróć WYŁĄCZNIE kod Pythona (bez markdownu, bez omówienia). Nie dopisuj kodu uruchamiającego funkcję.10 wektorów testowych (model ich nie widzi)
85031212305→ {"poprawny":true,"data_urodzenia":"1985-03-12","plec":"K"}04313004573→ {"poprawny":true,"data_urodzenia":"2004-11-30","plec":"M"}71123199937→ {"poprawny":true,"data_urodzenia":"1971-12-31","plec":"M"}00222900702→ {"poprawny":true,"data_urodzenia":"2000-02-29","plec":"K"}99870432158→ {"poprawny":true,"data_urodzenia":"1899-07-04","plec":"M"}85031212306→ {"poprawny":false,"data_urodzenia":null,"plec":null}00223100705→ {"poprawny":false,"data_urodzenia":null,"plec":null}8503121230→ {"poprawny":false,"data_urodzenia":null,"plec":null}85031212a05→ {"poprawny":false,"data_urodzenia":null,"plec":null}(pusty)→ {"poprawny":false,"data_urodzenia":null,"plec":null}
Claude Opus 5 10/10 wektorów8 s
- Wszystkie 10 wektorów zaliczone, w tym 31 lutego z poprawną sumą kontrolną i rok 1899.
```python
import datetime
def waliduj_pesel(pesel: str) -> dict:
niepoprawny = {'poprawny': False, 'data_urodzenia': None, 'plec': None}
try:
if not isinstance(pesel, str):
return niepoprawny
if len(pesel) != 11:
return niepoprawny
if not all('0' <= znak <= '9' for znak in pesel):
return niepoprawny
cyfry = [ord(znak) - 48 for znak in pesel]
wagi = (1, 3, 7, 9, 1, 3, 7, 9, 1, 3)
suma = sum(w * c for w, c in zip(wagi, cyfry[:10]))
if (10 - suma % 10) % 10 != cyfry[10]:
return niepoprawny
rr = cyfry[0] * 10 + cyfry[1]
mm = cyfry[2] * 10 + cyfry[3]
dd = cyfry[4] * 10 + cyfry[5]
if 1 <= mm <= 12:
wiek = 1900
miesiac = mm
elif 21 <= mm <= 32:
wiek = 2000
miesiac = mm - 20
elif 41 <= mm <= 52:
wiek = 2100
miesiac = mm - 40
elif 61 <= mm <= 72:
wiek = 2200
miesiac = mm - 60
elif 81 <= mm <= 92:
wiek = 1800
miesiac = mm - 80
else:
return niepoprawny
rok = wiek + rr
try:
data = datetime.date(rok, miesiac, dd)
except ValueError:
return niepoprawny
plec = 'K' if cyfry[9] % 2 == 0 else 'M'
return {
'poprawny': True,
'data_urodzenia': '{:04d}-{:02d}-{:02d}'.format(data.year, data.month, data.day),
'plec': plec,
}
except Exception:
return {'poprawny': False, 'data_urodzenia': None, 'plec': None}
```GPT-6 Astra 10/10 wektorów17.4 s
- Wszystkie 10 wektorów zaliczone, w tym 31 lutego z poprawną sumą kontrolną i rok 1899.
from datetime import date
def waliduj_pesel(pesel: str) -> dict:
niepoprawny = {
"poprawny": False,
"data_urodzenia": None,
"plec": None,
}
try:
if not isinstance(pesel, str) or len(pesel) != 11:
return niepoprawny
if any(znak not in "0123456789" for znak in pesel):
return niepoprawny
cyfry = [int(znak) for znak in pesel]
wagi = (1, 3, 7, 9, 1, 3, 7, 9, 1, 3)
suma = sum(cyfra * waga for cyfra, waga in zip(cyfry[:10], wagi))
if (10 - suma % 10) % 10 != cyfry[10]:
return niepoprawny
rok = cyfry[0] * 10 + cyfry[1]
miesiac = cyfry[2] * 10 + cyfry[3]
dzien = cyfry[4] * 10 + cyfry[5]
if 1 <= miesiac <= 12:
rok += 1900
elif 21 <= miesiac <= 32:
rok += 2000
miesiac -= 20
elif 41 <= miesiac <= 52:
rok += 2100
miesiac -= 40
elif 61 <= miesiac <= 72:
rok += 2200
miesiac -= 60
elif 81 <= miesiac <= 92:
rok += 1800
miesiac -= 80
else:
return niepoprawny
data_urodzenia = date(rok, miesiac, dzien)
return {
"poprawny": True,
"data_urodzenia": data_urodzenia.isoformat(),
"plec": "K" if cyfry[9] % 2 == 0 else "M",
}
except Exception:
return niepoprawnyGemini 3.1 Pro 10/10 wektorów17 s
- Wszystkie 10 wektorów zaliczone, w tym 31 lutego z poprawną sumą kontrolną i rok 1899.
import datetime
def waliduj_pesel(pesel: str) -> dict:
wynik_bledny = {'poprawny': False, 'data_urodzenia': None, 'plec': None}
if not isinstance(pesel, str) or len(pesel) != 11 or not pesel.isdigit():
return wynik_bledny
wagi = [1, 3, 7, 9, 1, 3, 7, 9, 1, 3]
suma = sum(int(pesel[i]) * wagi[i] for i in range(10))
cyfra_kontrolna = (10 - (suma % 10)) % 10
if cyfra_kontrolna != int(pesel[10]):
return wynik_bledny
rok_dwie_cyfry = int(pesel[0:2])
miesiac_kod = int(pesel[2:4])
dzien = int(pesel[4:6])
if 81 <= miesiac_kod <= 92:
rok = 1800 + rok_dwie_cyfry
miesiac = miesiac_kod - 80
elif 1 <= miesiac_kod <= 12:
rok = 1900 + rok_dwie_cyfry
miesiac = miesiac_kod
elif 21 <= miesiac_kod <= 32:
rok = 2000 + rok_dwie_cyfry
miesiac = miesiac_kod - 20
elif 41 <= miesiac_kod <= 52:
rok = 2100 + rok_dwie_cyfry
miesiac = miesiac_kod - 40
elif 61 <= miesiac_kod <= 72:
rok = 2200 + rok_dwie_cyfry
miesiac = miesiac_kod - 60
else:
return wynik_bledny
try:
datetime.date(rok, miesiac, dzien)
except ValueError:
return wynik_bledny
cyfra_plci = int(pesel[9])
plec = 'K' if cyfra_plci % 2 == 0 else 'M'
data_urodzenia = f"{rok:04d}-{miesiac:02d}-{dzien:02d}"
return {
'poprawny': True,
'data_urodzenia': data_urodzenia,
'plec': plec
}Kimi K3 10/10 wektorów155.1 s
- Wszystkie 10 wektorów zaliczone, w tym 31 lutego z poprawną sumą kontrolną i rok 1899.
import datetime
def waliduj_pesel(pesel: str) -> dict:
niepoprawny = {'poprawny': False, 'data_urodzenia': None, 'plec': None}
try:
if not isinstance(pesel, str):
return niepoprawny
if len(pesel) != 11 or not pesel.isascii() or not pesel.isdigit():
return niepoprawny
cyfry = [int(c) for c in pesel]
wagi = (1, 3, 7, 9, 1, 3, 7, 9, 1, 3)
suma = sum(wagi[i] * cyfry[i] for i in range(10))
if (10 - suma % 10) % 10 != cyfry[10]:
return niepoprawny
rok = cyfry[0] * 10 + cyfry[1]
miesiac = cyfry[2] * 10 + cyfry[3]
dzien = cyfry[4] * 10 + cyfry[5]
if 1 <= miesiac <= 12:
stulecie = 1900
elif 21 <= miesiac <= 32:
stulecie = 2000
miesiac -= 20
elif 41 <= miesiac <= 52:
stulecie = 2100
miesiac -= 40
elif 61 <= miesiac <= 72:
stulecie = 2200
miesiac -= 60
elif 81 <= miesiac <= 92:
stulecie = 1800
miesiac -= 80
else:
return niepoprawny
rok += stulecie
try:
datetime.date(rok, miesiac, dzien)
except ValueError:
return niepoprawny
plec = 'K' if cyfry[9] % 2 == 0 else 'M'
return {
'poprawny': True,
'data_urodzenia': f'{rok:04d}-{miesiac:02d}-{dzien:02d}',
'plec': plec,
}
except Exception:
return {'poprawny': False, 'data_urodzenia': None, 'plec': None}DeepSeek V4 Pro brak odpowiedzi170 s
- przekroczony limit czasu 170 s
Błąd: przekroczony limit czasu 170 s
Grok 4.6 10/10 wektorów45.8 s
- Wszystkie 10 wektorów zaliczone, w tym 31 lutego z poprawną sumą kontrolną i rok 1899.
from datetime import datetime
def waliduj_pesel(pesel: str) -> dict:
invalid = {'poprawny': False, 'data_urodzenia': None, 'plec': None}
try:
if not isinstance(pesel, str) or len(pesel) != 11 or not pesel.isdigit():
return invalid
digits = [int(c) for c in pesel]
weights = (1, 3, 7, 9, 1, 3, 7, 9, 1, 3)
s = sum(d * w for d, w in zip(digits, weights))
control = (10 - s % 10) % 10
if control != digits[10]:
return invalid
yy = 10 * digits[0] + digits[1]
mm = 10 * digits[2] + digits[3]
dd = 10 * digits[4] + digits[5]
if 1 <= mm <= 12:
year = 1900 + yy
month = mm
elif 21 <= mm <= 32:
year = 2000 + yy
month = mm - 20
elif 41 <= mm <= 52:
year = 2100 + yy
month = mm - 40
elif 61 <= mm <= 72:
year = 2200 + yy
month = mm - 60
elif 81 <= mm <= 92:
year = 1800 + yy
month = mm - 80
else:
return invalid
datetime(year, month, dd)
plec = 'K' if digits[9] % 2 == 0 else 'M'
return {
'poprawny': True,
'data_urodzenia': f'{year:04d}-{month:02d}-{dd:02d}',
'plec': plec
}
except Exception:
return invalidQwen 3.8 Max brak odpowiedzi170 s
- przekroczony limit czasu 170 s
Błąd: przekroczony limit czasu 170 s
Co nie zadziałało w tym przebiegu
- DeepSeek V4 Pro, Kod: walidator PESEL z testami: przekroczony limit czasu 170 s.
- Qwen 3.8 Max, Kod: walidator PESEL z testami: przekroczony limit czasu 170 s.
Metodologia i zastrzeżenia
- Jedno wywołanie na parę model-zadanie, temperatura 0, bez system promptu, bez narzędzi. Nie powtarzam wywołania, gdy odpowiedź jest zła; powtarzam tylko, gdy API nie odpowiedziało (429, 5xx, zerwane połączenie), i zaznaczam to w zapisie.
- Ocena jest deterministyczna: kod PHP porównuje liczby i komórki, a kod modelu uruchamia zewnętrzna piaskownica Compiler Explorer (godbolt.org, Python 3.12). Żaden model nie ocenia innego modelu.
- Limit czasu odpowiedzi: 170 s. Przekroczenie liczy się jako brak odpowiedzi i tak jest publikowane, bo z perspektywy użytkownika to ten sam skutek. Limit tokenów odpowiedzi to 8000 łącznie z ukrytym rozumowaniem; model, który zużyje go na myślenie i nie odda treści, dostaje „pusta odpowiedź”.
- Ograniczenia: to trzy krótkie zadania po polsku, nie pełny obraz modelu. Zadania są jawne, więc mogą z czasem trafić do danych treningowych; dlatego protokół ma wersję, a zmiana zadań oznacza nową wersję i osobne porównanie.
- Cytując: „promptowy.com, test modeli AI, przebieg z 16.09.2026″ z linkiem do tego wpisu.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który model AI najlepiej poradził sobie z testem kontekstu przy 128k tokenach?
Kimi K3 i DeepSeek V4 Pro uzyskały wynik 2/2 przy 128k tokenach. Claude Opus 5 zaliczył tylko 1/1 przy 128k, ale popełnił błędy przy 8k i 32k, natomiast GPT-6 Astra, Gemini 3.1 Pro, Grok 4.6 i Qwen 3.8 Max były poza zakresem tego testu.
Czy któryś model nie dał żadnej odpowiedzi na zadanie z walidatorem PESEL?
Tak, DeepSeek V4 Pro i Qwen 3.8 Max zwróciły brak odpowiedzi w zadaniu z kodem walidatora PESEL. Oba modele ukończyły za to poprawnie zadanie redakcji tekstu i konwersji tabeli z PDF do JSON.
Jak długo trwał cały przebieg protokołu testowego z 16 września 2026?
Przebieg trwał od 20:19:01 do 20:45:03 czasu serwera, czyli około 26 minut. Testy były przeprowadzone przez OpenRouter, a każdy model otrzymał identyczne prompty przy temperaturze 0.
Ile wierszy tabeli poprawnie przekonwertowały modele AI w zadaniu z PDF do JSON?
Wszystkie modele, które zwróciły odpowiedź w tym zadaniu, uzyskały wynik 8/8 wierszy. DeepSeek V4 Pro osiągnął ten wynik w 24,5 s, a Qwen 3.8 Max w 40,9 s, mimo że oba później nie odpowiedziały na zadanie z walidatorem PESEL.
