🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 7 szt. albo Gemini Pro na 18 miesięcy 170 zł Kup teraz →
Przejdź do treści
Testy

Test modeli AI 16.09.2026: 7 modeli, 4 zadania, pełne wyniki

Przebieg z 16.09.2026: 7 modeli, te same 3 zadania (redakcja bez zmiany liczb, tabela z PDF, kod PESEL w piaskownicy) plus test kontekstu. Komplet zaliczyło 5 z 7. Pełne prompty i surowe odpowiedzi do wglądu.

22 min czytania

👁 116 przeczytań

// w skrócie
  • Wszystkie 7 modeli zaliczyły redakcję tekstu bez zmiany liczb, ale przy walidatorze PESEL DeepSeek V4 Pro i Qwen 3.8 Max zwróciły brak odpowiedzi.
  • Jedynym modelem, który zaliczył wszystkie próby testu kontekstu przy 8k, 32k i 128k tokenach, był Kimi K3 oraz DeepSeek V4 Pro, oba z wynikiem 2/2 na każdym poziomie.

Ten wpis to surowy zapis jednego przebiegu protokołu testowego Promptowego (v1 (16.09.2026)). Każdy z 7 modeli dostał identyczne prompty w tej samej kolejności, temperatura 0, jedno wywołanie na zadanie, bez ponownych prób po złej odpowiedzi. Ocenia PHP, nie inny model: porównanie liczb, komórek tabeli i uruchomienie kodu na stałych wektorach. Poniżej tabela zbiorcza, potem każde zadanie z pełnym promptem i surową odpowiedzią każdego modelu. Porażki, puste odpowiedzi i przekroczenia czasu zostają w tabeli.

Data przebiegu: 16.09.2026 (start 2026-09-16 20:19:01, koniec 2026-09-16 20:45:03, czas serwera). Modele wywołane przez OpenRouter; w tabeli podaję identyfikator zwrócony przez API, nie nazwę marketingową. Wszystkie przebiegi: kategoria Testy.

ModelRedakcja bez zmiany liczbTabela z PDF do JSONKod: walidator PESEL z testamiKontekst (igła w stogu)
Claude Opus 5anthropic/claude-opus-5zaliczone6.2 s8/8 wierszy5 s10/10 wektorów8 sbłąd @8k · błąd @32k · 1/1 @128k
GPT-6 Astraopenai/gpt-6-astrazaliczone4.9 s8/8 wierszy7.4 s10/10 wektorów17.4 spoza testem kontekstu
Gemini 3.1 Progoogle/gemini-3.1-pro-previewzaliczone19 s8/8 wierszy16.8 s10/10 wektorów17 spoza testem kontekstu
Kimi K3moonshotai/kimi-k3zaliczone59.3 s8/8 wierszy8.6 s10/10 wektorów155.1 s2/2 @8k · 2/2 @32k · 2/2 @128k
DeepSeek V4 Prodeepseek/deepseek-v4-prozaliczone40.2 s8/8 wierszy24.5 sbrak odpowiedzi170 s2/2 @8k · 2/2 @32k · 2/2 @128k
Grok 4.6x-ai/grok-4.6zaliczone27.9 s8/8 wierszy32 s10/10 wektorów45.8 spoza testem kontekstu
Qwen 3.8 Maxqwen/qwen3.8-max-0902zaliczone105.8 s8/8 wierszy40.9 sbrak odpowiedzi170 spoza testem kontekstu

Kolumna „Kontekst” to import z osobnego cotygodniowego testu okna kontekstu (przebieg 2026-09-14 06:43:32): trafienia/próby przy 8, 32 i 128 tys. tokenów. Tamten test obejmuje inny zestaw modeli (m.in. GPT-5.6 Terra), dlatego część komórek jest pusta. Wpis „błąd” oznacza, że wywołanie nie wróciło z odpowiedzią.

Redakcja bez zmiany liczb

Model dostaje tekst urzędowy z trzema literówkami i drętwymi zwrotami. Ma poprawić styl i literówki, nie ruszając ani jednej liczby, daty ani godziny. Oceniacz porównuje multizbiór liczb w oryginale i w odpowiedzi, sprawdza trzy literówki i format (sam tekst, bez nagłówków i list).

Pełny prompt (identyczny dla każdego modelu)
Popraw poniższy tekst pod względem stylu i literówek: usuń urzędowe zwroty, popraw błędy i literówki, zachowaj sens i wszystkie informacje.

ZASADY:
- nie zmieniaj żadnej liczby, daty ani godziny ani ich zapisu (cyfry zostają cyframi, nie zamieniaj liczb na słowa, nie dodawaj nowych liczb, nie usuwaj istniejących),
- nie dodawaj nagłówków, list, komentarzy ani wyjaśnień,
- zwróć wyłącznie poprawiony tekst jako jeden lub dwa akapity.

TEKST:
W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebódowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. W chwili obecnej radni zaplanowali na 2026 rok kwotę 16 mln zł, jednak skarbnik ostrzga, że przy inflacji na poziomie 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkanca przypada 1 146 zł wydatków drogowych. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1, a ich celem jest dokonanie ustalenia priorytetów na kolejne 4 lata.
Claude Opus 5 zaliczone6.2 s

Model wg API: anthropic/claude-opus-5 · dostawca Claude Platform on AWS · czas 6.2 s · tokeny 604 wej. / 441 wyj. · finish: stop · 2026-09-16 20:19:11

  • Liczby: wszystkie 18 zachowane co do znaku.
  • Literówki: wszystkie 3 poprawione.
  • Format: sam tekst, długość 98% oryginału.

Surowa odpowiedź:

W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebudowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. Obecnie radni zaplanowali na 2026 rok kwotę 16 mln zł, jednak skarbnik ostrzega, że przy inflacji na poziomie 4,7% realna wartość tej kwoty będzie niższa.

W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkańca przypada 1 146 zł wydatków drogowych. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1, a ich celem jest ustalenie priorytetów na kolejne 4 lata.
GPT-6 Astra zaliczone4.9 s

Model wg API: openai/gpt-6-astra · dostawca OpenAI · czas 4.9 s · tokeny 398 wej. / 249 wyj. · finish: stop · 2026-09-16 20:44:55

  • Liczby: wszystkie 18 zachowane co do znaku.
  • Literówki: wszystkie 3 poprawione.
  • Format: sam tekst, długość 98% oryginału.

Surowa odpowiedź:

W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebudowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. Radni zaplanowali na 2026 rok wydatki w wysokości 16 mln zł, jednak skarbnik ostrzega, że przy inflacji na poziomie 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkańca przypada 1 146 zł wydatków na drogi. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1. Ich celem jest ustalenie priorytetów na kolejne 4 lata.
Gemini 3.1 Pro zaliczone19 s

Model wg API: google/gemini-3.1-pro-preview · dostawca Google · czas 19 s · tokeny 387 wej. / 2705 wyj. · finish: stop · 2026-09-16 20:19:31

  • Liczby: wszystkie 18 zachowane co do znaku.
  • Literówki: wszystkie 3 poprawione.
  • Format: sam tekst, długość 97% oryginału.

Surowa odpowiedź:

W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebudowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. Obecnie radni zaplanowali na 2026 rok kwotę 16 mln zł, jednak skarbnik ostrzega, że przy inflacji na poziomie 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkańca przypada 1 146 zł wydatków drogowych. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1, a ich celem jest ustalenie priorytetów na kolejne 4 lata.
Kimi K3 zaliczone59.3 s

Model wg API: moonshotai/kimi-k3 · dostawca DigitalOcean · czas 59.3 s · tokeny 580 wej. / 1594 wyj. · finish: stop · 2026-09-16 20:20:30

  • Liczby: wszystkie 18 zachowane co do znaku.
  • Literówki: wszystkie 3 poprawione.
  • Format: sam tekst, długość 94% oryginału.

Surowa odpowiedź:

W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebudowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. Na 2026 rok radni zaplanowali 16 mln zł, jednak skarbnik ostrzega, że przy inflacji 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkańca przypada 1 146 zł wydatków drogowych. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1, a ich celem jest ustalenie priorytetów na kolejne 4 lata.
DeepSeek V4 Pro zaliczone40.2 s

Model wg API: deepseek/deepseek-v4-pro · dostawca StreamLake · czas 40.2 s · tokeny 412 wej. / 2145 wyj. · finish: stop · 2026-09-16 20:22:18

  • Liczby: wszystkie 18 zachowane co do znaku.
  • Literówki: wszystkie 3 poprawione.
  • Format: sam tekst, długość 96% oryginału.

Surowa odpowiedź:

W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebudowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. Obecnie radni zaplanowali na 2026 rok kwotę 16 mln zł, jednak skarbnik ostrzega, że przy inflacji 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkańca przypada 1 146 zł wydatków drogowych. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1, a ich celem jest ustalenie priorytetów na kolejne 4 lata.
Grok 4.6 zaliczone27.9 s

Model wg API: x-ai/grok-4.6 · dostawca xAI · czas 27.9 s · tokeny 565 wej. / 1724 wyj. · finish: stop · 2026-09-16 20:22:46

  • Liczby: wszystkie 18 zachowane co do znaku.
  • Literówki: wszystkie 3 poprawione.
  • Format: sam tekst, długość 97% oryginału.

Surowa odpowiedź:

W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebudowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. Obecnie radni zaplanowali na 2026 rok kwotę 16 mln zł, jednak skarbnik ostrzega, że przy inflacji na poziomie 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkańca przypada 1 146 zł wydatków drogowych. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1, a ich celem jest ustalenie priorytetów na kolejne 4 lata.
Qwen 3.8 Max zaliczone105.8 s

Model wg API: qwen/qwen3.8-max-0902 · dostawca Alibaba · czas 105.8 s · tokeny 454 wej. / 5173 wyj. · finish: stop · 2026-09-16 20:24:31

  • Liczby: wszystkie 18 zachowane co do znaku.
  • Literówki: wszystkie 3 poprawione.
  • Format: sam tekst, długość 92% oryginału.

Surowa odpowiedź:

W 2025 roku gmina Lipowo wydała na remonty dróg 14,3 mln zł, czyli o 2,1 mln zł więcej niż rok wcześniej. Najdroższa okazała się przebudowa ulicy Długiej, która kosztowała 3 850 000 zł za odcinek 1,8 km. Radni zaplanowali na 2026 rok 16 mln zł, jednak skarbnik ostrzega, że przy inflacji 4,7% realna wartość tej kwoty będzie niższa. W gminie mieszka 12 480 osób, a zarejestrowanych samochodów jest 7 912, więc na jednego mieszkańca przypada 1 146 zł wydatków drogowych. Konsultacje społeczne w tej sprawie odbędą się 21 października 2026 roku o godzinie 17:30 w sali nr 3 urzędu gminy przy ulicy Rynek 1, aby ustalić priorytety na kolejne 4 lata.

Tabela z PDF do JSON

Model dostaje warstwę tekstową cennika z PDF: dwa wiersze z nazwą przeniesioną do następnej linii, wiersz bez danych (kreski), usługa zwolniona z VAT z gwiazdką i przypisem. Ma zwrócić 8 wierszy jako JSON. Oceniacz porównuje każdą komórkę z wartością oczekiwaną; wiersz liczy się tylko w całości.

Pełny prompt (identyczny dla każdego modelu)
Poniżej tekst wyciągnięty z pliku PDF (warstwa tekstowa, kolumny rozdzielone spacjami, niektóre nazwy przeniesione do następnej linii).

Zwróć WYŁĄCZNIE JSON: tablicę 8 obiektów z kluczami:
- "lp" (liczba całkowita),
- "usluga" (pełna nazwa usługi, łącznie z częścią przeniesioną do następnej linii, bez gwiazdki),
- "netto" (liczba lub null, gdy brak),
- "vat" (stawka jako liczba, np. 23; tekst "zw." dla usługi zwolnionej; null, gdy brak),
- "brutto" (liczba lub null, gdy brak).
Bez komentarzy, bez markdownu, bez tekstu poza JSON-em.

TEKST Z PDF:
CENNIK USŁUG SERWISOWYCH                          obowiązuje od 1.03.2026

Lp.  Usługa                                  Cena netto   VAT    Cena brutto
1    Diagnostyka komputera                       120,00   23%        147,60
2    Wymiana dysku SSD (bez części)              180,00   23%        221,40
3    Instalacja systemu operacyjnego             150,00   23%        184,50
4    Czyszczenie laptopa z wymianą
     pasty termoprzewodzącej                     210,00   23%        258,30
5    Odzyskiwanie danych (wycena
     indywidualna)                                    -      -             -
6    Konfiguracja routera                         90,00   23%        110,70
7    Szkolenie z obsługi (1 godz.)*              100,00   zw.        100,00
8    Dojazd do klienta (za km)                     2,50   23%          3,08

* usługa zwolniona z VAT na podstawie art. 43 ust. 1 pkt 29 ustawy
Claude Opus 5 8/8 wierszy5 s

Model wg API: anthropic/claude-opus-5 · dostawca Claude Platform on AWS · czas 5 s · tokeny 660 wej. / 427 wyj. · finish: stop · 2026-09-16 20:25:42

  • Wszystkie 8 wierszy zgodne z tabelą, łącznie z nazwami łamanymi w PDF i wierszem bez danych.

Surowa odpowiedź:

[{"lp":1,"usluga":"Diagnostyka komputera","netto":120.00,"vat":23,"brutto":147.60},{"lp":2,"usluga":"Wymiana dysku SSD (bez części)","netto":180.00,"vat":23,"brutto":221.40},{"lp":3,"usluga":"Instalacja systemu operacyjnego","netto":150.00,"vat":23,"brutto":184.50},{"lp":4,"usluga":"Czyszczenie laptopa z wymianą pasty termoprzewodzącej","netto":210.00,"vat":23,"brutto":258.30},{"lp":5,"usluga":"Odzyskiwanie danych (wycena indywidualna)","netto":null,"vat":null,"brutto":null},{"lp":6,"usluga":"Konfiguracja routera","netto":90.00,"vat":23,"brutto":110.70},{"lp":7,"usluga":"Szkolenie z obsługi (1 godz.)","netto":100.00,"vat":"zw.","brutto":100.00},{"lp":8,"usluga":"Dojazd do klienta (za km)","netto":2.50,"vat":23,"brutto":3.08}]
GPT-6 Astra 8/8 wierszy7.4 s

Model wg API: openai/gpt-6-astra · dostawca OpenAI · czas 7.4 s · tokeny 490 wej. / 450 wyj. · finish: stop · 2026-09-16 20:45:03

  • Wszystkie 8 wierszy zgodne z tabelą, łącznie z nazwami łamanymi w PDF i wierszem bez danych.

Surowa odpowiedź:

[
  {
    "lp": 1,
    "usluga": "Diagnostyka komputera",
    "netto": 120.00,
    "vat": 23,
    "brutto": 147.60
  },
  {
    "lp": 2,
    "usluga": "Wymiana dysku SSD (bez części)",
    "netto": 180.00,
    "vat": 23,
    "brutto": 221.40
  },
  {
    "lp": 3,
    "usluga": "Instalacja systemu operacyjnego",
    "netto": 150.00,
    "vat": 23,
    "brutto": 184.50
  },
  {
    "lp": 4,
    "usluga": "Czyszczenie laptopa z wymianą pasty termoprzewodzącej",
    "netto": 210.00,
    "vat": 23,
    "brutto": 258.30
  },
  {
    "lp": 5,
    "usluga": "Odzyskiwanie danych (wycena indywidualna)",
    "netto": null,
    "vat": null,
    "brutto": null
  },
  {
    "lp": 6,
    "usluga": "Konfiguracja routera",
    "netto": 90.00,
    "vat": 23,
    "brutto": 110.70
  },
  {
    "lp": 7,
    "usluga": "Szkolenie z obsługi (1 godz.)",
    "netto": 100.00,
    "vat": "zw.",
    "brutto": 100.00
  },
  {
    "lp": 8,
    "usluga": "Dojazd do klienta (za km)",
    "netto": 2.50,
    "vat": 23,
    "brutto": 3.08
  }
]
Gemini 3.1 Pro 8/8 wierszy16.8 s

Model wg API: google/gemini-3.1-pro-preview · dostawca Google · czas 16.8 s · tokeny 504 wej. / 2440 wyj. · finish: stop · 2026-09-16 20:26:00

  • Wszystkie 8 wierszy zgodne z tabelą, łącznie z nazwami łamanymi w PDF i wierszem bez danych.

Surowa odpowiedź:

[
  {
    "lp": 1,
    "usluga": "Diagnostyka komputera",
    "netto": 120.00,
    "vat": 23,
    "brutto": 147.60
  },
  {
    "lp": 2,
    "usluga": "Wymiana dysku SSD (bez części)",
    "netto": 180.00,
    "vat": 23,
    "brutto": 221.40
  },
  {
    "lp": 3,
    "usluga": "Instalacja systemu operacyjnego",
    "netto": 150.00,
    "vat": 23,
    "brutto": 184.50
  },
  {
    "lp": 4,
    "usluga": "Czyszczenie laptopa z wymianą pasty termoprzewodzącej",
    "netto": 210.00,
    "vat": 23,
    "brutto": 258.30
  },
  {
    "lp": 5,
    "usluga": "Odzyskiwanie danych (wycena indywidualna)",
    "netto": null,
    "vat": null,
    "brutto": null
  },
  {
    "lp": 6,
    "usluga": "Konfiguracja routera",
    "netto": 90.00,
    "vat": 23,
    "brutto": 110.70
  },
  {
    "lp": 7,
    "usluga": "Szkolenie z obsługi (1 godz.)",
    "netto": 100.00,
    "vat": "zw.",
    "brutto": 100.00
  },
  {
    "lp": 8,
    "usluga": "Dojazd do klienta (za km)",
    "netto": 2.50,
    "vat": 23,
    "brutto": 3.08
  }
]
Kimi K3 8/8 wierszy8.6 s

Model wg API: moonshotai/kimi-k3 · dostawca Together · czas 8.6 s · tokeny 634 wej. / 1050 wyj. · finish: stop · 2026-09-16 20:26:09

  • Wszystkie 8 wierszy zgodne z tabelą, łącznie z nazwami łamanymi w PDF i wierszem bez danych.

Surowa odpowiedź:

[{"lp":1,"usluga":"Diagnostyka komputera","netto":120.00,"vat":23,"brutto":147.60},{"lp":2,"usluga":"Wymiana dysku SSD (bez części)","netto":180.00,"vat":23,"brutto":221.40},{"lp":3,"usluga":"Instalacja systemu operacyjnego","netto":150.00,"vat":23,"brutto":184.50},{"lp":4,"usluga":"Czyszczenie laptopa z wymianą pasty termoprzewodzącej","netto":210.00,"vat":23,"brutto":258.30},{"lp":5,"usluga":"Odzyskiwanie danych (wycena indywidualna)","netto":null,"vat":null,"brutto":null},{"lp":6,"usluga":"Konfiguracja routera","netto":90.00,"vat":23,"brutto":110.70},{"lp":7,"usluga":"Szkolenie z obsługi (1 godz.)","netto":100.00,"vat":"zw.","brutto":100.00},{"lp":8,"usluga":"Dojazd do klienta (za km)","netto":2.50,"vat":23,"brutto":3.08}]
DeepSeek V4 Pro 8/8 wierszy24.5 s

Model wg API: deepseek/deepseek-v4-pro · dostawca Baidu · czas 24.5 s · tokeny 479 wej. / 1876 wyj. · finish: stop · 2026-09-16 20:26:33

  • Wszystkie 8 wierszy zgodne z tabelą, łącznie z nazwami łamanymi w PDF i wierszem bez danych.

Surowa odpowiedź:

[
  {
    "lp": 1,
    "usluga": "Diagnostyka komputera",
    "netto": 120,
    "vat": 23,
    "brutto": 147.6
  },
  {
    "lp": 2,
    "usluga": "Wymiana dysku SSD (bez części)",
    "netto": 180,
    "vat": 23,
    "brutto": 221.4
  },
  {
    "lp": 3,
    "usluga": "Instalacja systemu operacyjnego",
    "netto": 150,
    "vat": 23,
    "brutto": 184.5
  },
  {
    "lp": 4,
    "usluga": "Czyszczenie laptopa z wymianą pasty termoprzewodzącej",
    "netto": 210,
    "vat": 23,
    "brutto": 258.3
  },
  {
    "lp": 5,
    "usluga": "Odzyskiwanie danych (wycena indywidualna)",
    "netto": null,
    "vat": null,
    "brutto": null
  },
  {
    "lp": 6,
    "usluga": "Konfiguracja routera",
    "netto": 90,
    "vat": 23,
    "brutto": 110.7
  },
  {
    "lp": 7,
    "usluga": "Szkolenie z obsługi (1 godz.)",
    "netto": 100,
    "vat": "zw.",
    "brutto": 100
  },
  {
    "lp": 8,
    "usluga": "Dojazd do klienta (za km)",
    "netto": 2.5,
    "vat": 23,
    "brutto": 3.08
  }
]
Grok 4.6 8/8 wierszy32 s

Model wg API: x-ai/grok-4.6 · dostawca xAI · czas 32 s · tokeny 671 wej. / 2378 wyj. · finish: stop · 2026-09-16 20:27:05

  • Wszystkie 8 wierszy zgodne z tabelą, łącznie z nazwami łamanymi w PDF i wierszem bez danych.

Surowa odpowiedź:

[{"lp":1,"usluga":"Diagnostyka komputera","netto":120,"vat":23,"brutto":147.6},{"lp":2,"usluga":"Wymiana dysku SSD (bez części)","netto":180,"vat":23,"brutto":221.4},{"lp":3,"usluga":"Instalacja systemu operacyjnego","netto":150,"vat":23,"brutto":184.5},{"lp":4,"usluga":"Czyszczenie laptopa z wymianą pasty termoprzewodzącej","netto":210,"vat":23,"brutto":258.3},{"lp":5,"usluga":"Odzyskiwanie danych (wycena indywidualna)","netto":null,"vat":null,"brutto":null},{"lp":6,"usluga":"Konfiguracja routera","netto":90,"vat":23,"brutto":110.7},{"lp":7,"usluga":"Szkolenie z obsługi (1 godz.)","netto":100,"vat":"zw.","brutto":100},{"lp":8,"usluga":"Dojazd do klienta (za km)","netto":2.5,"vat":23,"brutto":3.08}]
Qwen 3.8 Max 8/8 wierszy40.9 s

Model wg API: qwen/qwen3.8-max-0902 · dostawca Alibaba · czas 40.9 s · tokeny 582 wej. / 2013 wyj. · finish: stop · 2026-09-16 20:27:46

  • Wszystkie 8 wierszy zgodne z tabelą, łącznie z nazwami łamanymi w PDF i wierszem bez danych.

Surowa odpowiedź:

[
  {
    "lp": 1,
    "usluga": "Diagnostyka komputera",
    "netto": 120.00,
    "vat": 23,
    "brutto": 147.60
  },
  {
    "lp": 2,
    "usluga": "Wymiana dysku SSD (bez części)",
    "netto": 180.00,
    "vat": 23,
    "brutto": 221.40
  },
  {
    "lp": 3,
    "usluga": "Instalacja systemu operacyjnego",
    "netto": 150.00,
    "vat": 23,
    "brutto": 184.50
  },
  {
    "lp": 4,
    "usluga": "Czyszczenie laptopa z wymianą pasty termoprzewodzącej",
    "netto": 210.00,
    "vat": 23,
    "brutto": 258.30
  },
  {
    "lp": 5,
    "usluga": "Odzyskiwanie danych (wycena indywidualna)",
    "netto": null,
    "vat": null,
    "brutto": null
  },
  {
    "lp": 6,
    "usluga": "Konfiguracja routera",
    "netto": 90.00,
    "vat": 23,
    "brutto": 110.70
  },
  {
    "lp": 7,
    "usluga": "Szkolenie z obsługi (1 godz.)",
    "netto": 100.00,
    "vat": "zw.",
    "brutto": 100.00
  },
  {
    "lp": 8,
    "usluga": "Dojazd do klienta (za km)",
    "netto": 2.50,
    "vat": 23,
    "brutto": 3.08
  }
]

Kod: walidator PESEL z testami

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Model pisze funkcję Python walidującą PESEL (suma kontrolna, kodowanie stulecia w miesiącu, poprawność daty, płeć). Kod jest uruchamiany w zewnętrznej piaskownicy (Compiler Explorer, Python 3.12) na 10 wektorach: 5 poprawnych numerów z różnych stuleci i 5 pułapek (zła suma, 31 lutego, 10 znaków, litera, pusty ciąg). Wynik to liczba zaliczonych wektorów.

Pełny prompt (identyczny dla każdego modelu)
Napisz w Pythonie 3 funkcję waliduj_pesel(pesel: str) -> dict.

Wymagania:
- wejście to dowolny ciąg znaków; poprawny PESEL ma dokładnie 11 cyfr,
- suma kontrolna: wagi 1,3,7,9,1,3,7,9,1,3 dla pierwszych 10 cyfr; cyfra kontrolna = (10 - suma mod 10) mod 10 i musi być równa 11. cyfrze,
- stulecie zakodowane w miesiącu: 1800-1899 miesiąc + 80, 1900-1999 bez zmian, 2000-2099 miesiąc + 20, 2100-2199 miesiąc + 40, 2200-2299 miesiąc + 60,
- data musi być poprawną datą kalendarzową (np. 31 lutego jest błędny),
- płeć z 10. cyfry: parzysta = 'K', nieparzysta = 'M'.

Zwracany słownik: {'poprawny': bool, 'data_urodzenia': 'RRRR-MM-DD' albo None, 'plec': 'K'/'M' albo None}. Dla niepoprawnego numeru: {'poprawny': False, 'data_urodzenia': None, 'plec': None}. Funkcja nie może rzucać wyjątków dla żadnego wejścia.

Zwróć WYŁĄCZNIE kod Pythona (bez markdownu, bez omówienia). Nie dopisuj kodu uruchamiającego funkcję.
10 wektorów testowych (model ich nie widzi)
  • 85031212305 → {"poprawny":true,"data_urodzenia":"1985-03-12","plec":"K"}
  • 04313004573 → {"poprawny":true,"data_urodzenia":"2004-11-30","plec":"M"}
  • 71123199937 → {"poprawny":true,"data_urodzenia":"1971-12-31","plec":"M"}
  • 00222900702 → {"poprawny":true,"data_urodzenia":"2000-02-29","plec":"K"}
  • 99870432158 → {"poprawny":true,"data_urodzenia":"1899-07-04","plec":"M"}
  • 85031212306 → {"poprawny":false,"data_urodzenia":null,"plec":null}
  • 00223100705 → {"poprawny":false,"data_urodzenia":null,"plec":null}
  • 8503121230 → {"poprawny":false,"data_urodzenia":null,"plec":null}
  • 85031212a05 → {"poprawny":false,"data_urodzenia":null,"plec":null}
  • (pusty) → {"poprawny":false,"data_urodzenia":null,"plec":null}
Claude Opus 5 10/10 wektorów8 s

Model wg API: anthropic/claude-opus-5 · dostawca Claude Platform on AWS · czas 8 s · tokeny 541 wej. / 741 wyj. · finish: stop · 2026-09-16 20:28:33

  • Wszystkie 10 wektorów zaliczone, w tym 31 lutego z poprawną sumą kontrolną i rok 1899.

Surowa odpowiedź:

```python
import datetime


def waliduj_pesel(pesel: str) -> dict:
    niepoprawny = {'poprawny': False, 'data_urodzenia': None, 'plec': None}

    try:
        if not isinstance(pesel, str):
            return niepoprawny

        if len(pesel) != 11:
            return niepoprawny

        if not all('0' <= znak <= '9' for znak in pesel):
            return niepoprawny

        cyfry = [ord(znak) - 48 for znak in pesel]

        wagi = (1, 3, 7, 9, 1, 3, 7, 9, 1, 3)
        suma = sum(w * c for w, c in zip(wagi, cyfry[:10]))
        if (10 - suma % 10) % 10 != cyfry[10]:
            return niepoprawny

        rr = cyfry[0] * 10 + cyfry[1]
        mm = cyfry[2] * 10 + cyfry[3]
        dd = cyfry[4] * 10 + cyfry[5]

        if 1 <= mm <= 12:
            wiek = 1900
            miesiac = mm
        elif 21 <= mm <= 32:
            wiek = 2000
            miesiac = mm - 20
        elif 41 <= mm <= 52:
            wiek = 2100
            miesiac = mm - 40
        elif 61 <= mm <= 72:
            wiek = 2200
            miesiac = mm - 60
        elif 81 <= mm <= 92:
            wiek = 1800
            miesiac = mm - 80
        else:
            return niepoprawny

        rok = wiek + rr

        try:
            data = datetime.date(rok, miesiac, dd)
        except ValueError:
            return niepoprawny

        plec = 'K' if cyfry[9] % 2 == 0 else 'M'

        return {
            'poprawny': True,
            'data_urodzenia': '{:04d}-{:02d}-{:02d}'.format(data.year, data.month, data.day),
            'plec': plec,
        }
    except Exception:
        return {'poprawny': False, 'data_urodzenia': None, 'plec': None}
```
GPT-6 Astra 10/10 wektorów17.4 s

Model wg API: openai/gpt-6-astra · dostawca OpenAI · czas 17.4 s · tokeny 366 wej. / 602 wyj. · finish: stop · 2026-09-16 20:28:51

  • Wszystkie 10 wektorów zaliczone, w tym 31 lutego z poprawną sumą kontrolną i rok 1899.

Surowa odpowiedź:

from datetime import date


def waliduj_pesel(pesel: str) -> dict:
    niepoprawny = {
        "poprawny": False,
        "data_urodzenia": None,
        "plec": None,
    }

    try:
        if not isinstance(pesel, str) or len(pesel) != 11:
            return niepoprawny
        if any(znak not in "0123456789" for znak in pesel):
            return niepoprawny

        cyfry = [int(znak) for znak in pesel]
        wagi = (1, 3, 7, 9, 1, 3, 7, 9, 1, 3)
        suma = sum(cyfra * waga for cyfra, waga in zip(cyfry[:10], wagi))
        if (10 - suma % 10) % 10 != cyfry[10]:
            return niepoprawny

        rok = cyfry[0] * 10 + cyfry[1]
        miesiac = cyfry[2] * 10 + cyfry[3]
        dzien = cyfry[4] * 10 + cyfry[5]

        if 1 <= miesiac <= 12:
            rok += 1900
        elif 21 <= miesiac <= 32:
            rok += 2000
            miesiac -= 20
        elif 41 <= miesiac <= 52:
            rok += 2100
            miesiac -= 40
        elif 61 <= miesiac <= 72:
            rok += 2200
            miesiac -= 60
        elif 81 <= miesiac <= 92:
            rok += 1800
            miesiac -= 80
        else:
            return niepoprawny

        data_urodzenia = date(rok, miesiac, dzien)

        return {
            "poprawny": True,
            "data_urodzenia": data_urodzenia.isoformat(),
            "plec": "K" if cyfry[9] % 2 == 0 else "M",
        }
    except Exception:
        return niepoprawny
Gemini 3.1 Pro 10/10 wektorów17 s

Model wg API: google/gemini-3.1-pro-preview · dostawca Google · czas 17 s · tokeny 403 wej. / 2532 wyj. · finish: stop · 2026-09-16 20:29:09

  • Wszystkie 10 wektorów zaliczone, w tym 31 lutego z poprawną sumą kontrolną i rok 1899.

Surowa odpowiedź:

import datetime

def waliduj_pesel(pesel: str) -> dict:
    wynik_bledny = {'poprawny': False, 'data_urodzenia': None, 'plec': None}
    
    if not isinstance(pesel, str) or len(pesel) != 11 or not pesel.isdigit():
        return wynik_bledny
        
    wagi = [1, 3, 7, 9, 1, 3, 7, 9, 1, 3]
    suma = sum(int(pesel[i]) * wagi[i] for i in range(10))
    cyfra_kontrolna = (10 - (suma % 10)) % 10
    
    if cyfra_kontrolna != int(pesel[10]):
        return wynik_bledny
        
    rok_dwie_cyfry = int(pesel[0:2])
    miesiac_kod = int(pesel[2:4])
    dzien = int(pesel[4:6])
    
    if 81 <= miesiac_kod <= 92:
        rok = 1800 + rok_dwie_cyfry
        miesiac = miesiac_kod - 80
    elif 1 <= miesiac_kod <= 12:
        rok = 1900 + rok_dwie_cyfry
        miesiac = miesiac_kod
    elif 21 <= miesiac_kod <= 32:
        rok = 2000 + rok_dwie_cyfry
        miesiac = miesiac_kod - 20
    elif 41 <= miesiac_kod <= 52:
        rok = 2100 + rok_dwie_cyfry
        miesiac = miesiac_kod - 40
    elif 61 <= miesiac_kod <= 72:
        rok = 2200 + rok_dwie_cyfry
        miesiac = miesiac_kod - 60
    else:
        return wynik_bledny
        
    try:
        datetime.date(rok, miesiac, dzien)
    except ValueError:
        return wynik_bledny
        
    cyfra_plci = int(pesel[9])
    plec = 'K' if cyfra_plci % 2 == 0 else 'M'
    
    data_urodzenia = f"{rok:04d}-{miesiac:02d}-{dzien:02d}"
    
    return {
        'poprawny': True,
        'data_urodzenia': data_urodzenia,
        'plec': plec
    }
Kimi K3 10/10 wektorów155.1 s

Model wg API: moonshotai/kimi-k3 · dostawca Together · czas 155.1 s · tokeny 499 wej. / 3136 wyj. · finish: stop · 2026-09-16 20:31:44

  • Wszystkie 10 wektorów zaliczone, w tym 31 lutego z poprawną sumą kontrolną i rok 1899.

Surowa odpowiedź:

import datetime


def waliduj_pesel(pesel: str) -> dict:
    niepoprawny = {'poprawny': False, 'data_urodzenia': None, 'plec': None}
    try:
        if not isinstance(pesel, str):
            return niepoprawny
        if len(pesel) != 11 or not pesel.isascii() or not pesel.isdigit():
            return niepoprawny

        cyfry = [int(c) for c in pesel]

        wagi = (1, 3, 7, 9, 1, 3, 7, 9, 1, 3)
        suma = sum(wagi[i] * cyfry[i] for i in range(10))
        if (10 - suma % 10) % 10 != cyfry[10]:
            return niepoprawny

        rok = cyfry[0] * 10 + cyfry[1]
        miesiac = cyfry[2] * 10 + cyfry[3]
        dzien = cyfry[4] * 10 + cyfry[5]

        if 1 <= miesiac <= 12:
            stulecie = 1900
        elif 21 <= miesiac <= 32:
            stulecie = 2000
            miesiac -= 20
        elif 41 <= miesiac <= 52:
            stulecie = 2100
            miesiac -= 40
        elif 61 <= miesiac <= 72:
            stulecie = 2200
            miesiac -= 60
        elif 81 <= miesiac <= 92:
            stulecie = 1800
            miesiac -= 80
        else:
            return niepoprawny

        rok += stulecie

        try:
            datetime.date(rok, miesiac, dzien)
        except ValueError:
            return niepoprawny

        plec = 'K' if cyfry[9] % 2 == 0 else 'M'

        return {
            'poprawny': True,
            'data_urodzenia': f'{rok:04d}-{miesiac:02d}-{dzien:02d}',
            'plec': plec,
        }
    except Exception:
        return {'poprawny': False, 'data_urodzenia': None, 'plec': None}
DeepSeek V4 Pro brak odpowiedzi170 s

Model wg API: - · czas 170 s · tokeny 0 wej. / 0 wyj. · 2026-09-16 20:39:30

  • przekroczony limit czasu 170 s

Błąd: przekroczony limit czasu 170 s

Grok 4.6 10/10 wektorów45.8 s

Model wg API: x-ai/grok-4.6 · dostawca xAI · czas 45.8 s · tokeny 565 wej. / 3307 wyj. · finish: stop · 2026-09-16 20:40:52

  • Wszystkie 10 wektorów zaliczone, w tym 31 lutego z poprawną sumą kontrolną i rok 1899.

Surowa odpowiedź:

from datetime import datetime

def waliduj_pesel(pesel: str) -> dict:
    invalid = {'poprawny': False, 'data_urodzenia': None, 'plec': None}
    try:
        if not isinstance(pesel, str) or len(pesel) != 11 or not pesel.isdigit():
            return invalid
        digits = [int(c) for c in pesel]
        weights = (1, 3, 7, 9, 1, 3, 7, 9, 1, 3)
        s = sum(d * w for d, w in zip(digits, weights))
        control = (10 - s % 10) % 10
        if control != digits[10]:
            return invalid
        yy = 10 * digits[0] + digits[1]
        mm = 10 * digits[2] + digits[3]
        dd = 10 * digits[4] + digits[5]
        if 1 <= mm <= 12:
            year = 1900 + yy
            month = mm
        elif 21 <= mm <= 32:
            year = 2000 + yy
            month = mm - 20
        elif 41 <= mm <= 52:
            year = 2100 + yy
            month = mm - 40
        elif 61 <= mm <= 72:
            year = 2200 + yy
            month = mm - 60
        elif 81 <= mm <= 92:
            year = 1800 + yy
            month = mm - 80
        else:
            return invalid
        datetime(year, month, dd)
        plec = 'K' if digits[9] % 2 == 0 else 'M'
        return {
            'poprawny': True,
            'data_urodzenia': f'{year:04d}-{month:02d}-{dd:02d}',
            'plec': plec
        }
    except Exception:
        return invalid
Qwen 3.8 Max brak odpowiedzi170 s

Model wg API: - · czas 170 s · tokeny 0 wej. / 0 wyj. · 2026-09-16 20:43:43

  • przekroczony limit czasu 170 s

Błąd: przekroczony limit czasu 170 s

Co nie zadziałało w tym przebiegu

  • DeepSeek V4 Pro, Kod: walidator PESEL z testami: przekroczony limit czasu 170 s.
  • Qwen 3.8 Max, Kod: walidator PESEL z testami: przekroczony limit czasu 170 s.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Metodologia i zastrzeżenia

  • Jedno wywołanie na parę model-zadanie, temperatura 0, bez system promptu, bez narzędzi. Nie powtarzam wywołania, gdy odpowiedź jest zła; powtarzam tylko, gdy API nie odpowiedziało (429, 5xx, zerwane połączenie), i zaznaczam to w zapisie.
  • Ocena jest deterministyczna: kod PHP porównuje liczby i komórki, a kod modelu uruchamia zewnętrzna piaskownica Compiler Explorer (godbolt.org, Python 3.12). Żaden model nie ocenia innego modelu.
  • Limit czasu odpowiedzi: 170 s. Przekroczenie liczy się jako brak odpowiedzi i tak jest publikowane, bo z perspektywy użytkownika to ten sam skutek. Limit tokenów odpowiedzi to 8000 łącznie z ukrytym rozumowaniem; model, który zużyje go na myślenie i nie odda treści, dostaje „pusta odpowiedź”.
  • Ograniczenia: to trzy krótkie zadania po polsku, nie pełny obraz modelu. Zadania są jawne, więc mogą z czasem trafić do danych treningowych; dlatego protokół ma wersję, a zmiana zadań oznacza nową wersję i osobne porównanie.
  • Cytując: „promptowy.com, test modeli AI, przebieg z 16.09.2026″ z linkiem do tego wpisu.
// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Który model AI najlepiej poradził sobie z testem kontekstu przy 128k tokenach?

Kimi K3 i DeepSeek V4 Pro uzyskały wynik 2/2 przy 128k tokenach. Claude Opus 5 zaliczył tylko 1/1 przy 128k, ale popełnił błędy przy 8k i 32k, natomiast GPT-6 Astra, Gemini 3.1 Pro, Grok 4.6 i Qwen 3.8 Max były poza zakresem tego testu.

Czy któryś model nie dał żadnej odpowiedzi na zadanie z walidatorem PESEL?

Tak, DeepSeek V4 Pro i Qwen 3.8 Max zwróciły brak odpowiedzi w zadaniu z kodem walidatora PESEL. Oba modele ukończyły za to poprawnie zadanie redakcji tekstu i konwersji tabeli z PDF do JSON.

Jak długo trwał cały przebieg protokołu testowego z 16 września 2026?

Przebieg trwał od 20:19:01 do 20:45:03 czasu serwera, czyli około 26 minut. Testy były przeprowadzone przez OpenRouter, a każdy model otrzymał identyczne prompty przy temperaturze 0.

Ile wierszy tabeli poprawnie przekonwertowały modele AI w zadaniu z PDF do JSON?

Wszystkie modele, które zwróciły odpowiedź w tym zadaniu, uzyskały wynik 8/8 wierszy. DeepSeek V4 Pro osiągnął ten wynik w 24,5 s, a Qwen 3.8 Max w 40,9 s, mimo że oba później nie odpowiedziały na zadanie z walidatorem PESEL.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie