Claude for Startups i 100+ programów z darmowymi kredytami AI dla startupów i JDG Darmowe kredyty AI dla Twojej firmy Sprawdź, co dostaniesz
✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Newsy

Która AI zdałaby maturę 2026: trzy modele z kompletem 220/220

Claude Opus 5.5, GPT-6.1 Sol i Gemini 3.8 Flash zdobyły 220/220 punktów na arkuszach CKE z maja 2026. Modele traciły punkty głównie na polskim.

5 min czytania
Która AI zdałaby maturę 2026 - trzy modele z kompletem 220/220 punktów

👁 118 przeczytań

Dałem dziesięciu modelom AI prawdziwe arkusze matury z maja 2026 i oceniłem je według kluczy CKE. Trzy modele - Claude Opus 5.5, GPT-6.1 Sol i Gemini 3.8 Flash - zdobyły komplet 220 na 220 punktów z matematyki podstawowej, rozszerzonej, polskiego i angielskiego. Każdy model, który doszedł do końca, zdałby maturę z dużym zapasem: najsłabszy wynik z przedmiotu to 70%, a próg to 30%. Pełna tabela, metodologia i przykłady błędów są w hubie Matura AI.

Jak wyglądał test

Pobrałem z cke.gov.pl publiczne arkusze z terminu głównego, czyli z maja 2026, razem z zasadami oceniania. W zestawie były cztery egzaminy:

  • matematyka na poziomie podstawowym - 50 punktów;
  • matematyka na poziomie rozszerzonym - 50 punktów;
  • język polski na poziomie podstawowym - 25 punktów za testy i 35 za wypracowanie;
  • język angielski na poziomie podstawowym - 60 punktów.

Modele z wejściem obrazowym dostawały zadania z matematyki jako wycinki arkusza, więc widziały wzory, wykresy i rysunki tak jak zdający. Polski i angielski szły jednym zapytaniem, z ilustracjami jako obrazy. Zadania zamknięte sprawdzałem automatycznie z kluczem CKE. Otwarte, w tym wypracowanie, oceniał sędzia - model Gemini 3.8 Flash z fragmentem oficjalnych zasad oceniania dla każdego zadania. Wszystkie modele odpowiadały przez OpenRoutera, bez internetu i bez podpowiedzi.

Wyniki: trzy komplety i nikt poniżej progu

ModelPunkty /220ŚrednioNajsłabszy przedmiot
Claude Opus 5.5220100%-
GPT-6.1 Sol220100%-
Gemini 3.8 Flash220100%-
Claude Haiku 5.521597,9%polski 56/60
GPT-6 Luna21597,9%polski 55/60
Claude Sonnet 5.521397,1%polski 55/60
Mistral Large 421196%polski 56/60
Step 5 Preview20191,7%polski 46/60
Qwen3.8 27B19991%polski 42/60
GLM-5.3--polski 48/60, reszta nie testowana

GLM-5.3 skończył tylko polski. Przy angielskim test przerwał limit kosztów, bo model bardzo długo „myśli”, a matematyki już nie puszczałem. Nie dopisuję mu żadnych szacunków. Gemini 3.8 Flash był jednocześnie sędzią, więc jego odpowiedzi w zadaniach otwartych oceniał ten sam model. Jego wynik z polskiego trzeba czytać z tym zastrzeżeniem.

Wynik z polskiego, punkty na 60
Opus 5.5 / Sol / Gemini60
Haiku 5.556
Mistral Large 456
Sonnet 5.555
GPT-6 Luna55
GLM-5.348
Step 5 Preview46
Qwen3.8 27B42

Matematyka już nie odróżnia modeli

Sześć z dziewięciu modeli, które przeszły cały zestaw, zdobyło 100 na 100 punktów z obu poziomów matematyki. Pozostałe trzy straciły od 3 do 5 punktów. Ciekawe jest, gdzie. W pierwszym zadaniu z rozszerzenia Mistral Large 4 i Qwen3.8 27B odczytały symbol Newtona z obrazka jako zwykły ułamek i rozwiązały w praktyce inne zadanie. Step 5 Preview zgubił 3! w mianowniku, ale liczył dalej konsekwentnie, więc zgodnie z zasadami CKE dostał 1 punkt z 2. To błędy odczytu, a nie liczenia. Sama algebra, pochodne i prawdopodobieństwo nie sprawiały modelom problemu.

Najwięcej punktów poszło na polskim

Rozrzut na polskim wyniósł od 42 do 60 punktów i to on ułożył tabelę. Najdroższe okazało się zadanie 6, czyli notatka syntetyzująca z dwóch tekstów o tradycyjnych i cyfrowych nośnikach informacji. Siedem z dziesięciu modeli dostało za nią 0 na 4 punkty. Napisały gładkie streszczenia wad i zalet papieru oraz chmury, a zasady CKE mówią wprost, że to nie jest przedstawienie stanowiska autorów. Gdy za treść jest zero, przepada też punkt za język. Komplet dostały tylko Opus, Sol i Gemini, które zestawiły stanowiska obu autorów.

Drugi typ błędu to lektury. W zadaniu 11 trzeba było rozpoznać bohatera „Lalki” we fragmencie eseju Olgi Tokarczuk. Step 5 Preview wskazał Wokulskiego zamiast Rzeckiego, a GLM-5.3 wymyślił postać, której w powieści nie ma. Qwen3.8 27B w wypracowaniu przeniósł akcję „Romea i Julii” do Wenecji i dopisał bohaterów, których nie ma w lekturach. Dostał za wypracowanie 23 z 35 punktów.

Model, który opisał plakat, którego nie widział

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

GLM-5.3 przyjmuje tylko tekst, więc dostał arkusz bez ilustracji i wyraźną informację, że ich nie widzi. Mimo to opisał na plakacie do „Antygony” elementy, których według sędziego tam nie ma, w tym czerwoną plamę na czarno-białej grafice. To dobry przykład dla każdego, kto uczy się z AI: model rzadko przyznaje, że czegoś nie wie. Woli dopowiedzieć coś, co brzmi wiarygodnie.

Ile kosztuje matura zdawana przez AI

  • GPT-6 Luna rozwiązał cztery arkusze za 0,02 USD i stracił tylko 5 punktów na polskim.
  • Claude Haiku 5.5 kosztował 0,04 USD przy 215 punktach.
  • Claude Opus 5.5, jeden z trzech modeli z kompletem, kosztował 1,13 USD.
  • GPT-6.1 Sol i Gemini 3.8 Flash dały komplet za ok. 0,32-0,34 USD.

To ceny samego modelu przez API, bez kosztu sędziego. Wniosek jest prosty: do sprawdzania zadań z matematyki wystarczy tani model, a różnicę w cenie widać dopiero przy pisaniu i rozumieniu tekstu po polsku.

Czego ten test nie mówi

Chcę być uczciwy co do ograniczeń, bo nagłówek „AI zdała maturę na 100%” łatwo przecenić:

  • Arkusze z maja 2026 są w sieci od miesięcy, a rozwiązania omawiały media i serwisy edukacyjne. Część modeli mogła je widzieć w danych treningowych.
  • Sędzia AI jest łagodniejszy od egzaminatora, zwłaszcza przy wypracowaniu. Prawie wszystkie prace dostały 34-35 na 35 punktów i traktuję to jako górną granicę.
  • Na angielskim modele dostały transkrypcję nagrań zamiast dźwięku, co jest ułatwieniem.
  • Każdy model przeszedł test raz. Nie powtarzałem go, więc nie wiem, jak bardzo wynik zmienia się między podejściami.
  • Wyników nie sprawdzałem osobno ręcznie: zamknięte ocenia klucz CKE, otwarte wyłącznie sędzia AI.
  • Model nie ma limitu czasu, nie pisze ręcznie i nie stresuje się na sali.

Dlatego wynik nie mówi, że AI „umie” polski lepiej od maturzysty. Mówi raczej, że zadania sprawdzające wiedzę z klucza przestały być dla modeli wyzwaniem, a zadania wymagające syntezy i pamięci o lekturach wciąż je odsiewają.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Co dalej

Przy każdej ważnej premierze modelu puszczam go przez ten sam zestaw arkuszy i dopisuję wiersz do tabeli w hubie Matura AI. Dzięki temu nowe modele da się porównać ze starymi na identycznych zadaniach. Jeśli uczysz się do matury z pomocą AI, zajrzyj do tekstu Czy AI pomoże w nauce do matury, gdzie rozpisałem, w czym modele są dobre, a gdzie się mylą. O polskim osobno piszę w tekście Które AI do matury z polskiego, a o zasadach na sali w tekście ChatGPT a matura.

Źródła: arkusze i zasady oceniania z cke.gov.pl, pobrane 9 października 2026; ceny modeli z cennika OpenRoutera z tego samego dnia.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›