Która AI zdałaby maturę 2026: trzy modele z kompletem 220/220
Claude Opus 5.5, GPT-6.1 Sol i Gemini 3.8 Flash zdobyły 220/220 punktów na arkuszach CKE z maja 2026. Modele traciły punkty głównie na polskim.

👁 118 przeczytań
Dałem dziesięciu modelom AI prawdziwe arkusze matury z maja 2026 i oceniłem je według kluczy CKE. Trzy modele - Claude Opus 5.5, GPT-6.1 Sol i Gemini 3.8 Flash - zdobyły komplet 220 na 220 punktów z matematyki podstawowej, rozszerzonej, polskiego i angielskiego. Każdy model, który doszedł do końca, zdałby maturę z dużym zapasem: najsłabszy wynik z przedmiotu to 70%, a próg to 30%. Pełna tabela, metodologia i przykłady błędów są w hubie Matura AI.
Jak wyglądał test
Pobrałem z cke.gov.pl publiczne arkusze z terminu głównego, czyli z maja 2026, razem z zasadami oceniania. W zestawie były cztery egzaminy:
- matematyka na poziomie podstawowym - 50 punktów;
- matematyka na poziomie rozszerzonym - 50 punktów;
- język polski na poziomie podstawowym - 25 punktów za testy i 35 za wypracowanie;
- język angielski na poziomie podstawowym - 60 punktów.
Modele z wejściem obrazowym dostawały zadania z matematyki jako wycinki arkusza, więc widziały wzory, wykresy i rysunki tak jak zdający. Polski i angielski szły jednym zapytaniem, z ilustracjami jako obrazy. Zadania zamknięte sprawdzałem automatycznie z kluczem CKE. Otwarte, w tym wypracowanie, oceniał sędzia - model Gemini 3.8 Flash z fragmentem oficjalnych zasad oceniania dla każdego zadania. Wszystkie modele odpowiadały przez OpenRoutera, bez internetu i bez podpowiedzi.
Wyniki: trzy komplety i nikt poniżej progu
| Model | Punkty /220 | Średnio | Najsłabszy przedmiot |
|---|---|---|---|
| Claude Opus 5.5 | 220 | 100% | - |
| GPT-6.1 Sol | 220 | 100% | - |
| Gemini 3.8 Flash | 220 | 100% | - |
| Claude Haiku 5.5 | 215 | 97,9% | polski 56/60 |
| GPT-6 Luna | 215 | 97,9% | polski 55/60 |
| Claude Sonnet 5.5 | 213 | 97,1% | polski 55/60 |
| Mistral Large 4 | 211 | 96% | polski 56/60 |
| Step 5 Preview | 201 | 91,7% | polski 46/60 |
| Qwen3.8 27B | 199 | 91% | polski 42/60 |
| GLM-5.3 | - | - | polski 48/60, reszta nie testowana |
GLM-5.3 skończył tylko polski. Przy angielskim test przerwał limit kosztów, bo model bardzo długo „myśli”, a matematyki już nie puszczałem. Nie dopisuję mu żadnych szacunków. Gemini 3.8 Flash był jednocześnie sędzią, więc jego odpowiedzi w zadaniach otwartych oceniał ten sam model. Jego wynik z polskiego trzeba czytać z tym zastrzeżeniem.
Matematyka już nie odróżnia modeli
Sześć z dziewięciu modeli, które przeszły cały zestaw, zdobyło 100 na 100 punktów z obu poziomów matematyki. Pozostałe trzy straciły od 3 do 5 punktów. Ciekawe jest, gdzie. W pierwszym zadaniu z rozszerzenia Mistral Large 4 i Qwen3.8 27B odczytały symbol Newtona z obrazka jako zwykły ułamek i rozwiązały w praktyce inne zadanie. Step 5 Preview zgubił 3! w mianowniku, ale liczył dalej konsekwentnie, więc zgodnie z zasadami CKE dostał 1 punkt z 2. To błędy odczytu, a nie liczenia. Sama algebra, pochodne i prawdopodobieństwo nie sprawiały modelom problemu.
Najwięcej punktów poszło na polskim
Rozrzut na polskim wyniósł od 42 do 60 punktów i to on ułożył tabelę. Najdroższe okazało się zadanie 6, czyli notatka syntetyzująca z dwóch tekstów o tradycyjnych i cyfrowych nośnikach informacji. Siedem z dziesięciu modeli dostało za nią 0 na 4 punkty. Napisały gładkie streszczenia wad i zalet papieru oraz chmury, a zasady CKE mówią wprost, że to nie jest przedstawienie stanowiska autorów. Gdy za treść jest zero, przepada też punkt za język. Komplet dostały tylko Opus, Sol i Gemini, które zestawiły stanowiska obu autorów.
Drugi typ błędu to lektury. W zadaniu 11 trzeba było rozpoznać bohatera „Lalki” we fragmencie eseju Olgi Tokarczuk. Step 5 Preview wskazał Wokulskiego zamiast Rzeckiego, a GLM-5.3 wymyślił postać, której w powieści nie ma. Qwen3.8 27B w wypracowaniu przeniósł akcję „Romea i Julii” do Wenecji i dopisał bohaterów, których nie ma w lekturach. Dostał za wypracowanie 23 z 35 punktów.
Model, który opisał plakat, którego nie widział
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
GLM-5.3 przyjmuje tylko tekst, więc dostał arkusz bez ilustracji i wyraźną informację, że ich nie widzi. Mimo to opisał na plakacie do „Antygony” elementy, których według sędziego tam nie ma, w tym czerwoną plamę na czarno-białej grafice. To dobry przykład dla każdego, kto uczy się z AI: model rzadko przyznaje, że czegoś nie wie. Woli dopowiedzieć coś, co brzmi wiarygodnie.
Ile kosztuje matura zdawana przez AI
- GPT-6 Luna rozwiązał cztery arkusze za 0,02 USD i stracił tylko 5 punktów na polskim.
- Claude Haiku 5.5 kosztował 0,04 USD przy 215 punktach.
- Claude Opus 5.5, jeden z trzech modeli z kompletem, kosztował 1,13 USD.
- GPT-6.1 Sol i Gemini 3.8 Flash dały komplet za ok. 0,32-0,34 USD.
To ceny samego modelu przez API, bez kosztu sędziego. Wniosek jest prosty: do sprawdzania zadań z matematyki wystarczy tani model, a różnicę w cenie widać dopiero przy pisaniu i rozumieniu tekstu po polsku.
Czego ten test nie mówi
Chcę być uczciwy co do ograniczeń, bo nagłówek „AI zdała maturę na 100%” łatwo przecenić:
- Arkusze z maja 2026 są w sieci od miesięcy, a rozwiązania omawiały media i serwisy edukacyjne. Część modeli mogła je widzieć w danych treningowych.
- Sędzia AI jest łagodniejszy od egzaminatora, zwłaszcza przy wypracowaniu. Prawie wszystkie prace dostały 34-35 na 35 punktów i traktuję to jako górną granicę.
- Na angielskim modele dostały transkrypcję nagrań zamiast dźwięku, co jest ułatwieniem.
- Każdy model przeszedł test raz. Nie powtarzałem go, więc nie wiem, jak bardzo wynik zmienia się między podejściami.
- Wyników nie sprawdzałem osobno ręcznie: zamknięte ocenia klucz CKE, otwarte wyłącznie sędzia AI.
- Model nie ma limitu czasu, nie pisze ręcznie i nie stresuje się na sali.
Dlatego wynik nie mówi, że AI „umie” polski lepiej od maturzysty. Mówi raczej, że zadania sprawdzające wiedzę z klucza przestały być dla modeli wyzwaniem, a zadania wymagające syntezy i pamięci o lekturach wciąż je odsiewają.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co dalej
Przy każdej ważnej premierze modelu puszczam go przez ten sam zestaw arkuszy i dopisuję wiersz do tabeli w hubie Matura AI. Dzięki temu nowe modele da się porównać ze starymi na identycznych zadaniach. Jeśli uczysz się do matury z pomocą AI, zajrzyj do tekstu Czy AI pomoże w nauce do matury, gdzie rozpisałem, w czym modele są dobre, a gdzie się mylą. O polskim osobno piszę w tekście Które AI do matury z polskiego, a o zasadach na sali w tekście ChatGPT a matura.
Źródła: arkusze i zasady oceniania z cke.gov.pl, pobrane 9 października 2026; ceny modeli z cennika OpenRoutera z tego samego dnia.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
