Matura AI 2026: wyniki 10 modeli na arkuszach CKE z maja
10 modeli AI rozwiązało arkusze CKE z maja 2026. Trzy mają komplet 220/220, każdy przetestowany zdałby maturę. Tabela, metodologia i błędy.

👁 122 przeczytań
- Wszystkie 9 przetestowanych modeli zdałoby maturę 2026, bo żaden nie zszedł poniżej 70%, a próg zdania wynosi 30% z każdego przedmiotu.
- Komplet 220 na 220 punktów zdobyły trzy modele: Claude Opus 5.5, GPT-6.1 Sol i Gemini 3.8 Flash.
- Największe straty modele ponosiły na polskim - rozrzut wyników wyniósł od 42 do 60 punktów, głównie przez błędy w notatce syntetyzującej i mylenie bohaterów lektur.
Dałem 10 modelom AI prawdziwe arkusze matury z maja 2026: matematykę na poziomie podstawowym i rozszerzonym, polski i angielski. Każdy model, który doszedł do końca, zdałby wszystkie cztery egzaminy, bo nikt nie zszedł poniżej 70%. Komplet punktów, czyli 220 na 220, mają Claude Opus 5.5, GPT-6.1 Sol i Gemini 3.8 Flash. Najwięcej punktów modele traciły na polskim, a nie na matematyce. Ten hub aktualizuję przy każdej ważnej premierze modelu.
Stan na 9 października 2026
- Arkusze: CKE, matura 2026, termin główny (maj), formuła 2023, wersja A arkusza.
- Przedmioty: matematyka PP (50 pkt), matematyka PR (50 pkt), język polski PP (25 pkt za testy + 35 pkt za wypracowanie), angielski PP (60 pkt).
- Modele: 10 z OpenRoutera, z czego 9 przeszło cały zestaw. GLM-5.3 skończył tylko polski, bo test przerwał limit kosztów.
- Koszt całej edycji: co najmniej 5,8 USD według zachowanych logów, razem z oceną przez sędziego.
- Próg zdania matury: 30% z każdego przedmiotu obowiązkowego.
Wyniki: matura 2026 zdawana przez AI
W tabeli są punkty i procent z każdego arkusza oraz suma z czterech przedmiotów. Kolejność: od najlepszego średniego wyniku.
| Model | Mat. PP | Mat. PR | Polski | Angielski | Razem |
|---|---|---|---|---|---|
| Claude Opus 5.5 | 50/50 100% | 50/50 100% | 60/60 100% | 60/60 100% | 220/220 100% |
| GPT-6.1 Sol | 50/50 100% | 50/50 100% | 60/60 100% | 60/60 100% | 220/220 100% |
| Gemini 3.8 Flash* | 50/50 100% | 50/50 100% | 60/60 100% | 60/60 100% | 220/220 100% |
| Claude Haiku 5.5 | 50/50 100% | 50/50 100% | 56/60 93,3% | 59/60 98,3% | 215/220 97,9% |
| GPT-6 Luna | 50/50 100% | 50/50 100% | 55/60 91,7% | 60/60 100% | 215/220 97,9% |
| Claude Sonnet 5.5 | 50/50 100% | 50/50 100% | 55/60 91,7% | 58/60 96,7% | 213/220 97,1% |
| Mistral Large 4 | 49/50 98% | 48/50 96% | 56/60 93,3% | 58/60 96,7% | 211/220 96% |
| Step 5 Preview | 49/50 98% | 46/50 92% | 46/60 76,7% | 60/60 100% | 201/220 91,7% |
| Qwen3.8 27B | 49/50 98% | 48/50 96% | 42/60 70% | 60/60 100% | 199/220 91% |
| GLM-5.3** | nie testowany w tym przedmiocie | nie testowany w tym przedmiocie | 48/60 80% | nie testowany w tym przedmiocie | - |
- Procent w kolumnie „Razem” to średnia z czterech przedmiotów. Próg zdania matury to 30% z każdego przedmiotu obowiązkowego - każdy przetestowany wynik jest ponad nim z dużym zapasem.
- * Gemini 3.8 Flash był też sędzią w zadaniach otwartych, więc w zadaniach otwartych jego odpowiedzi oceniał ten sam model. Tego wyniku nie weryfikowałem osobno - traktuj komplet Gemini z polskiego z tą poprawką.
- ** GLM-5.3 przyjmuje tylko tekst, więc nie widział ilustracji. Skończył polski. Angielski przerwał limit kosztów, bo model bardzo długo „myśli”, a jego odpowiedzi są drogie (4,80 USD za milion tokenów wyjścia). Matematyki nie puszczałem, żeby nie przepalać budżetu - nie wpisuję żadnych szacunków.
Koszt i czas to sam model, bez sędziego, według rozliczenia OpenRoutera. Czas to suma czasu odpowiedzi na wszystkie zadania.
| Model | Koszt modelu | Czas odpowiedzi | Widzi obrazy |
|---|---|---|---|
| Claude Opus 5.5 | 1,1 USD | 9 min | tak |
| GPT-6.1 Sol | 0,3 USD | 9 min | tak |
| Gemini 3.8 Flash | 0,3 USD | 11 min | tak |
| Claude Haiku 5.5 | 0,0 USD | 7 min | tak |
| GPT-6 Luna | 0,0 USD | 7 min | tak |
| Claude Sonnet 5.5 | 0,5 USD | 6 min | tak |
| Mistral Large 4 | 0,6 USD | 73 min | tak |
| Step 5 Preview | 0,5 USD | 16 min | tak |
| Qwen3.8 27B | 0,3 USD | 32 min | tak |
| GLM-5.3 | 0,0 USD | 1 min | nie |
Co z tego wynika
- Matematyka przestała różnicować modele. Sześć z dziewięciu modeli zdobyło 100/100 punktów z obu poziomów. Pomyliły się tylko Mistral Large 4, Step 5 Preview i Qwen3.8 27B, a i to w 3-5 punktach na 100.
- Najtrudniejszy był polski. Rozrzut na polskim wyniósł od 42 do 60 punktów. Modele najczęściej myliły bohaterów lektur i nie umiały napisać notatki syntetyzującej.
- Tańszy model potrafi wypaść lepiej od droższego. Haiku 5.5 zdobył z polskiego więcej punktów niż Sonnet 5.5, a GPT-6 Luna za całą maturę zapłacił 0,02 USD.
- Angielski PP jest dla AI za łatwy. Najsłabszy wynik to 58/60.
Przykłady błędów
Notatka syntetyzująca: 7 z 10 modeli dostało 0 z 4 punktów
Zadanie 6 z polskiego wymagało notatki o tym, jak dwaj autorzy oceniają tradycyjne i cyfrowe nośniki informacji. Zasady CKE mówią wprost, że samo wypisanie wad i zalet nie jest przedstawieniem stanowiska autora. Gdy za treść jest 0 punktów, przepada też punkt za poprawność językową. Haiku, Sonnet, Luna, Mistral, Step, Qwen i GLM napisały zgrabne streszczenia typu „papier jest trwały, chmura zawodna” i dostały 0/4. Opus, Sol i Gemini zestawiły stanowiska obu autorów i dostały komplet - Sol napisał na przykład: „Oboje dostrzegają rosnącą ilość informacji, jednak tylko Krzemińska wyraźnie przestrzega przed skutkami jej cyfrowego gromadzenia”.
Rzecki czy Wokulski
W zadaniu 11 trzeba było rozpoznać bohatera „Lalki” we fragmencie eseju Olgi Tokarczuk. Step 5 Preview odpowiedział „Wokulski”, a GLM-5.3 wymyślił postać o nazwisku „Radosz”. Obaj stracili przez to także zadanie 11.2, które zależało od tej odpowiedzi.
Plakat, którego model nie widział
GLM-5.3 nie ma wejścia obrazowego, więc dostał sam tekst arkusza z adnotacją, że ilustracji nie widzi. Mimo to opisał „złamaną laskę” i „czerwoną plamę” na plakacie „Antygony”, choć według sędziego, który widział plakat, grafika jest czarno-biała i przedstawia m.in. wagę oraz nagrobek. Na murale z bajki Krasickiego też dopisał elementy, których tam nie ma. To podręcznikowa konfabulacja: model nie przyznaje, że czegoś nie wie.
Symbol Newtona jako ułamek
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
W pierwszym zadaniu z matematyki rozszerzonej Mistral Large 4 i Qwen3.8 27B odczytały symbol Newtona z obrazka jako zwykły ułamek i rozwiązały inne zadanie (0/2). Step 5 zgubił 3! w mianowniku, ale liczył konsekwentnie, więc zgodnie z zasadami CKE dostał 1 punkt.
Wypracowanie: dużo punktów, ale z gwiazdką
Sędzia dał 34-35/35 punktów prawie wszystkim wypracowaniom. Wyjątki to Step 5 (27 pkt, za zmyślony cytat z „Romantyczności”) i Qwen3.8 27B (23 pkt, za błędy rzeczowe). Długość prac wyniosła od 396 do 639 wyrazów. Uważam, że żywy egzaminator byłby surowszy, i opisuję to niżej w ograniczeniach.
Metodologia
- Arkusze i klucze: tylko publiczne pliki PDF z cke.gov.pl (lista na dole). Używam wersji A arkusza.
- Matematyka: zadanie po zadaniu. Model z wejściem obrazowym dostaje wycinek arkusza jako obraz (wzory, wykresy, rysunki). Model bez obrazu dostaje tekst wyciągnięty z PDF i informację, że wzory mogą być zniekształcone. W wynikach jest to oznaczone.
- Zadania z rysunkami: wiele zadań z matematyki ma w treści rysunek, wykres albo tabelę. Model z wejściem obrazowym dostaje każde zadanie jako wycinek arkusza, więc widzi je tak jak zdający. Sędzia też dostaje ten wycinek. W arkuszach z maja 2026 żadne zadanie nie każe niczego rysować na karcie, więc nie musiałem nic wyłączać: do wyniku liczę wszystkie zadania.
- Polski i angielski: cały arkusz w jednym zapytaniu, razem ze stronami z ilustracjami (plakat, mural, zdjęcia). Wypracowanie to osobne zapytanie: model sam wybiera temat.
- Nagrania z angielskiego: modele dostały oficjalną transkrypcję CKE zamiast pliku dźwiękowego. To ułatwienie w stosunku do zdającego.
- Zadania zamknięte (matematyka i angielski) oceniam automatycznie z klucza CKE: ostatnia linia „ODPOWIEDŹ: …” porównana z kluczem.
- Zadania otwarte (rozwiązania z matematyki, odpowiedzi z polskiego, luki z angielskiego, notatka, e-mail i wypracowanie) ocenia sędzia google/gemini-3.8-flash. Dostaje on oficjalny fragment zasad oceniania CKE dla danego zadania i działa przy temperaturze 0.
- Ustawienia modeli: domyślne ustawienia rozumowania na OpenRouterze, bez podpowiedzi i bez dostępu do internetu.
- Skrypt:
matura.pyzapisuje dla każdego modelu log odpowiedzi, oceny z uzasadnieniem, czas i koszt.
Ograniczenia, o których trzeba pamiętać
- Arkusze z maja 2026 są w sieci od kilku miesięcy, a rozwiązania omawiały media i serwisy edukacyjne. Część modeli mogła je widzieć podczas treningu.
- Sędzia AI jest łagodniejszy od egzaminatora, zwłaszcza przy wypracowaniu. Kryteria stosuje poprawnie, ale „dojrzałość argumentacji” to ocena, w której człowiek bywa ostrzejszy.
- Gemini 3.8 Flash oceniał też własne odpowiedzi, bo sędzią w zadaniach otwartych był ten sam model. Jego wynik w tych zadaniach może być zawyżony.
- Model nie pisze ręcznie, nie ma limitu 170-240 minut i nie przenosi odpowiedzi na kartę. Z drugiej strony nie może dopytać, gdy coś jest nieczytelne.
- Jeden przebieg na model. Nie powtarzałem testu, więc nie wiem, jak bardzo wynik zmienia się między podejściami.
- Wyników nie sprawdzałem osobno ręcznie. Zadania zamknięte ocenia klucz CKE, a otwarte wyłącznie sędzia AI - jego oceny i uzasadnienia są zapisane w logach testu.
Nowy model = nowy wiersz
Przy każdej ważnej premierze modelu językowego puszczam go przez ten sam zestaw. Wynik dopisuję do tabeli z datą, a w tekście o premierze podaję, czy „zdałby maturę”. Ten sam zestaw zadań pozwala porównać nowe modele ze starymi bez zgadywania.
Gdzie czytać dalej
- Która AI zdałaby maturę 2026 - wyniki 10 modeli
- Czy AI pomoże w nauce do matury - co umie, gdzie się myli
- Które AI do matury z polskiego? ChatGPT, Gemini czy Claude
- AI do wypracowań: jak używać, żeby się uczyć, a nie ściągać
- AI do matematyki: test 9 modeli
- AI do szkoły: ranking na 15 zadaniach
- ChatGPT a matura: co grozi na sali
- Arena modeli AI po polsku
Najczęstsze pytania
Czy ChatGPT zdałby maturę 2026?
Tak. GPT-6.1 Sol, model z płatnego ChatGPT, zdobył 220/220 punktów. Tańszy GPT-6 Luna miał 215/220 i stracił punkty tylko na polskim.
Która AI najlepiej pisze maturę z polskiego?
Claude Opus 5.5, GPT-6.1 Sol i Gemini 3.8 Flash miały 60/60. Najsłabiej wypadł Qwen3.8 27B (42/60), głównie przez błędy rzeczowe o lekturach. Jak używać tych modeli do nauki polskiego, opisałem w tekście Które AI do matury z polskiego.
Czy AI rozwiąże maturę rozszerzoną z matematyki?
Sześć modeli miało 50/50. Problemy pojawiały się przy odczytaniu zapisu z obrazka, a nie przy samym liczeniu.
Ile kosztuje rozwiązanie matury przez AI?
Przez API od 0,02 USD (GPT-6 Luna) do 1,13 USD (Claude Opus 5.5) za cztery arkusze. Do tego dochodzi koszt sędziego, ok. 0,19 USD na model.
Czy mogę używać AI na maturze?
Nie. Telefon i inne urządzenia na sali oznaczają unieważnienie egzaminu. Szczegóły opisałem w tekście ChatGPT a matura.
Czy wyniki są wiarygodne?
Zadania zamknięte tak, bo ocenia je klucz. Zadania otwarte ocenia sędzia AI według zasad CKE i nie sprawdzałem tych ocen osobno ręcznie. Wypracowania traktuj jako górną granicę.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Źródła (pobrane 9.10.2026)
- CKE - arkusze maturalne 2026
- Matematyka PP - arkusz i zasady oceniania
- Matematyka PR - arkusz i zasady oceniania
- Polski PP arkusz 1 (zasady), arkusz 2 - wypracowanie (zasady)
- Angielski PP - arkusz, zasady, transkrypcja nagrań
- Ceny i identyfikatory modeli: openrouter.ai/api/v1/models, stan na 9.10.2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
