Claude for Startups i 100+ programów z darmowymi kredytami AI dla startupów i JDG Darmowe kredyty AI dla Twojej firmy Sprawdź, co dostaniesz
✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Matura AI 2026: wyniki 10 modeli na arkuszach CKE z maja

10 modeli AI rozwiązało arkusze CKE z maja 2026. Trzy mają komplet 220/220, każdy przetestowany zdałby maturę. Tabela, metodologia i błędy.

8 min czytania
Arkusz CKE 2026 z wynikiem 220/220 - matura zdawana przez modele AI, tabela wyników

👁 120 przeczytań

// w skrócie
  • Wszystkie 9 przetestowanych modeli zdałoby maturę 2026, bo żaden nie zszedł poniżej 70%, a próg zdania wynosi 30% z każdego przedmiotu.
  • Komplet 220 na 220 punktów zdobyły trzy modele: Claude Opus 5.5, GPT-6.1 Sol i Gemini 3.8 Flash.
  • Największe straty modele ponosiły na polskim - rozrzut wyników wyniósł od 42 do 60 punktów, głównie przez błędy w notatce syntetyzującej i mylenie bohaterów lektur.

Dałem 10 modelom AI prawdziwe arkusze matury z maja 2026: matematykę na poziomie podstawowym i rozszerzonym, polski i angielski. Każdy model, który doszedł do końca, zdałby wszystkie cztery egzaminy, bo nikt nie zszedł poniżej 70%. Komplet punktów, czyli 220 na 220, mają Claude Opus 5.5, GPT-6.1 Sol i Gemini 3.8 Flash. Najwięcej punktów modele traciły na polskim, a nie na matematyce. Ten hub aktualizuję przy każdej ważnej premierze modelu.

Stan na 9 października 2026

  • Arkusze: CKE, matura 2026, termin główny (maj), formuła 2023, wersja A arkusza.
  • Przedmioty: matematyka PP (50 pkt), matematyka PR (50 pkt), język polski PP (25 pkt za testy + 35 pkt za wypracowanie), angielski PP (60 pkt).
  • Modele: 10 z OpenRoutera, z czego 9 przeszło cały zestaw. GLM-5.3 skończył tylko polski, bo test przerwał limit kosztów.
  • Koszt całej edycji: co najmniej 5,8 USD według zachowanych logów, razem z oceną przez sędziego.
  • Próg zdania matury: 30% z każdego przedmiotu obowiązkowego.
3modele z kompletem 220/220 pkt
10modeli, 4 arkusze CKE
7 z 10modeli z 0/4 za notatkę syntetyzującą
0,02 USDkoszt całej matury GPT-6 Luna

Wyniki: matura 2026 zdawana przez AI

W tabeli są punkty i procent z każdego arkusza oraz suma z czterech przedmiotów. Kolejność: od najlepszego średniego wyniku.

ModelMat. PPMat. PRPolskiAngielskiRazem
Claude Opus 5.550/50
100%
50/50
100%
60/60
100%
60/60
100%
220/220
100%
GPT-6.1 Sol50/50
100%
50/50
100%
60/60
100%
60/60
100%
220/220
100%
Gemini 3.8 Flash*50/50
100%
50/50
100%
60/60
100%
60/60
100%
220/220
100%
Claude Haiku 5.550/50
100%
50/50
100%
56/60
93,3%
59/60
98,3%
215/220
97,9%
GPT-6 Luna50/50
100%
50/50
100%
55/60
91,7%
60/60
100%
215/220
97,9%
Claude Sonnet 5.550/50
100%
50/50
100%
55/60
91,7%
58/60
96,7%
213/220
97,1%
Mistral Large 449/50
98%
48/50
96%
56/60
93,3%
58/60
96,7%
211/220
96%
Step 5 Preview49/50
98%
46/50
92%
46/60
76,7%
60/60
100%
201/220
91,7%
Qwen3.8 27B49/50
98%
48/50
96%
42/60
70%
60/60
100%
199/220
91%
GLM-5.3**nie testowany w tym przedmiocienie testowany w tym przedmiocie48/60
80%
nie testowany w tym przedmiocie-
  • Procent w kolumnie „Razem” to średnia z czterech przedmiotów. Próg zdania matury to 30% z każdego przedmiotu obowiązkowego - każdy przetestowany wynik jest ponad nim z dużym zapasem.
  • * Gemini 3.8 Flash był też sędzią w zadaniach otwartych, więc w zadaniach otwartych jego odpowiedzi oceniał ten sam model. Tego wyniku nie weryfikowałem osobno - traktuj komplet Gemini z polskiego z tą poprawką.
  • ** GLM-5.3 przyjmuje tylko tekst, więc nie widział ilustracji. Skończył polski. Angielski przerwał limit kosztów, bo model bardzo długo „myśli”, a jego odpowiedzi są drogie (4,80 USD za milion tokenów wyjścia). Matematyki nie puszczałem, żeby nie przepalać budżetu - nie wpisuję żadnych szacunków.

Koszt i czas to sam model, bez sędziego, według rozliczenia OpenRoutera. Czas to suma czasu odpowiedzi na wszystkie zadania.

ModelKoszt modeluCzas odpowiedziWidzi obrazy
Claude Opus 5.51,1 USD9 mintak
GPT-6.1 Sol0,3 USD9 mintak
Gemini 3.8 Flash0,3 USD11 mintak
Claude Haiku 5.50,0 USD7 mintak
GPT-6 Luna0,0 USD7 mintak
Claude Sonnet 5.50,5 USD6 mintak
Mistral Large 40,6 USD73 mintak
Step 5 Preview0,5 USD16 mintak
Qwen3.8 27B0,3 USD32 mintak
GLM-5.30,0 USD1 minnie
Średni wynik z 4 arkuszy matury 2026, %
Claude Opus 5.5100
GPT-6.1 Sol100
Gemini 3.8 Flash100
Claude Haiku 5.597,9
GPT-6 Luna97,9
Claude Sonnet 5.597,1
Mistral Large 496,0
Step 5 Preview91,7
Qwen3.8 27B91,0

Co z tego wynika

  • Matematyka przestała różnicować modele. Sześć z dziewięciu modeli zdobyło 100/100 punktów z obu poziomów. Pomyliły się tylko Mistral Large 4, Step 5 Preview i Qwen3.8 27B, a i to w 3-5 punktach na 100.
  • Najtrudniejszy był polski. Rozrzut na polskim wyniósł od 42 do 60 punktów. Modele najczęściej myliły bohaterów lektur i nie umiały napisać notatki syntetyzującej.
  • Tańszy model potrafi wypaść lepiej od droższego. Haiku 5.5 zdobył z polskiego więcej punktów niż Sonnet 5.5, a GPT-6 Luna za całą maturę zapłacił 0,02 USD.
  • Angielski PP jest dla AI za łatwy. Najsłabszy wynik to 58/60.

Przykłady błędów

Notatka syntetyzująca: 7 z 10 modeli dostało 0 z 4 punktów

Zadanie 6 z polskiego wymagało notatki o tym, jak dwaj autorzy oceniają tradycyjne i cyfrowe nośniki informacji. Zasady CKE mówią wprost, że samo wypisanie wad i zalet nie jest przedstawieniem stanowiska autora. Gdy za treść jest 0 punktów, przepada też punkt za poprawność językową. Haiku, Sonnet, Luna, Mistral, Step, Qwen i GLM napisały zgrabne streszczenia typu „papier jest trwały, chmura zawodna” i dostały 0/4. Opus, Sol i Gemini zestawiły stanowiska obu autorów i dostały komplet - Sol napisał na przykład: „Oboje dostrzegają rosnącą ilość informacji, jednak tylko Krzemińska wyraźnie przestrzega przed skutkami jej cyfrowego gromadzenia”.

Rzecki czy Wokulski

W zadaniu 11 trzeba było rozpoznać bohatera „Lalki” we fragmencie eseju Olgi Tokarczuk. Step 5 Preview odpowiedział „Wokulski”, a GLM-5.3 wymyślił postać o nazwisku „Radosz”. Obaj stracili przez to także zadanie 11.2, które zależało od tej odpowiedzi.

Plakat, którego model nie widział

GLM-5.3 nie ma wejścia obrazowego, więc dostał sam tekst arkusza z adnotacją, że ilustracji nie widzi. Mimo to opisał „złamaną laskę” i „czerwoną plamę” na plakacie „Antygony”, choć według sędziego, który widział plakat, grafika jest czarno-biała i przedstawia m.in. wagę oraz nagrobek. Na murale z bajki Krasickiego też dopisał elementy, których tam nie ma. To podręcznikowa konfabulacja: model nie przyznaje, że czegoś nie wie.

Symbol Newtona jako ułamek

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

W pierwszym zadaniu z matematyki rozszerzonej Mistral Large 4 i Qwen3.8 27B odczytały symbol Newtona z obrazka jako zwykły ułamek i rozwiązały inne zadanie (0/2). Step 5 zgubił 3! w mianowniku, ale liczył konsekwentnie, więc zgodnie z zasadami CKE dostał 1 punkt.

Wypracowanie: dużo punktów, ale z gwiazdką

Sędzia dał 34-35/35 punktów prawie wszystkim wypracowaniom. Wyjątki to Step 5 (27 pkt, za zmyślony cytat z „Romantyczności”) i Qwen3.8 27B (23 pkt, za błędy rzeczowe). Długość prac wyniosła od 396 do 639 wyrazów. Uważam, że żywy egzaminator byłby surowszy, i opisuję to niżej w ograniczeniach.

Metodologia

  • Arkusze i klucze: tylko publiczne pliki PDF z cke.gov.pl (lista na dole). Używam wersji A arkusza.
  • Matematyka: zadanie po zadaniu. Model z wejściem obrazowym dostaje wycinek arkusza jako obraz (wzory, wykresy, rysunki). Model bez obrazu dostaje tekst wyciągnięty z PDF i informację, że wzory mogą być zniekształcone. W wynikach jest to oznaczone.
  • Zadania z rysunkami: wiele zadań z matematyki ma w treści rysunek, wykres albo tabelę. Model z wejściem obrazowym dostaje każde zadanie jako wycinek arkusza, więc widzi je tak jak zdający. Sędzia też dostaje ten wycinek. W arkuszach z maja 2026 żadne zadanie nie każe niczego rysować na karcie, więc nie musiałem nic wyłączać: do wyniku liczę wszystkie zadania.
  • Polski i angielski: cały arkusz w jednym zapytaniu, razem ze stronami z ilustracjami (plakat, mural, zdjęcia). Wypracowanie to osobne zapytanie: model sam wybiera temat.
  • Nagrania z angielskiego: modele dostały oficjalną transkrypcję CKE zamiast pliku dźwiękowego. To ułatwienie w stosunku do zdającego.
  • Zadania zamknięte (matematyka i angielski) oceniam automatycznie z klucza CKE: ostatnia linia „ODPOWIEDŹ: …” porównana z kluczem.
  • Zadania otwarte (rozwiązania z matematyki, odpowiedzi z polskiego, luki z angielskiego, notatka, e-mail i wypracowanie) ocenia sędzia google/gemini-3.8-flash. Dostaje on oficjalny fragment zasad oceniania CKE dla danego zadania i działa przy temperaturze 0.
  • Ustawienia modeli: domyślne ustawienia rozumowania na OpenRouterze, bez podpowiedzi i bez dostępu do internetu.
  • Skrypt: matura.py zapisuje dla każdego modelu log odpowiedzi, oceny z uzasadnieniem, czas i koszt.

Ograniczenia, o których trzeba pamiętać

  • Arkusze z maja 2026 są w sieci od kilku miesięcy, a rozwiązania omawiały media i serwisy edukacyjne. Część modeli mogła je widzieć podczas treningu.
  • Sędzia AI jest łagodniejszy od egzaminatora, zwłaszcza przy wypracowaniu. Kryteria stosuje poprawnie, ale „dojrzałość argumentacji” to ocena, w której człowiek bywa ostrzejszy.
  • Gemini 3.8 Flash oceniał też własne odpowiedzi, bo sędzią w zadaniach otwartych był ten sam model. Jego wynik w tych zadaniach może być zawyżony.
  • Model nie pisze ręcznie, nie ma limitu 170-240 minut i nie przenosi odpowiedzi na kartę. Z drugiej strony nie może dopytać, gdy coś jest nieczytelne.
  • Jeden przebieg na model. Nie powtarzałem testu, więc nie wiem, jak bardzo wynik zmienia się między podejściami.
  • Wyników nie sprawdzałem osobno ręcznie. Zadania zamknięte ocenia klucz CKE, a otwarte wyłącznie sędzia AI - jego oceny i uzasadnienia są zapisane w logach testu.

Nowy model = nowy wiersz

Przy każdej ważnej premierze modelu językowego puszczam go przez ten sam zestaw. Wynik dopisuję do tabeli z datą, a w tekście o premierze podaję, czy „zdałby maturę”. Ten sam zestaw zadań pozwala porównać nowe modele ze starymi bez zgadywania.

Gdzie czytać dalej

Najczęstsze pytania

Czy ChatGPT zdałby maturę 2026?

Tak. GPT-6.1 Sol, model z płatnego ChatGPT, zdobył 220/220 punktów. Tańszy GPT-6 Luna miał 215/220 i stracił punkty tylko na polskim.

Która AI najlepiej pisze maturę z polskiego?

Claude Opus 5.5, GPT-6.1 Sol i Gemini 3.8 Flash miały 60/60. Najsłabiej wypadł Qwen3.8 27B (42/60), głównie przez błędy rzeczowe o lekturach. Jak używać tych modeli do nauki polskiego, opisałem w tekście Które AI do matury z polskiego.

Czy AI rozwiąże maturę rozszerzoną z matematyki?

Sześć modeli miało 50/50. Problemy pojawiały się przy odczytaniu zapisu z obrazka, a nie przy samym liczeniu.

Ile kosztuje rozwiązanie matury przez AI?

Przez API od 0,02 USD (GPT-6 Luna) do 1,13 USD (Claude Opus 5.5) za cztery arkusze. Do tego dochodzi koszt sędziego, ok. 0,19 USD na model.

Czy mogę używać AI na maturze?

Nie. Telefon i inne urządzenia na sali oznaczają unieważnienie egzaminu. Szczegóły opisałem w tekście ChatGPT a matura.

Czy wyniki są wiarygodne?

Zadania zamknięte tak, bo ocenia je klucz. Zadania otwarte ocenia sędzia AI według zasad CKE i nie sprawdzałem tych ocen osobno ręcznie. Wypracowania traktuj jako górną granicę.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła (pobrane 9.10.2026)

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›