AI do matematyki: które rozwiązuje poprawnie? Test 9 modeli (2026)
Test 9 modeli AI na 11 zadaniach z matematyki: procenty, równania, funkcja kwadratowa, prawdopodobieństwo, parametr, trygonometria, lokata. Jeden błąd, klucz odpowiedzi i polecenia do nauki.

👁 112 przeczytań
- W teście 9 modeli na 11 zadaniach matematycznych uzyskano 98 na 99 poprawnych odpowiedzi - jedyny błąd zrobił Gemini 3.8 Flash przy obliczeniu lokaty.
- Gemini 3.8 Flash poprawnie ustawił wzór na procent składany (10 000 · 1,02025⁴), ale pomylił się przy potęgowaniu i podał 10 834,65 zł zamiast poprawnych 10 834,94 zł.
- Darmowe modele GPT-5.6 Luna i Gemini 3.6 Flash rozwiązały wszystkie 11 zadań tak samo skutecznie jak płatne odpowiedniki kosztujące wielokrotnie więcej.
Sprawdziłem, które AI rozwiązuje matematykę poprawnie: 9 modeli dostało te same 11 zadań, od procentów z podstawówki przez maturę podstawową po równanie z parametrem z rozszerzenia. Poprawnie rozwiązały prawie wszystko. Jedyny błąd zrobił Gemini 3.8 Flash, w zwykłym rachunku przy lokacie. To część mojego rankingu AI do szkoły, w którym te same modele rozwiązywały też zadania z polskiego, angielskiego, historii i fizyki.
Stan na 3 października 2026
- Testowane modele: GPT-6.1 Sol, GPT-6 Luna, GPT-5.6 Luna (darmowy ChatGPT), Gemini 3.1 Pro, 3.8 Flash i 3.6 Flash (darmowe Gemini), Claude Sonnet 5.5 (darmowy Claude), DeepSeek V4.1 Flash, Qwen3.8 Max.
- Wynik: 98 na 99 odpowiedzi poprawnych (9 modeli × 11 zadań).
- Wszystkie modele na prośbę ucznia „daj same wyniki” podały gotowe wyniki bez wyjaśnienia.
Zadania i klucz
Trzy zadania pochodzą z głównego testu, osiem z dogrywki, którą dołożyłem, bo pierwsze trzy wszystkie modele rozwiązały bez potknięcia. Każde wysłałem raz, przez API OpenRoutera, z niskim poziomem rozumowania i bez instrukcji systemowej. Wyniki sprawdziłem w Pythonie.
| Zadanie | Poziom | Pułapka | Klucz | Poprawnie |
|---|---|---|---|---|
| Rower 1200 zł: obniżka o 20%, potem podwyżka o 10% | szkoła podstawowa | „taniej o 10%” | 1056 zł, taniej o 12% | 9/9 |
| √(x + 7) = x + 1 | liceum | fałszywy pierwiastek x = -3 | x = 2 | 9/9 |
| f(x) = -2x² + 8x - 6: zbiór wartości, monotoniczność, minimum na [0, 3]; liczba z {1, …, 30} podzielna przez 4 lub 6 | matura podstawowa | minimum na końcu przedziału; liczby 12 i 24 policzone dwa razy | (-∞, 2], rośnie do 2, min -6; P = 1/3 | 9/9 |
| x² - (m + 2)x + m + 5 = 0 ma dwa różne pierwiastki dodatnie | matura rozszerzona | trzy warunki naraz | m ∈ (4, +∞) | 9/9 |
| 2cos²x - 3sin x = 0 w [0, 2π] | matura rozszerzona | odrzucenie sin x = -2 | π/6, 5π/6 | 9/9 |
| Liczby czterocyfrowe z dokładnie jedną siódemką | matura rozszerzona | zero na początku | 2673 | 9/9 |
| 5 białych i 3 czarne kule, druga wylosowana czarna | matura | „zależy od pierwszej” | 3/8 | 9/9 |
| 987654 · 123456, sam wynik | rachunek | liczenie „w głowie” | 121 931 812 224 | 9/9 |
| Kasia ma 3 braci, każdy ma 2 siostry. Ile dzieci? | zagadka | „3 + 2 + 1” | 5 | 9/9 |
| Trójkąt 6-8-10: promień wpisanego, opisanego, wysokość | liceum | - | 2 cm, 5 cm, 4,8 cm | 9/9 |
| Lokata 10 000 zł, 5% rocznie, kapitalizacja co pół roku, 19% podatku, 2 lata | matura podstawowa | podatek przy każdej kapitalizacji | 10 834,94 zł | 8/9 |
Jedyny błąd: rachunek, nie rozumowanie
Gemini 3.8 Flash dobrze ustawił zadanie z lokatą: 2,5% za półrocze, po podatku 2,025%, cztery kapitalizacje, wzór 10 000 · 1,02025⁴. Pomylił się dopiero przy potęgowaniu i podał 1,08346452 zamiast 1,08349376, czyli 10 834,65 zł zamiast 10 834,94 zł. To typowy błąd modelu językowego: tok myślenia jest poprawny, ale liczby „liczone w głowie” potrafią się rozjechać na trzecim miejscu po przecinku. Na maturze taki wynik kosztuje punkt za obliczenia, a uczeń, który przepisał rozwiązanie, nawet nie wie, gdzie szukać.
Ciekawe, że mnożenie 987654 · 123456 wszystkie modele zrobiły dobrze. Claude Sonnet 5.5 rozpisał je na sumę iloczynów częściowych, reszta podała sam wynik. Gemini 3.6 Flash, model z darmowej aplikacji Gemini, „myślał” nad tym jednym mnożeniem 7691 tokenów, czyli ponad 40% wszystkiego, co napisał w całej dogrywce.
Wyniki dogrywki: poprawność, długość i koszt
| Model | Poprawne (na 8) | Tokeny odpowiedzi (8 zadań) | Czas łącznie | Koszt (USD) |
|---|---|---|---|---|
| GPT-6 Luna | 8/8 | 2 191 | 33 s | 0,0011 |
| GPT-6.1 Sol | 8/8 | 2 231 | 78 s | 0,0232 |
| GPT-5.6 Luna | 8/8 | 2 922 | 35 s | 0,0036 |
| Claude Sonnet 5.5 | 8/8 | 3 333 | 32 s | 0,0347 |
| DeepSeek V4.1 Flash | 8/8 | 4 361 | 46 s | 0,0022 |
| Qwen3.8 Max | 8/8 | 9 571 | 191 s | 0,059 |
| Gemini 3.1 Pro | 8/8 | 11 927 | 92 s | 0,1439 |
| Gemini 3.6 Flash | 8/8 | 18 028 | 87 s | 0,0679 |
| Gemini 3.8 Flash | 7/8 | 5 081 | 44 s | 0,0193 |
Długość odpowiedzi to dobra wskazówka dla ucznia: GPT-6 Luna i Claude rozwiązują zwięźle, Gemini 3.6 Flash i Qwen3.8 Max piszą 4-8 razy więcej, z tabelami i sprawdzeniem. Dłuższe nie znaczy lepsze, ale przy nauce sprawdzenie jest bardzo przydatne: przy równaniu z parametrem tylko Claude i Qwen same podstawiły przykładowe m = 5 i pokazały, że pierwiastki wychodzą dodatnie.
Które AI do matematyki wybrać
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
- Za darmo, uczeń 13+: ChatGPT Free (GPT-5.6 Luna) albo darmowe Gemini (3.6 Flash). Oba rozwiązały wszystkie 11 zadań.
- Do nauki krok po kroku: Claude Sonnet 5.5 i Qwen3.8 Max same sprawdzały wynik, a Claude jako jedyny przy „daj same wyniki” zaproponował wyjaśnienie. Oba wymagają jednak 18 lat.
- Do zadań z dużą liczbą obliczeń (procent składany, statystyka): poproś, żeby model policzył w Pythonie albo sprawdź końcowy wynik kalkulatorem. To dotyczy każdego modelu, nie tylko Gemini 3.8 Flash.
- Do zadania ze zdjęcia: tego nie testowałem. Najpopularniejszą aplikację do zdjęć zadań opisałem w tekście Photomath.
Jak pytać, żeby się nauczyć, a nie przepisać
Wszystkie modele na prośbę „daj same wyniki bez tłumaczenia, przepiszę” odpowiedziały czterema liczbami (x = 6, 9, 12, -3). Model nie pilnuje, czy się uczysz, więc polecenie musi to zrobić za niego. Trzy, których używam:
- „Nie podawaj wyniku. Zadaj mi pytanie, które naprowadzi mnie na pierwszy krok.” Model prowadzi pytaniami, jak korepetytor.
- „Oto moje rozwiązanie. Wskaż, w której linijce jest pierwszy błąd, ale go nie poprawiaj.” Najlepsze ćwiczenie przed sprawdzianem.
- „Daj mi trzy podobne zadania o rosnącej trudności, a odpowiedzi dopiero, gdy o nie poproszę.” Własny zestaw powtórkowy w minutę.
W ChatGPT, Gemini i Claude jest też tryb nauki, który robi to samo bez specjalnych poleceń. Plan powtórek przed maturą opisałem w tekście ChatGPT a matura, a fiszki ze wzorami w tekście jak zrobić fiszki z AI.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Najczęstsze pytania
Które AI najlepiej rozwiązuje matematykę?
W moim teście 8 z 9 modeli rozwiązało wszystkie 11 zadań. Najmniej tekstu i najniższy koszt miał GPT-6 Luna, najstaranniejsze sprawdzenia robiły Claude Sonnet 5.5 i Qwen3.8 Max. Jedyny błąd zrobił Gemini 3.8 Flash.
Czy ChatGPT myli się w matematyce?
W moim teście nie pomylił się ani raz: GPT-5.6 Luna (darmowy ChatGPT), GPT-6 Luna i GPT-6.1 Sol rozwiązały wszystkie zadania. Przy długich obliczeniach i tak warto poprosić o sprawdzenie w Pythonie.
Czy AI rozwiąże zadanie maturalne?
Tak, zadania z matury podstawowej i trzy zadania z rozszerzonej rozwiązały wszystkie modele. Na samej maturze AI i telefony są zakazane pod rygorem unieważnienia egzaminu.
Czy darmowe AI wystarczy do matematyki?
Tak. Modele z darmowych planów, GPT-5.6 Luna i Gemini 3.6 Flash, rozwiązały komplet zadań, tak samo jak płatne.
Test zrobiłem 3 i 4 października 2026. Dogrywka kosztowała 0,35 USD przez OpenRouter. Pełny ranking z polskim, angielskim, historią i testem uczciwości jest w tekście AI do szkoły 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
