Mistral Large 4 po polsku: mój test w 13 zadaniach
Mistral Large 4 przeszedł przez 13 zadań Laboratorium: 69,2 pkt z rozumowaniem i 65,6 bez. Pokazuję, gdzie wypadł dobrze, gdzie się wyłożył i ile to kosztowało.

👁 120 przeczytań
- Mistral Large 4 uzyskał 69,2 pkt na 100 w trybie z rozumowaniem i 65,6 pkt bez niego, co odpowiada poziomowi Mistral Medium 3.5.
- W trybie rozumowania model trzykrotnie zużył cały limit tokenów i nie oddał żadnej odpowiedzi w opisie produktu (6000 tokenów) i trudnej korekcie (8000 tokenów).
- Za podobne pieniądze Gemini 3.8 Flash (79,4 pkt) i DeepSeek V4 Pro (74,1 pkt) wypadają lepiej, a Mistral Large 4 poleca się głównie do korekty bez rozumowania.
Mistral Large 4 dostał w moim teście po polsku 69,2 pkt na 100 z rozumowaniem i 65,6 pkt bez niego. To poziom poprzedniego flagowca Mistrala, Medium 3.5, i wyraźnie mniej niż Claude Sonnet 5.5, GPT-6.1 Sol czy DeepSeek V4 Pro. Świetnie zna polszczyznę (quiz 46/46), ale w trybie rozumowania potrafi „przemyśleć” cały limit tokenów i nie oddać odpowiedzi. O samej premierze piszę w newsie Mistral Large 4, a o firmie w hubie Mistral AI.
Test z 7 października 2026
- Model:
mistralai/mistral-large-4-0przez OpenRouter (dostawca: Mistral), wersja podglądowa z 6.10.2026. - Zadania: 13 - te same co w Arenie modeli AI po polsku i w rankingu AI do pisania.
- Ocena: w ciemno, Claude Opus 5.5 i GPT-6 Sol, z kalibracją przez 4 modele kotwiczące.
- Koszt: 0,24 USD odpowiedzi z rozumowaniem (z powtórkami), 0,015 USD bez rozumowania, ok. 1,28 USD sędziowie.
Jak testowałem
Laboratorium Promptowego to mój stały zestaw 13 poleceń, przez który przeszło już ponad 30 modeli:
- 9 zadań pisarskich: artykuł na bloga, opis produktu, odpowiedź na skargę klienta, post na LinkedIn, opowiadanie, 10 tytułów SEO, streszczenie w 5 punktach, wyjaśnienie inflacji dziecku i tłumaczenie newslettera;
- 2 korekty tekstu z błędami (łatwa z 22 błędami i trudna z 30);
- 2 quizy z polszczyzny (46 i 48 pytań).
Teksty oceniali w ciemno dwaj sędziowie (Claude Opus 5.5 i GPT-6 Sol) w trzech kryteriach: poprawność, naturalność, wykonanie polecenia. Wynik końcowy to w 70% ocena sędziów, w 20% spełnienie twardych reguł z poleceń (limity słów, liczba punktów) i w 10% higiena tekstu. Żeby wynik dało się porównać ze starszymi rundami, w tej samej puli oceniałem 4 modele kotwiczące (Opus 5.5, GPT-6 Luna, Qwen3.8 Max, GLM-5.3) i przesuwałem skalę o średnią różnicę. Kotwice ułożyły się w tej samej kolejności co w pierwszej rundzie, a przesunięcie wyniosło +1,38 i +1,0 pkt.
OpenRouter pozwala dla Large 4 ustawić tylko rozumowanie pełne albo wyłączone (inne modele w Laboratorium biegły na niskim poziomie rozumowania). Dlatego zrobiłem dwie rundy: z rozumowaniem i bez.
Wyniki
| Large 4 z rozumowaniem | Large 4 bez rozumowania | |
|---|---|---|
| Wynik (0-100) | 69,2 | 65,6 |
| Średnia sędziów (1-10) | 6,30 | 6,52 |
| Poprawność / naturalność / wykonanie | 7,67 / 5,89 / 5,33 | 8,22 / 6,22 / 5,11 |
| Reguły z poleceń | 23/26 | 23/26 |
| Korekta łatwa | 21/22 | 21/22 |
| Korekta trudna | 0/30 (pusta odpowiedź) | 24/30 |
| Quiz łatwy / trudny | 46/46 i 46/48 | 46/46 i 45/48 |
| Czas 9 zadań pisarskich | 888,6 s | 91,0 s |
| Koszt 13 zadań | 0,134 USD (0,235 z powtórkami) | 0,015 USD |
| Tokeny „myślenia” / wszystkie wyjściowe | 42 230 / 62 423 | 0 / 5 786 |
Średnia sędziów w poszczególnych zadaniach (1-10):
| Zadanie | Z rozumowaniem | Bez rozumowania |
|---|---|---|
| Artykuł na bloga | 5,50 | 5,83 |
| Opis produktu | 1,00 (pusta odpowiedź) | 6,50 |
| Odpowiedź na skargę klienta | 7,00 | 7,50 |
| Post na LinkedIn | 7,33 | 6,33 |
| Opowiadanie | 6,50 | 6,33 |
| 10 tytułów SEO | 5,67 (tylko 2 tytuły) | 7,00 |
| Streszczenie w 5 punktach | 7,83 | 6,83 |
| Inflacja dla dziecka | 7,50 | 5,50 |
| Tłumaczenie newslettera | 8,33 | 6,83 |
Co dokładnie poszło nie tak
- Puste odpowiedzi przy rozumowaniu. W opisie produktu (limit 6000 tokenów) i trudnej korekcie (8000) model trzy razy pod rząd zużył cały limit i nie oddał ani słowa. W tytułach SEO trzecia próba skończyła się po dwóch tytułach z dziesięciu. Inne modele dostały te same limity i się w nich mieściły, więc liczę to jako błąd modelu, a nie testu.
- Dopowiedziane fakty. W mailu do klienta wersja z rozumowaniem napisała, że przewoźnik „potwierdził dostawę na 3 października”, choć w poleceniu była tylko przewidywana data. Wersja bez rozumowania dodała od siebie, że paczka utknęła „z przyczyn niezależnych od nas”. Obaj sędziowie wychwycili jedno i drugie.
- Błąd logiczny w tekście dla dziecka. Wersja z rozumowaniem napisała, że warto oszczędzać pieniądze na później, „bo z czasem będą warte mniej niż dzisiaj”. To odwrotność sensownej rady. Wersja bez rozumowania powtórzyła ten sam błąd i dodała lizak za 20 zł.
- Jednostki i kalki. W artykule o oszczędzaniu prądu pojawiły się „waty na godzinę”, w tłumaczeniu „piłka jest teraz po naszej stronie”.
- Rok 2024 w tytułach. Bez rozumowania model dał 10 poprawnych tytułów, ale w jednym wpisał „2024”. Tak samo zrobił w urwanej wersji z rozumowaniem.
- Półpauzy. Bez rozumowania model wstawiał ich 20,6 na 1000 słów, z rozumowaniem 8,7. Dla porównania Claude Opus 5.5 - 5,1.
Co wyszło dobrze: tłumaczenie newslettera z rozumowaniem dostało 8,33 i zachowało sens idiomów („kubeł zimnej wody”, „szczęście w nieszczęściu”), streszczenie było rzeczowe, a quizy z polszczyzny model rozwiązał prawie bezbłędnie. W łatwej korekcie poprawił 21 z 22 błędów.
Na tle innych modeli
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Wyniki z tej samej metody, skalibrowane do jednej skali (ranking ze wszystkimi modelami jest w rankingu AI do pisania po polsku):
| Model | Wynik (0-100) | Cena API (USD za 1 mln tokenów, wejście / wyjście) |
|---|---|---|
| Claude Opus 5.5 | 90,1 | 4 / 20 |
| GPT-6.1 Sol | 85,8 | 2 / 10 |
| Claude Sonnet 5.5 | 80,4 | 2 / 10 |
| Gemini 3.8 Flash | 79,4 | 0,75 / 3,75 |
| DeepSeek V4 Pro | 74,1 | 0,21 / 0,42 |
| Mistral Large 4 (z rozumowaniem) | 69,2 | 1,36 / 4,18 (teraz 0,68 / 2,09) |
| Mistral Medium 3.5 | 68,0 | 1,50 / 7,50 |
| Mistral Large 4 (bez rozumowania) | 65,6 | jak wyżej |
| Bielik 11B v3 (lokalnie) | 64,4 | 0 (własny komputer) |
Ceny z listy OpenRoutera z 7.10.2026, Mistral według cennika producenta. Ceny DeepSeeka zmieniają się często. Bielik był testowany lokalnie na RTX 4090 tą samą metodą w rundzie modeli lokalnych. Gemini 4 Argon nie ma jeszcze w Laboratorium, bo nie ma go na OpenRouterze.
Czy warto go używać po polsku
- Do tekstów, które ktoś przeczyta: raczej nie. Za podobne albo mniejsze pieniądze Gemini 3.8 Flash i DeepSeek V4 Pro piszą lepiej, a Sonnet 5.5 dużo lepiej.
- Do zadań z wiedzą o języku (korekta, sprawdzanie pisowni): tak, ale bez rozumowania - jest szybki, tani i w trudnej korekcie poprawił 24 z 30 błędów.
- Z rozumowaniem: ustaw duży limit tokenów albo licz się z pustymi odpowiedziami. U mnie 9 tekstów zajęło prawie 15 minut.
- Gdy liczy się europejski dostawca i otwarte wagi: to najmocniejszy duży model z Europy. Po premierze wag ocena może się zmienić, bo Mistral zapowiada finalny checkpoint.
Wszystkie odpowiedzi Large 4 możesz przeczytać obok odpowiedzi innych modeli w Arenie modeli AI po polsku - dopisałem tam oba warianty. Pełne porównanie cen i benchmarków jest w tekście Mistral Large 4 vs Claude, GPT, Gemini i DeepSeek.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Źródła i metoda
- Laboratorium Promptowego: 13 poleceń, wyniki i oceny zapisane lokalnie, test 7.10.2026 przez OpenRouter (dostawca Mistral).
- Mistral Large 4 na OpenRouterze (parametry rozumowania, cena)
- Ogłoszenie Mistrala (6.10.2026)
Sprawdziłem: 7 października 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Ile punktów zdobył Mistral Large 4 w teście po polsku?
Mistral Large 4 zdobył 69,2 pkt na 100 z rozumowaniem i 65,6 pkt bez niego. To wynik zbliżony do Mistral Medium 3.5 (68,0 pkt), a wyraźnie niższy niż Claude Sonnet 5.5 (80,4 pkt) czy GPT-6.1 Sol (85,8 pkt).
Czy Mistral Large 4 dobrze radzi sobie z polszczyzną w quizach językowych?
Tak, w quizach językowych model wypadł niemal bezbłędnie - z rozumowaniem uzyskał 46/46 i 46/48, bez rozumowania 46/46 i 45/48. W łatwej korekcie poprawił 21 z 22 błędów, a w trudnej (bez rozumowania) 24 z 30.
Dlaczego Mistral Large 4 z rozumowaniem oddawał puste odpowiedzi?
Model trzykrotnie zużył cały przydzielony limit tokenów na samo rozumowanie i nie wygenerował żadnej odpowiedzi, na przykład przy opisie produktu (limit 6000 tokenów) i trudnej korekcie (8000 tokenów). Inne modele testowane z tymi samymi limitami mieściły się w nich bez problemu.
Ile kosztuje użycie Mistral Large 4 przez API?
Według cennika Mistrala z 7 października 2026 cena wynosiła 1,36 USD za milion tokenów wejściowych i 4,18 USD za wyjściowe, a następnie spadła do 0,68 / 2,09 USD. Dla porównania cały test 13 zadań z rozumowaniem kosztował 0,134 USD (0,235 USD z powtórkami), a bez rozumowania 0,015 USD.
