✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Mistral Large 4 po polsku: mój test w 13 zadaniach

Mistral Large 4 przeszedł przez 13 zadań Laboratorium: 69,2 pkt z rozumowaniem i 65,6 bez. Pokazuję, gdzie wypadł dobrze, gdzie się wyłożył i ile to kosztowało.

5 min czytania
Logo Mistral AI i napis Large 4 po polsku - mój test w 13 zadaniach

👁 120 przeczytań

// w skrócie
  • Mistral Large 4 uzyskał 69,2 pkt na 100 w trybie z rozumowaniem i 65,6 pkt bez niego, co odpowiada poziomowi Mistral Medium 3.5.
  • W trybie rozumowania model trzykrotnie zużył cały limit tokenów i nie oddał żadnej odpowiedzi w opisie produktu (6000 tokenów) i trudnej korekcie (8000 tokenów).
  • Za podobne pieniądze Gemini 3.8 Flash (79,4 pkt) i DeepSeek V4 Pro (74,1 pkt) wypadają lepiej, a Mistral Large 4 poleca się głównie do korekty bez rozumowania.

Mistral Large 4 dostał w moim teście po polsku 69,2 pkt na 100 z rozumowaniem i 65,6 pkt bez niego. To poziom poprzedniego flagowca Mistrala, Medium 3.5, i wyraźnie mniej niż Claude Sonnet 5.5, GPT-6.1 Sol czy DeepSeek V4 Pro. Świetnie zna polszczyznę (quiz 46/46), ale w trybie rozumowania potrafi „przemyśleć” cały limit tokenów i nie oddać odpowiedzi. O samej premierze piszę w newsie Mistral Large 4, a o firmie w hubie Mistral AI.

Test z 7 października 2026

  • Model: mistralai/mistral-large-4-0 przez OpenRouter (dostawca: Mistral), wersja podglądowa z 6.10.2026.
  • Zadania: 13 - te same co w Arenie modeli AI po polsku i w rankingu AI do pisania.
  • Ocena: w ciemno, Claude Opus 5.5 i GPT-6 Sol, z kalibracją przez 4 modele kotwiczące.
  • Koszt: 0,24 USD odpowiedzi z rozumowaniem (z powtórkami), 0,015 USD bez rozumowania, ok. 1,28 USD sędziowie.

Jak testowałem

Laboratorium Promptowego to mój stały zestaw 13 poleceń, przez który przeszło już ponad 30 modeli:

  1. 9 zadań pisarskich: artykuł na bloga, opis produktu, odpowiedź na skargę klienta, post na LinkedIn, opowiadanie, 10 tytułów SEO, streszczenie w 5 punktach, wyjaśnienie inflacji dziecku i tłumaczenie newslettera;
  2. 2 korekty tekstu z błędami (łatwa z 22 błędami i trudna z 30);
  3. 2 quizy z polszczyzny (46 i 48 pytań).

Teksty oceniali w ciemno dwaj sędziowie (Claude Opus 5.5 i GPT-6 Sol) w trzech kryteriach: poprawność, naturalność, wykonanie polecenia. Wynik końcowy to w 70% ocena sędziów, w 20% spełnienie twardych reguł z poleceń (limity słów, liczba punktów) i w 10% higiena tekstu. Żeby wynik dało się porównać ze starszymi rundami, w tej samej puli oceniałem 4 modele kotwiczące (Opus 5.5, GPT-6 Luna, Qwen3.8 Max, GLM-5.3) i przesuwałem skalę o średnią różnicę. Kotwice ułożyły się w tej samej kolejności co w pierwszej rundzie, a przesunięcie wyniosło +1,38 i +1,0 pkt.

OpenRouter pozwala dla Large 4 ustawić tylko rozumowanie pełne albo wyłączone (inne modele w Laboratorium biegły na niskim poziomie rozumowania). Dlatego zrobiłem dwie rundy: z rozumowaniem i bez.

Wyniki

Large 4 z rozumowaniemLarge 4 bez rozumowania
Wynik (0-100)69,265,6
Średnia sędziów (1-10)6,306,52
Poprawność / naturalność / wykonanie7,67 / 5,89 / 5,338,22 / 6,22 / 5,11
Reguły z poleceń23/2623/26
Korekta łatwa21/2221/22
Korekta trudna0/30 (pusta odpowiedź)24/30
Quiz łatwy / trudny46/46 i 46/4846/46 i 45/48
Czas 9 zadań pisarskich888,6 s91,0 s
Koszt 13 zadań0,134 USD (0,235 z powtórkami)0,015 USD
Tokeny „myślenia” / wszystkie wyjściowe42 230 / 62 4230 / 5 786

Średnia sędziów w poszczególnych zadaniach (1-10):

ZadanieZ rozumowaniemBez rozumowania
Artykuł na bloga5,505,83
Opis produktu1,00 (pusta odpowiedź)6,50
Odpowiedź na skargę klienta7,007,50
Post na LinkedIn7,336,33
Opowiadanie6,506,33
10 tytułów SEO5,67 (tylko 2 tytuły)7,00
Streszczenie w 5 punktach7,836,83
Inflacja dla dziecka7,505,50
Tłumaczenie newslettera8,336,83

Co dokładnie poszło nie tak

  • Puste odpowiedzi przy rozumowaniu. W opisie produktu (limit 6000 tokenów) i trudnej korekcie (8000) model trzy razy pod rząd zużył cały limit i nie oddał ani słowa. W tytułach SEO trzecia próba skończyła się po dwóch tytułach z dziesięciu. Inne modele dostały te same limity i się w nich mieściły, więc liczę to jako błąd modelu, a nie testu.
  • Dopowiedziane fakty. W mailu do klienta wersja z rozumowaniem napisała, że przewoźnik „potwierdził dostawę na 3 października”, choć w poleceniu była tylko przewidywana data. Wersja bez rozumowania dodała od siebie, że paczka utknęła „z przyczyn niezależnych od nas”. Obaj sędziowie wychwycili jedno i drugie.
  • Błąd logiczny w tekście dla dziecka. Wersja z rozumowaniem napisała, że warto oszczędzać pieniądze na później, „bo z czasem będą warte mniej niż dzisiaj”. To odwrotność sensownej rady. Wersja bez rozumowania powtórzyła ten sam błąd i dodała lizak za 20 zł.
  • Jednostki i kalki. W artykule o oszczędzaniu prądu pojawiły się „waty na godzinę”, w tłumaczeniu „piłka jest teraz po naszej stronie”.
  • Rok 2024 w tytułach. Bez rozumowania model dał 10 poprawnych tytułów, ale w jednym wpisał „2024”. Tak samo zrobił w urwanej wersji z rozumowaniem.
  • Półpauzy. Bez rozumowania model wstawiał ich 20,6 na 1000 słów, z rozumowaniem 8,7. Dla porównania Claude Opus 5.5 - 5,1.

Co wyszło dobrze: tłumaczenie newslettera z rozumowaniem dostało 8,33 i zachowało sens idiomów („kubeł zimnej wody”, „szczęście w nieszczęściu”), streszczenie było rzeczowe, a quizy z polszczyzny model rozwiązał prawie bezbłędnie. W łatwej korekcie poprawił 21 z 22 błędów.

Na tle innych modeli

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Wyniki z tej samej metody, skalibrowane do jednej skali (ranking ze wszystkimi modelami jest w rankingu AI do pisania po polsku):

ModelWynik (0-100)Cena API (USD za 1 mln tokenów, wejście / wyjście)
Claude Opus 5.590,14 / 20
GPT-6.1 Sol85,82 / 10
Claude Sonnet 5.580,42 / 10
Gemini 3.8 Flash79,40,75 / 3,75
DeepSeek V4 Pro74,10,21 / 0,42
Mistral Large 4 (z rozumowaniem)69,21,36 / 4,18 (teraz 0,68 / 2,09)
Mistral Medium 3.568,01,50 / 7,50
Mistral Large 4 (bez rozumowania)65,6jak wyżej
Bielik 11B v3 (lokalnie)64,40 (własny komputer)

Ceny z listy OpenRoutera z 7.10.2026, Mistral według cennika producenta. Ceny DeepSeeka zmieniają się często. Bielik był testowany lokalnie na RTX 4090 tą samą metodą w rundzie modeli lokalnych. Gemini 4 Argon nie ma jeszcze w Laboratorium, bo nie ma go na OpenRouterze.

Czy warto go używać po polsku

  • Do tekstów, które ktoś przeczyta: raczej nie. Za podobne albo mniejsze pieniądze Gemini 3.8 Flash i DeepSeek V4 Pro piszą lepiej, a Sonnet 5.5 dużo lepiej.
  • Do zadań z wiedzą o języku (korekta, sprawdzanie pisowni): tak, ale bez rozumowania - jest szybki, tani i w trudnej korekcie poprawił 24 z 30 błędów.
  • Z rozumowaniem: ustaw duży limit tokenów albo licz się z pustymi odpowiedziami. U mnie 9 tekstów zajęło prawie 15 minut.
  • Gdy liczy się europejski dostawca i otwarte wagi: to najmocniejszy duży model z Europy. Po premierze wag ocena może się zmienić, bo Mistral zapowiada finalny checkpoint.

Wszystkie odpowiedzi Large 4 możesz przeczytać obok odpowiedzi innych modeli w Arenie modeli AI po polsku - dopisałem tam oba warianty. Pełne porównanie cen i benchmarków jest w tekście Mistral Large 4 vs Claude, GPT, Gemini i DeepSeek.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i metoda

Sprawdziłem: 7 października 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Ile punktów zdobył Mistral Large 4 w teście po polsku?

Mistral Large 4 zdobył 69,2 pkt na 100 z rozumowaniem i 65,6 pkt bez niego. To wynik zbliżony do Mistral Medium 3.5 (68,0 pkt), a wyraźnie niższy niż Claude Sonnet 5.5 (80,4 pkt) czy GPT-6.1 Sol (85,8 pkt).

Czy Mistral Large 4 dobrze radzi sobie z polszczyzną w quizach językowych?

Tak, w quizach językowych model wypadł niemal bezbłędnie - z rozumowaniem uzyskał 46/46 i 46/48, bez rozumowania 46/46 i 45/48. W łatwej korekcie poprawił 21 z 22 błędów, a w trudnej (bez rozumowania) 24 z 30.

Dlaczego Mistral Large 4 z rozumowaniem oddawał puste odpowiedzi?

Model trzykrotnie zużył cały przydzielony limit tokenów na samo rozumowanie i nie wygenerował żadnej odpowiedzi, na przykład przy opisie produktu (limit 6000 tokenów) i trudnej korekcie (8000 tokenów). Inne modele testowane z tymi samymi limitami mieściły się w nich bez problemu.

Ile kosztuje użycie Mistral Large 4 przez API?

Według cennika Mistrala z 7 października 2026 cena wynosiła 1,36 USD za milion tokenów wejściowych i 4,18 USD za wyjściowe, a następnie spadła do 0,68 / 2,09 USD. Dla porównania cały test 13 zadań z rozumowaniem kosztował 0,134 USD (0,235 USD z powtórkami), a bez rozumowania 0,015 USD.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›