✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Benchmarki

Arena tygodnia: 2-7 października 2026 - Mistral Large 4 w rankingu

W tym tygodniu do Areny modeli AI po polsku doszły 2 modele: Mistral Large 4 i Mistral Large 4 (bez rozumowania). Najwyżej wszedł Mistral Large 4 - na 17. miejsce wśród 26 modeli w chmurze, ze średnią 6,95 na 10. Na czele bez zmian Claude Opus 5.5 (8,94/10).

4 min czytania
Okładka: Arena tygodnia 2-7 października 2026 - zmiany w rankingu modeli AI po polsku

👁 119 przeczytań

// w skrócie
  • Mistral Large 4 wszedł do Areny na 17. miejscu spośród 26 modeli w chmurze, uzyskując średnią 6,95 na 10 z 8 zadań pisarskich.
  • Liderem rankingu pozostaje Claude Opus 5.5 ze średnią 8,94 na 10, a za nim plasują się GPT-6 Astra (8,78) i GPT-6 Sol (8,76).
  • Wersja Mistral Large 4 bez rozumowania kosztowała 0,015 USD za 13 zadań Laboratorium, czyli prawie 9 razy mniej niż wersja z rozumowaniem (0,134 USD).

W tym tygodniu do Areny modeli AI po polsku doszły 2 modele: Mistral Large 4 i Mistral Large 4 (bez rozumowania). Najwyżej wszedł Mistral Large 4 - na 17. miejsce wśród 26 modeli w chmurze, ze średnią 6,95 na 10. Na czele bez zmian Claude Opus 5.5 (8,94/10).

Stan na 7 października 2026 (porównanie z 2.10)

  • W Arenie: 33 modele (26 w chmurze, 7 lokalnie), tydzień wcześniej 31.
  • Weszli: 2 - Mistral Large 4, Mistral Large 4 (bez rozumowania).
  • Awansowali: 0, spadli: 8, odpadli: 0.
  • Lider: Claude Opus 5.5, średnia 8,94 z 9 zadań pisarskich.

Arena tygodnia to cotygodniowe zestawienie zmian w Arenie modeli AI po polsku: kto doszedł, kto się przesunął i dlaczego. Ranking liczę ze średniej ocen sędziów w 9 zadaniach pisarskich, a obok podaję wynik z Laboratorium Promptowego (0-100), który obejmuje też korektę i quiz z polszczyzny.

Kto wszedł do Areny

Mistral Large 4: 17. miejsce

  • Średnia sędziów: 6,95 na 10 z 8 zadań.
  • Wynik w Laboratorium: 69,2 pkt na 100.
  • Najlepiej: tłumaczenie newslettera - 8,3/10, 10. miejsce na 26.
  • Najsłabiej: artykuł na bloga - 5,5/10, 19. miejsce na 26.
  • Bez oceny (pusta odpowiedź): opis produktu - tego zadania nie liczę do średniej w Arenie.

Pełny test z przykładami błędów: Mistral Large 4 - mój test.

Mistral Large 4 (bez rozumowania): 19. miejsce

  • Średnia sędziów: 6,50 na 10.
  • Wynik w Laboratorium: 65,6 pkt na 100.
  • Najlepiej: odpowiedź na skargę klienta - 7,5/10, 14. miejsce na 26.
  • Najsłabiej: wyjaśnij dziecku inflację - 5,5/10, 25. miejsce na 26.

Pełny test z przykładami błędów: Mistral Large 4 - mój test.

Co mówi wejście Mistrala

Mistral Large 4 jest pierwszym nowym modelem w Arenie od jej startu 2 października. Sprawdziłem w wynikach Laboratorium, kto jeszcze doszedł w tym czasie: nikt. Ostatnie wcześniejsze przebiegi (Llama 4 Maverick, Llama 4 Scout i Muse Glimmer 30B z 30 września) były w Arenie od pierwszego dnia.

  • W tekstach Large 4 jest wyraźnie lepszy od poprzednika. Mistral Medium 3.5 ma w Arenie średnią 5,13 i stoi na 25. miejscu, a Large 4 z rozumowaniem 6,95 i 17. miejsce. Różnica jest największa w streszczeniu (7,8 wobec 3,9) i w odpowiedzi na skargę (7,0 wobec 4,1).
  • W Laboratorium różnica prawie znika: 69,2 pkt wobec 68,0. Wynik Laboratorium liczy też korektę tekstu i twarde reguły z poleceń, a Large 4 z rozumowaniem w trudnej korekcie i w opisie produktu zużył cały limit tokenów i nie oddał odpowiedzi. Arena nie liczy pustych odpowiedzi, Laboratorium liczy je jako błąd.
  • Wersja bez rozumowania jest tańsza i równiejsza. Średnia 6,50 i 19. miejsce, ale odpowiedziała na wszystkie 9 zadań, a 13 zadań Laboratorium kosztowało 0,015 USD zamiast 0,134 USD.
  • Do czołówki daleko. Claude Sonnet 5.5 ma 8,28, GPT-6.1 Sol 8,57, a nawet tani Gemini 3.8 Flash 8,09. Large 4 wyprzedza za to GLM-5.3, Claude Haiku 4.5 i obie Llamy 4.

O samej premierze, cenie i otwartych wagach piszę w tekście Mistral Large 4: premiera, parametry, cena i wagi, a porównanie cen z konkurencją jest w zestawieniu Mistral Large 4 vs Claude, GPT, Gemini i DeepSeek. Wszystko o firmie zebrałem w przewodniku po Mistral AI.

Kto awansował, kto spadł

Wszystkie spadki w tym tygodniu są mechaniczne: 8 modeli zjechało w dół, bo nowe modele weszły nad nie. Ich oceny się nie zmieniły.

ModelByłoJestRuchŚredniaPowód
GLM-5.318.20.w dół o 26,36wyprzedzony przez nowe modele
GLM-5.3 (tylko Z.AI)19.21.w dół o 26,21wyprzedzony przez nowe modele
Claude Haiku 4.520.22.w dół o 25,61wyprzedzony przez nowe modele
Llama 4 Maverick21.23.w dół o 25,59wyprzedzony przez nowe modele
Muse Glimmer 30B22.24.w dół o 25,50wyprzedzony przez nowe modele
Mistral Medium 3.523.25.w dół o 25,13wyprzedzony przez nowe modele
Llama 4 Scout24.26.w dół o 24,87wyprzedzony przez nowe modele
Muse Spark 1.317.18.w dół o 16,79wyprzedzony przez nowe modele

Drobne przesunięcia ocen bez zmiany miejsca: Claude Opus 5.5 (-0,04), GPT-6 Luna (-0,03). To efekt ponownej oceny modeli kotwiczących w rundzie z nowym modelem - sędziowie ocenili ich teksty jeszcze raz, a średnia z wszystkich rund przesunęła się o setne części punktu.

Ranking po tym tygodniu

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

#ModelŚrednia 0-10LaboratoriumZmiana
1.Claude Opus 5.58,9490,1bez zmian
2.GPT-6 Astra8,7885,3bez zmian
3.GPT-6 Sol8,7686,4bez zmian
4.GPT-6.1 Sol8,5785,8bez zmian
5.GPT-6 Luna8,4182,8bez zmian
6.Claude Fable 5.18,3683,9bez zmian
7.Claude Sonnet 5.58,2880,4bez zmian
8.Gemini 3.8 Flash8,0979,4bez zmian
9.Kimi K38,0278,5bez zmian
10.Qwen 3.8 Max7,7375,9bez zmian
11.DeepSeek V4 Pro7,5774,1bez zmian
12.Gemini 3.1 Pro7,5677,8bez zmian
13.Grok 4.77,4977,4bez zmian
14.MiMo-V2.6-Pro7,11-bez zmian
15.DeepSeek V4.1 Flash7,0972,9bez zmian
16.Claude Sonnet 57,0071,9bez zmian
17.Mistral Large 46,9569,2nowy
18.Muse Spark 1.36,79-w dół o 1
19.Mistral Large 4 (bez rozumowania)6,5065,6nowy
20.GLM-5.36,3664,4w dół o 2
21.GLM-5.3 (tylko Z.AI)6,21-w dół o 2
22.Claude Haiku 4.55,6159,2w dół o 2
23.Llama 4 Maverick5,5962,9w dół o 2
24.Muse Glimmer 30B5,50-w dół o 2
25.Mistral Medium 3.55,1368,0w dół o 2
26.Llama 4 Scout4,87-w dół o 2

Jak liczę ten ranking

  • Każdy model dostaje te same 9 zadań: artykuł, opis produktu, odpowiedź na skargę, post na LinkedIn, opowiadanie, 10 tytułów SEO, streszczenie, wyjaśnienie inflacji dziecku i tłumaczenie.
  • Teksty oceniają w ciemno modele-sędziowie w trzech kryteriach: poprawność, naturalność i wykonanie polecenia. Średnia to wynik w skali 0-10.
  • Ranking obejmuje modele w chmurze. Modele lokalne (RTX 4090) mają osobną listę, bo ich runda była łagodniej oceniana.
  • Porównuję stan Areny z końca poprzedniego wydania. Spadek o miejsce przy tej samej ocenie oznacza, że nad model wszedł ktoś nowy.
  • Wynik Laboratorium (0-100) to osobna miara: 70% ocena sędziów, 20% twarde reguły z poleceń, 10% higiena tekstu, plus korekta i quiz.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Co sprawdzę w następnym tygodniu

Każda premiera z kalendarza premier AI trafia do Laboratorium w dniu udostępnienia w API, a potem do Areny. Odpowiedzi wszystkich modeli przeczytasz obok siebie w Arenie, a generatory obrazów porównasz w arenie generatorów obrazów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Na którym miejscu w rankingu znalazł się Mistral Large 4?

Mistral Large 4 zadebiutował na 17. miejscu wśród 26 modeli w chmurze ze średnią 6,95 na 10. Najlepiej wypadł w tłumaczeniu newslettera (8,3/10, 10. miejsce), a najsłabiej w artykule na bloga (5,5/10, 19. miejsce).

Czym różni się Mistral Large 4 od wersji bez rozumowania?

Wersja z rozumowaniem osiągnęła wyższą średnią (6,95 vs 6,50) i 17. miejsce, ale nie odpowiedziała na jedno zadanie - opis produktu - z powodu wyczerpania limitu tokenów. Wersja bez rozumowania zajęła 19. miejsce, lecz ukończyła wszystkie 9 zadań i była niemal 9 razy tańsza w Laboratorium.

Ile modeli jest w Arenie po tygodniu 2-7 października 2026?

W Arenie znajdują się łącznie 33 modele: 26 w chmurze i 7 lokalnie. Tydzień wcześniej było ich 31, a w tym tygodniu dołączyły dwa modele Mistrala.

Jak duża jest różnica między Mistral Large 4 a Mistral Medium 3.5?

Mistral Large 4 (z rozumowaniem) ma średnią 6,95 i zajmuje 17. miejsce, podczas gdy Mistral Medium 3.5 ma średnią 5,13 i stoi na 25. miejscu. Największa różnica widoczna jest w streszczeniu (7,8 vs 3,9) i w odpowiedzi na skargę klienta (7,0 vs 4,1).

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›