Arena tygodnia: 2-7 października 2026 - Mistral Large 4 w rankingu
W tym tygodniu do Areny modeli AI po polsku doszły 2 modele: Mistral Large 4 i Mistral Large 4 (bez rozumowania). Najwyżej wszedł Mistral Large 4 - na 17. miejsce wśród 26 modeli w chmurze, ze średnią 6,95 na 10. Na czele bez zmian Claude Opus 5.5 (8,94/10).

👁 120 przeczytań
- Mistral Large 4 wszedł do Areny na 17. miejscu spośród 26 modeli w chmurze, uzyskując średnią 6,95 na 10 z 8 zadań pisarskich.
- Liderem rankingu pozostaje Claude Opus 5.5 ze średnią 8,94 na 10, a za nim plasują się GPT-6 Astra (8,78) i GPT-6 Sol (8,76).
- Wersja Mistral Large 4 bez rozumowania kosztowała 0,015 USD za 13 zadań Laboratorium, czyli prawie 9 razy mniej niż wersja z rozumowaniem (0,134 USD).
W tym tygodniu do Areny modeli AI po polsku doszły 2 modele: Mistral Large 4 i Mistral Large 4 (bez rozumowania). Najwyżej wszedł Mistral Large 4 - na 17. miejsce wśród 26 modeli w chmurze, ze średnią 6,95 na 10. Na czele bez zmian Claude Opus 5.5 (8,94/10).
Stan na 7 października 2026 (porównanie z 2.10)
- W Arenie: 33 modele (26 w chmurze, 7 lokalnie), tydzień wcześniej 31.
- Weszli: 2 - Mistral Large 4, Mistral Large 4 (bez rozumowania).
- Awansowali: 0, spadli: 8, odpadli: 0.
- Lider: Claude Opus 5.5, średnia 8,94 z 9 zadań pisarskich.
Arena tygodnia to cotygodniowe zestawienie zmian w Arenie modeli AI po polsku: kto doszedł, kto się przesunął i dlaczego. Ranking liczę ze średniej ocen sędziów w 9 zadaniach pisarskich, a obok podaję wynik z Laboratorium Promptowego (0-100), który obejmuje też korektę i quiz z polszczyzny.
Kto wszedł do Areny
Mistral Large 4: 17. miejsce
- Średnia sędziów: 6,95 na 10 z 8 zadań.
- Wynik w Laboratorium: 69,2 pkt na 100.
- Najlepiej: tłumaczenie newslettera - 8,3/10, 10. miejsce na 26.
- Najsłabiej: artykuł na bloga - 5,5/10, 19. miejsce na 26.
- Bez oceny (pusta odpowiedź): opis produktu - tego zadania nie liczę do średniej w Arenie.
Pełny test z przykładami błędów: Mistral Large 4 - mój test.
Mistral Large 4 (bez rozumowania): 19. miejsce
- Średnia sędziów: 6,50 na 10.
- Wynik w Laboratorium: 65,6 pkt na 100.
- Najlepiej: odpowiedź na skargę klienta - 7,5/10, 14. miejsce na 26.
- Najsłabiej: wyjaśnij dziecku inflację - 5,5/10, 25. miejsce na 26.
Pełny test z przykładami błędów: Mistral Large 4 - mój test.
Co mówi wejście Mistrala
Mistral Large 4 jest pierwszym nowym modelem w Arenie od jej startu 2 października. Sprawdziłem w wynikach Laboratorium, kto jeszcze doszedł w tym czasie: nikt. Ostatnie wcześniejsze przebiegi (Llama 4 Maverick, Llama 4 Scout i Muse Glimmer 30B z 30 września) były w Arenie od pierwszego dnia.
- W tekstach Large 4 jest wyraźnie lepszy od poprzednika. Mistral Medium 3.5 ma w Arenie średnią 5,13 i stoi na 25. miejscu, a Large 4 z rozumowaniem 6,95 i 17. miejsce. Różnica jest największa w streszczeniu (7,8 wobec 3,9) i w odpowiedzi na skargę (7,0 wobec 4,1).
- W Laboratorium różnica prawie znika: 69,2 pkt wobec 68,0. Wynik Laboratorium liczy też korektę tekstu i twarde reguły z poleceń, a Large 4 z rozumowaniem w trudnej korekcie i w opisie produktu zużył cały limit tokenów i nie oddał odpowiedzi. Arena nie liczy pustych odpowiedzi, Laboratorium liczy je jako błąd.
- Wersja bez rozumowania jest tańsza i równiejsza. Średnia 6,50 i 19. miejsce, ale odpowiedziała na wszystkie 9 zadań, a 13 zadań Laboratorium kosztowało 0,015 USD zamiast 0,134 USD.
- Do czołówki daleko. Claude Sonnet 5.5 ma 8,28, GPT-6.1 Sol 8,57, a nawet tani Gemini 3.8 Flash 8,09. Large 4 wyprzedza za to GLM-5.3, Claude Haiku 4.5 i obie Llamy 4.
O samej premierze, cenie i otwartych wagach piszę w tekście Mistral Large 4: premiera, parametry, cena i wagi, a porównanie cen z konkurencją jest w zestawieniu Mistral Large 4 vs Claude, GPT, Gemini i DeepSeek. Wszystko o firmie zebrałem w przewodniku po Mistral AI.
Kto awansował, kto spadł
Wszystkie spadki w tym tygodniu są mechaniczne: 8 modeli zjechało w dół, bo nowe modele weszły nad nie. Ich oceny się nie zmieniły.
| Model | Było | Jest | Ruch | Średnia | Powód |
|---|---|---|---|---|---|
| GLM-5.3 | 18. | 20. | w dół o 2 | 6,36 | wyprzedzony przez nowe modele |
| GLM-5.3 (tylko Z.AI) | 19. | 21. | w dół o 2 | 6,21 | wyprzedzony przez nowe modele |
| Claude Haiku 4.5 | 20. | 22. | w dół o 2 | 5,61 | wyprzedzony przez nowe modele |
| Llama 4 Maverick | 21. | 23. | w dół o 2 | 5,59 | wyprzedzony przez nowe modele |
| Muse Glimmer 30B | 22. | 24. | w dół o 2 | 5,50 | wyprzedzony przez nowe modele |
| Mistral Medium 3.5 | 23. | 25. | w dół o 2 | 5,13 | wyprzedzony przez nowe modele |
| Llama 4 Scout | 24. | 26. | w dół o 2 | 4,87 | wyprzedzony przez nowe modele |
| Muse Spark 1.3 | 17. | 18. | w dół o 1 | 6,79 | wyprzedzony przez nowe modele |
Drobne przesunięcia ocen bez zmiany miejsca: Claude Opus 5.5 (-0,04), GPT-6 Luna (-0,03). To efekt ponownej oceny modeli kotwiczących w rundzie z nowym modelem - sędziowie ocenili ich teksty jeszcze raz, a średnia z wszystkich rund przesunęła się o setne części punktu.
Ranking po tym tygodniu
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
| # | Model | Średnia 0-10 | Laboratorium | Zmiana |
|---|---|---|---|---|
| 1. | Claude Opus 5.5 | 8,94 | 90,1 | bez zmian |
| 2. | GPT-6 Astra | 8,78 | 85,3 | bez zmian |
| 3. | GPT-6 Sol | 8,76 | 86,4 | bez zmian |
| 4. | GPT-6.1 Sol | 8,57 | 85,8 | bez zmian |
| 5. | GPT-6 Luna | 8,41 | 82,8 | bez zmian |
| 6. | Claude Fable 5.1 | 8,36 | 83,9 | bez zmian |
| 7. | Claude Sonnet 5.5 | 8,28 | 80,4 | bez zmian |
| 8. | Gemini 3.8 Flash | 8,09 | 79,4 | bez zmian |
| 9. | Kimi K3 | 8,02 | 78,5 | bez zmian |
| 10. | Qwen 3.8 Max | 7,73 | 75,9 | bez zmian |
| 11. | DeepSeek V4 Pro | 7,57 | 74,1 | bez zmian |
| 12. | Gemini 3.1 Pro | 7,56 | 77,8 | bez zmian |
| 13. | Grok 4.7 | 7,49 | 77,4 | bez zmian |
| 14. | MiMo-V2.6-Pro | 7,11 | - | bez zmian |
| 15. | DeepSeek V4.1 Flash | 7,09 | 72,9 | bez zmian |
| 16. | Claude Sonnet 5 | 7,00 | 71,9 | bez zmian |
| 17. | Mistral Large 4 | 6,95 | 69,2 | nowy |
| 18. | Muse Spark 1.3 | 6,79 | - | w dół o 1 |
| 19. | Mistral Large 4 (bez rozumowania) | 6,50 | 65,6 | nowy |
| 20. | GLM-5.3 | 6,36 | 64,4 | w dół o 2 |
| 21. | GLM-5.3 (tylko Z.AI) | 6,21 | - | w dół o 2 |
| 22. | Claude Haiku 4.5 | 5,61 | 59,2 | w dół o 2 |
| 23. | Llama 4 Maverick | 5,59 | 62,9 | w dół o 2 |
| 24. | Muse Glimmer 30B | 5,50 | - | w dół o 2 |
| 25. | Mistral Medium 3.5 | 5,13 | 68,0 | w dół o 2 |
| 26. | Llama 4 Scout | 4,87 | - | w dół o 2 |
Jak liczę ten ranking
- Każdy model dostaje te same 9 zadań: artykuł, opis produktu, odpowiedź na skargę, post na LinkedIn, opowiadanie, 10 tytułów SEO, streszczenie, wyjaśnienie inflacji dziecku i tłumaczenie.
- Teksty oceniają w ciemno modele-sędziowie w trzech kryteriach: poprawność, naturalność i wykonanie polecenia. Średnia to wynik w skali 0-10.
- Ranking obejmuje modele w chmurze. Modele lokalne (RTX 4090) mają osobną listę, bo ich runda była łagodniej oceniana.
- Porównuję stan Areny z końca poprzedniego wydania. Spadek o miejsce przy tej samej ocenie oznacza, że nad model wszedł ktoś nowy.
- Wynik Laboratorium (0-100) to osobna miara: 70% ocena sędziów, 20% twarde reguły z poleceń, 10% higiena tekstu, plus korekta i quiz.
Co sprawdzę w następnym tygodniu
Każda premiera z kalendarza premier AI trafia do Laboratorium w dniu udostępnienia w API, a potem do Areny. Odpowiedzi wszystkich modeli przeczytasz obok siebie w Arenie, a generatory obrazów porównasz w arenie generatorów obrazów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Na którym miejscu w rankingu znalazł się Mistral Large 4?
Mistral Large 4 zadebiutował na 17. miejscu wśród 26 modeli w chmurze ze średnią 6,95 na 10. Najlepiej wypadł w tłumaczeniu newslettera (8,3/10, 10. miejsce), a najsłabiej w artykule na bloga (5,5/10, 19. miejsce).
Czym różni się Mistral Large 4 od wersji bez rozumowania?
Wersja z rozumowaniem osiągnęła wyższą średnią (6,95 vs 6,50) i 17. miejsce, ale nie odpowiedziała na jedno zadanie - opis produktu - z powodu wyczerpania limitu tokenów. Wersja bez rozumowania zajęła 19. miejsce, lecz ukończyła wszystkie 9 zadań i była niemal 9 razy tańsza w Laboratorium.
Ile modeli jest w Arenie po tygodniu 2-7 października 2026?
W Arenie znajdują się łącznie 33 modele: 26 w chmurze i 7 lokalnie. Tydzień wcześniej było ich 31, a w tym tygodniu dołączyły dwa modele Mistrala.
Jak duża jest różnica między Mistral Large 4 a Mistral Medium 3.5?
Mistral Large 4 (z rozumowaniem) ma średnią 6,95 i zajmuje 17. miejsce, podczas gdy Mistral Medium 3.5 ma średnią 5,13 i stoi na 25. miejscu. Największa różnica widoczna jest w streszczeniu (7,8 vs 3,9) i w odpowiedzi na skargę klienta (7,0 vs 4,1).
