Mniej znane modele AI: MiMo, Qwen3.8 Max, GLM-5.3 i Muse Spark
Cztery modele tuż za Claude’em i GPT-6 w rankingu Artificial Analysis. W moim teście po polsku dzieli je 13 punktów, a najtańszy kosztował 0,03 USD.

👁 115 przeczytań
Mniej znane modele AI z czołówki to cztery nazwy, które w rankingu Artificial Analysis stoją tuż za modelami Anthropic i OpenAI, obok Groka 4.7: Muse Spark 1.3 od Mety, MiMo-V2.6-Pro od Xiaomi, Qwen3.8 Max od Alibaby i GLM-5.3 od Z.ai. Mają od 45 do 48 punktów w indeksie inteligencji, a za token wyjścia kosztują od 3 do 23 razy mniej niż Claude Opus 5.5. Wszystkie cztery przepuściłem przez moje Laboratorium: te same 13 zadań po polsku i ta sama ocena w ciemno co w rankingu 16 modeli.
W skrócie
Do pisania po polsku najlepiej wypadł Qwen3.8 Max: 76,4 pkt na 100, przy 91,2 pkt Claude Opus 5.5 i 81,5 pkt GPT-6 Luny w tej samej rundzie. Z zastrzeżeniem: jedną z jego odpowiedzi oceniłem z drugiej próby z wyższym limitem, a przy równych limitach miałby 68,2 pkt. Tuż za Qwenem jest Muse Spark 1.3 od Mety: 75,5 pkt za 0,10 USD, bez ani jednej pustej odpowiedzi, choć wynik podnosi mu głównie czysta typografia, a sędziowie ocenili jego teksty najsłabiej pod względem naturalności. MiMo-V2.6-Pro zdobył 69,1 pkt za 0,03 USD (13 zadań), ale w trudnym quizie myślał do końca limitu i nie oddał odpowiedzi. GLM-5.3 zamknął stawkę z wynikiem 63,6 pkt, a powtórka tylko u producenta (Z.ai, bez tańszych dostawców) dała 61,8 pkt, więc to nie wina kwantyzacji. Wysoki wynik w benchmarkach Artificial Analysis nie przekłada się na polszczyznę: tam wszystkie cztery są blisko siebie (45-48 pkt), u mnie dzieli je 13 punktów, a Muse Spark z najwyższym indeksem jest dopiero drugi. Jeśli piszesz po polsku przez API i szukasz czegoś taniego, GPT-6 Luna daje więcej za mniej. To moja opinia.
01Muse Spark 1.3 od Mety: benchmarki, cena i dostęp w PolsceNajszybszy model w czołówce Artificial Analysis. W moim teście po polsku 75,5 pkt za 0,10 USD - świetny przekład, fatalny opis produktu.Czytaj →
02Qwen3.8 Max po polsku: mój test w 13 zadaniach, ceny i dostępQwen3.8 Max (0902) w moim teście po polsku: 76,4 pkt, 30/30 w trudnej korekcie, ceny w złotych i jak z niego korzystać.Czytaj →
03GLM-5.3 po polsku: test w 13 zadaniach, dostawcy i cenyNajszybszy i, obok MiMo, najtańszy z mocnych chińskich modeli w moim teście, ale z największą liczbą błędów. Tania kwantyzacja fp4 nie jest winna.Czytaj →
04Xiaomi MiMo-V2.6: najmocniejszy otwarty model AI - cena, benchmarki i mój testNajmocniejszy otwarty model według Artificial Analysis. W krótkich zadaniach rzetelny, przy tekście po polsku myślał, aż skończył się limit.Czytaj →
05Ranking AI do pisania po polsku: 16 modeli, 9 zadań i ślepa ocenaClaude Opus 5.5 wygrał z wynikiem 90,1, ale GPT-6 Luna zrobiła 9 zadań za mniej niż grosz. Pełna tabela, cytaty z odpowiedzi i dokładna metodologia.Czytaj →
06Chińskie modele AI po polsku: test 5 modeli, trzy nie oddały ani słowaPięć nowych modeli z Chin, jedno polecenie po polsku. Trzy myślały, aż skończył się limit - Qwen liczył w myślach każde słowo po kolei.Czytaj →Kim są i gdzie stoją w rankingu
Artificial Analysis liczy swój indeks (wersja 4.3.2) z 10 testów: zadań agentowych, programowania, rozumowania naukowego i wiedzy ogólnej. Poniżej wartości odczytane 27 września 2026. Koszt zadania to średni koszt jednego zadania z indeksu według tej samej strony, a nie koszt mojego testu.
| Model | Firma | Indeks AA | Tokeny/s | Koszt zadania AA | Wagi |
|---|---|---|---|---|---|
| Claude Opus 5.5 (max) | Anthropic | 58 | - | 5,98 USD | zamknięte |
| Muse Spark 1.3 (max) | Meta | 48 | 214 | 1,60 USD | zamknięte |
| MiMo-V2.6-Pro | Xiaomi | 46 | 44 | 0,13 USD | otwarte, MIT |
| Muse Spark 1.3 (xhigh) | Meta | 45 | 252 | 1,37 USD | zamknięte |
| Qwen3.8 Max (0902) | Alibaba | 45 | 39 | 5,41 USD | zamknięte |
| GLM-5.3 (max) | Z.ai | 45 | 84 | 2,01 USD | otwarte, licencja GLM-5.3 |
| GPT-6 Luna (max) | OpenAI | 37 | 163 | 0,07 USD | zamknięte |
Z tej tabeli wynikają trzy rzeczy. Muse Spark jest najszybszy w czołówce - 214-252 tokenów na sekundę, czyli ponad dwa razy szybciej niż Opus 5.5 w wariancie xhigh (89). MiMo-V2.6-Pro robi zadanie z indeksu za 0,13 USD, 46 razy taniej niż Opus w wariancie max. Qwen to przeciwny biegun: kosztuje 5,41 USD za zadanie, bo przy indeksie wygenerował 190 mln tokenów.
Mój test po polsku: wyniki
Każdy model dostał przez OpenRouter te same 13 poleceń co w rankingu AI do pisania po polsku: 9 zadań pisarskich (artykuł, opis produktu, mail, post, opowiadanie, tytuły, streszczenie, tłumaczenie, tekst dla dziecka), dwie korekty i dwa quizy o Polsce. Ustawienia jak u wszystkich: effort=low, domyślna temperatura, te same limity tokenów. Odpowiedzi ocenili w ciemno trzej sędziowie z różnych firm (Claude Opus 5.5, GPT-6 Sol, Gemini 3.1 Pro), a sędzia z tej samej firmy co oceniany model był pomijany. Wynik to 70% ocen sędziów, 20% reguł z polecenia i 10% higieny tekstu (długie pauzy, wata).
Do puli dołożyłem cztery kotwice z pierwszej rundy: Claude Opus 5.5, GPT-6 Luna, Qwen3.8 Max i GLM-5.3. Ich wyniki różniły się od tamtych o 0,5-1,3 pkt, a kolejność się nie zmieniła, więc skala jest porównywalna (średnie przesunięcie wyszło +0,1 pkt). Muse Spark trafił do testu kilka godzin później, więc sędziowie ocenili go w osobnej puli z tymi samymi kotwicami. Tam kotwice różniły się od pierwszej rundy o 1,0-1,7 pkt, kolejność znów została ta sama, a przesunięcie skali wyszło -0,15 pkt.
| Model | Wynik | Sędziowie (1-10) | Reguły | Korekta trudna | Quiz trudny | Koszt 13 zadań | Czas 9 zadań |
|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 (kotwica) | 91,2 | 9,15 | 25/26 | 30/30 | 48/48 | 0,3716 USD (1,43 zł) | 133 s |
| GPT-6 Luna (kotwica) | 81,5 | 8,02 | 24/26 | 29/30 | 48/48 | 0,0041 USD (0,02 zł) | 39 s |
| Qwen3.8 Max | 76,4 (68,2*) | 7,75 | 26/26 | 30/30 | 48/48 | 0,2357 USD (0,91 zł) | 572 s |
| MiMo-V2.6-Pro | 69,1 | 7,12 | 25/26 | 27/30 | 0/48 (pusta) | 0,0308 USD (0,12 zł) | 401 s |
| GLM-5.3 (routing OpenRoutera) | 63,6 | 6,36 | 23/26 | 26/30 | 46/48 | 0,0304 USD (0,12 zł) | 27 s |
| GLM-5.3 (tylko Z.ai) | 61,8 | 6,20 | 24/26 | 26/30 | 47/48 | 0,0322 USD (0,12 zł) | 83 s |
| Muse Spark 1.3** | 75,5 | 6,78 | 25/26 | 29/30 | 48/48 | 0,1012 USD (0,39 zł) | 135 s |
* przy równych limitach tokenów, wyjaśnienie niżej. Koszt Qwena nie obejmuje pustej pierwszej próby z 26 września (0,0366 USD).
** oceniony w osobnej puli z tymi samymi kotwicami (Opus 5.5 - 91,8, Luna - 81,8, Qwen - 77,5, GLM-5.3 - 62,7). Po kalibracji do skali pierwszej rundy: 75,3 pkt.
W tabeli rankingu 16 modeli Muse Spark (75,3 po kalibracji) zająłby 11. miejsce, tuż za Qwenem (75,9) i przed DeepSeek V4 Pro (74,1). MiMo z wynikiem 69,1 wylądowałby na 14. miejscu, między Claude Sonnet 5 (71,9) a Mistral Medium 3.5 (68,0). Qwen jest tam dziesiąty, GLM przedostatni.
Poprawka do wyniku Qwena. W pierwszej rundzie (26 września) Qwen przy opisie produktu myślał do limitu 6000 tokenów i oddał pustą odpowiedź. Powtórzyłem wtedy próbę z wyższym limitem i to ją ocenili sędziowie - model zużył 14 460 tokenów na myślenie nad krótkim opisem produktu. Inne modele takiej drugiej szansy nie dostały, więc to był mój błąd metody. Jeśli policzyć to zadanie jako niezaliczone (średnia sędziów 1, reguły 0 z 3), Qwen ma 68,2 pkt, czyli prawie tyle co MiMo (69,1) i wyraźnie mniej niż Muse Spark (75,5). W tej rundzie niczego już nie powtarzałem z wyższym limitem. Pusty quiz MiMo nie wchodzi do wyniku pisania, bo liczą się w nim tylko zadania T1-T9.
Co wyszło w odpowiedziach
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Qwen3.8 Max jako jedyny z czwórki spełnił wszystkie 26 reguł z poleceń i bezbłędnie poprawił trudną korektę. Najwyżej sędziowie ocenili tekst o inflacji dla dziecka (8,89), opowiadanie (8,56) i tytuły SEO (8,56). Najsłabsze było streszczenie (6,22): „termin wdrożenia nie ustalono” zamiast „terminu” i pominięte szkolenia. W przekładzie idiomy wyszły dobrze („kubeł zimnej wody”, „szczęście w nieszczęściu”), ale obok zostały „onboardowanie” i „follow-up”.
Muse Spark 1.3 ma najbardziej nierówne wyniki. Przekład z idiomami dostał 8,67 („to nie fizyka kwantowa”, „zimny prysznic”), post na LinkedIn 8,56, ale opis produktu tylko 3,44, bo model dopchnął akapit do wymaganej długości, powtarzając całą specyfikację drugi raz. W artykule dopisał „(to przykład)” 20 razy i wstawił turecko-polskie „nie gerçekowa cena rynkowa”. Średnia sędziów (6,78) i naturalność (5,63) są u niego niższe niż u MiMo i Qwena, a wysoki wynik zawdzięcza regułom (25 z 26) i higienie tekstu: 3 długie pauzy na 1000 słów, najmniej w stawce, i zero waty. Poza pisaniem prawie bezbłędny: trudna korekta 29 z 30, oba quizy w całości.
MiMo-V2.6-Pro napisał najlepsze streszczenie w całej puli (9,44, wyżej niż Opus 5.5 z 9,33) i bezbłędną łatwą korektę. Za to opowiadanie dostało 5,0 przez błędy w rodzaju „Pachniało je zawsze wieczorem” i „zmoczne”, a w poście na LinkedIn pojawiło się niezrozumiałe „Nie kubki. Dla nich.”. Na 1000 słów wstawił 24,6 długiej pauzy, przy 5,1 u Opusa.
GLM-5.3 w obu przebiegach zrobił najwięcej błędów fleksyjnych i literówek: „w ramach przeprosiny” pojawiło się w obu wersjach maila. W wersji z routingiem OpenRoutera przekład dostał 3,0 („trzymaliśmy się po dachu”, „kwartalele”), a w wersji u Z.ai 8,78. W opowiadaniu z Z.ai sędziowie wyliczyli „wypłynął z niej koperta” i „sernak”. Pojedyncza próba na zadanie oznacza więc duży rozrzut, ale średnio obie wersje wypadły podobnie.
Puste odpowiedzi i myślenie po polsku
We wcześniejszym teście chińskich modeli po polsku MiMo-V2.6-Pro pięć razy myślał do końca limitu i nie oddał tekstu. Tym razem, z tym samym ustawieniem effort=low co u innych modeli, oddał 12 z 13 odpowiedzi, bo polecenia w Laboratorium są krótsze (teksty do 500 słów). Jedyna pusta to trudny quiz: 9000 tokenów myślenia, 613 sekund, zero tekstu. Nie podnosiłem limitu tylko dla niego, bo wtedy dostałby lepsze warunki niż reszta - quiz liczę jako niezaliczony. Myślenie zjadło 85% wszystkich tokenów, które MiMo wygenerował w teście (28,5 tys. z 33,6 tys.).
Sprawdziłem też, czy problem z długim tekstem zniknął. 27 września puściłem jeszcze raz tamto polecenie na 900 słów, z effort=low: 9000 tokenów myślenia, 204 sekundy, pusta odpowiedź, 0,0079 USD. Nic się nie zmieniło.
Qwen3.8 Max też dużo myśli: 33 tys. tokenów myślenia w 13 zadaniach i prawie 10 minut na 9 zadań pisarskich. Muse Spark przy effort=low też myśli sporo (17,2 tys. tokenów, 76% wyjścia), więc mimo 214-252 tokenów na sekundę w pomiarach AA 9 zadań pisarskich zajęło mu 135 sekund, prawie tyle co Opusowi 5.5. GLM-5.3 przy effort=low prawie nie myśli (211 tokenów w całym teście), dlatego jest najszybszy.
Ceny za milion tokenów
Ceny producentów bez VAT, sprawdzone 27 września 2026, przeliczone po kursie NBP 3,857 zł za dolara.
| Model | Wejście USD | Wyjście USD | Wejście zł | Wyjście zł | Gdzie ta cena |
|---|---|---|---|---|---|
| Muse Spark 1.3 | 1,25 | 4,25 | 4,82 | 16,39 | Meta Model API, OpenRouter |
| MiMo-V2.6-Pro | 0,435 | 0,87 | 1,68 | 3,36 | mimo.mi.com, OpenRouter |
| Qwen3.8 Max (0902) | 2,00 | 6,00 | 7,71 | 23,14 | Alibaba Cloud (Singapur), OpenRouter |
| GLM-5.3 | 1,40 | 4,40 | 5,40 | 16,97 | Z.ai; na OpenRouterze od 0,30 / 1,14 USD u innych dostawców |
| Claude Opus 5.5 | 4,00 | 20,00 | 15,43 | 77,14 | OpenRouter |
| GPT-6 Luna | 0,10 | 0,50 | 0,39 | 1,93 | OpenRouter |
Obie rundy kosztowały mnie 3,26 USD (12,57 zł): runda z MiMo i GLM - 1,66 USD (0,07 USD odpowiedzi modeli i kontroli, 1,59 USD sędziowie), runda z Muse Sparkiem - 1,60 USD (0,10 USD odpowiedzi, 1,50 USD sędziowie). Odpowiedzi kotwic pochodzą z pierwszej rundy, więc płaciłem tylko za ich ponowną ocenę.
Jak z nich skorzystać w Polsce
- Muse Spark 1.3 - Meta Model API jest w publicznym podglądzie z „rozszerzonym dostępem globalnym”, ale Meta nie publikuje listy krajów, a we wrześniu użytkownicy z Europy zgłaszali komunikat o niedostępności w regionie. Na OpenRouterze model jest dostępny po potwierdzeniu wieku 18+ w ustawieniach konta. Aplikacja Muse (osobisty agent) działa tylko w USA. Więcej w tekście o Muse Spark 1.3.
- MiMo-V2.6-Pro - API na mimo.mi.com, darmowy czat MiMo Studio według FAQ Xiaomi, trzech dostawców na OpenRouterze, wagi na Hugging Face na licencji MIT. Czatu z Polski nie sprawdzałem.
- Qwen3.8 Max - Alibaba Cloud Model Studio w wersji międzynarodowej i OpenRouter (tylko Alibaba jako dostawca). Czy wersja 0902 jest do wybrania w darmowym Qwen Chat, nie udało mi się potwierdzić.
- GLM-5.3 - API Z.ai, abonament GLM Coding Plan od 18 USD miesięcznie, ponad 30 dostawców na OpenRouterze. Czat na chat.z.ai działa według strony na GLM-5.3-Flash, nie na pełnym modelu.
Wszystkie cztery (poza aplikacjami Mety) najprościej wypróbować przez jedno konto na OpenRouterze, tak jak robiłem ten test. Przy Muse Sparku trzeba najpierw potwierdzić wiek w ustawieniach konta - bez tego OpenRouter zwraca błąd 403.
Najczęstsze pytania
Który z tych modeli najlepiej pisze po polsku?
W moim teście Qwen3.8 Max: 76,4 pkt na 100, tuż przed Muse Sparkiem 1.3 (75,5). Przy równych limitach tokenów Qwen ma 68,2 pkt i spada za Muse i MiMo-V2.6-Pro (69,1). Wszystkie przegrywają z GPT-6 Luną (81,5), która kosztuje ułamek ich ceny.
Czy MiMo-V2.6-Pro nadal zawiesza się przy polskich tekstach?
Przy krótszych poleceniach rzadko: z effort=low oddał 12 z 13 odpowiedzi, pusty był tylko trudny quiz. Przy tekście na 900 słów nadal myśli do limitu 9000 tokenów i nie oddaje nic.
Czy Muse Spark 1.3 jest dostępny w Polsce?
Przez OpenRouter tak, po potwierdzeniu wieku 18+ w ustawieniach konta - bez tego dostałem błąd 403, po potwierdzeniu test przeszedł bez problemów. Dostępu do Meta Model API z Polski Meta oficjalnie nie potwierdza, a aplikacja Muse działa tylko w USA.
Dlaczego wynik w benchmarkach różni się od mojego testu?
Indeks Artificial Analysis mierzy zadania agentowe, programowanie i wiedzę, głównie po angielsku, przy maksymalnym rozumowaniu. Mój test sprawdza pisanie po polsku przy effort=low.
Który jest najtańszy?
MiMo-V2.6-Pro: 0,435 USD za milion tokenów wejścia i 0,87 USD wyjścia. Mój test 13 zadań kosztował w nim 0,03 USD.
Źródła i data sprawdzenia
Indeks, prędkość i koszt zadania: ranking Artificial Analysis, strony modeli Muse Spark 1.3, MiMo-V2.6-Pro, Qwen3.8 Max, GLM-5.3 i metodologia indeksu. Ceny: Meta, Xiaomi, Alibaba Cloud, Z.ai oraz lista modeli OpenRoutera. Dostęp: Meta Model API, GLM Coding Plan. Wyniki testu to moje pomiary przez OpenRouter, koszt z pola rozliczeniowego odpowiedzi; metoda jak w Laboratorium Promptowego. Sprawdzone 27 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →