✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Mniej znane modele AI: MiMo, Qwen3.8 Max, GLM-5.3 i Muse Spark

Cztery modele tuż za Claude’em i GPT-6 w rankingu Artificial Analysis. W moim teście po polsku dzieli je 13 punktów, a najtańszy kosztował 0,03 USD.

9 min czytania
Mniej znane modele AI: MiMo, Qwen3.8 Max, GLM-5.3 i Muse Spark

👁 115 przeczytań

Mniej znane modele AI z czołówki to cztery nazwy, które w rankingu Artificial Analysis stoją tuż za modelami Anthropic i OpenAI, obok Groka 4.7: Muse Spark 1.3 od Mety, MiMo-V2.6-Pro od Xiaomi, Qwen3.8 Max od Alibaby i GLM-5.3 od Z.ai. Mają od 45 do 48 punktów w indeksie inteligencji, a za token wyjścia kosztują od 3 do 23 razy mniej niż Claude Opus 5.5. Wszystkie cztery przepuściłem przez moje Laboratorium: te same 13 zadań po polsku i ta sama ocena w ciemno co w rankingu 16 modeli.

W skrócie

Do pisania po polsku najlepiej wypadł Qwen3.8 Max: 76,4 pkt na 100, przy 91,2 pkt Claude Opus 5.5 i 81,5 pkt GPT-6 Luny w tej samej rundzie. Z zastrzeżeniem: jedną z jego odpowiedzi oceniłem z drugiej próby z wyższym limitem, a przy równych limitach miałby 68,2 pkt. Tuż za Qwenem jest Muse Spark 1.3 od Mety: 75,5 pkt za 0,10 USD, bez ani jednej pustej odpowiedzi, choć wynik podnosi mu głównie czysta typografia, a sędziowie ocenili jego teksty najsłabiej pod względem naturalności. MiMo-V2.6-Pro zdobył 69,1 pkt za 0,03 USD (13 zadań), ale w trudnym quizie myślał do końca limitu i nie oddał odpowiedzi. GLM-5.3 zamknął stawkę z wynikiem 63,6 pkt, a powtórka tylko u producenta (Z.ai, bez tańszych dostawców) dała 61,8 pkt, więc to nie wina kwantyzacji. Wysoki wynik w benchmarkach Artificial Analysis nie przekłada się na polszczyznę: tam wszystkie cztery są blisko siebie (45-48 pkt), u mnie dzieli je 13 punktów, a Muse Spark z najwyższym indeksem jest dopiero drugi. Jeśli piszesz po polsku przez API i szukasz czegoś taniego, GPT-6 Luna daje więcej za mniej. To moja opinia.

76,4pkt Qwen3.8 Max, najlepszy z czwórki po polsku
75,5pkt Muse Spark 1.3, drugi w moim teście
0,03 USDkoszt 13 zadań w MiMo-V2.6-Pro
3,26 USDkoszt obu rund z sędziami

Kim są i gdzie stoją w rankingu

Artificial Analysis liczy swój indeks (wersja 4.3.2) z 10 testów: zadań agentowych, programowania, rozumowania naukowego i wiedzy ogólnej. Poniżej wartości odczytane 27 września 2026. Koszt zadania to średni koszt jednego zadania z indeksu według tej samej strony, a nie koszt mojego testu.

ModelFirmaIndeks AATokeny/sKoszt zadania AAWagi
Claude Opus 5.5 (max)Anthropic58-5,98 USDzamknięte
Muse Spark 1.3 (max)Meta482141,60 USDzamknięte
MiMo-V2.6-ProXiaomi46440,13 USDotwarte, MIT
Muse Spark 1.3 (xhigh)Meta452521,37 USDzamknięte
Qwen3.8 Max (0902)Alibaba45395,41 USDzamknięte
GLM-5.3 (max)Z.ai45842,01 USDotwarte, licencja GLM-5.3
GPT-6 Luna (max)OpenAI371630,07 USDzamknięte

Z tej tabeli wynikają trzy rzeczy. Muse Spark jest najszybszy w czołówce - 214-252 tokenów na sekundę, czyli ponad dwa razy szybciej niż Opus 5.5 w wariancie xhigh (89). MiMo-V2.6-Pro robi zadanie z indeksu za 0,13 USD, 46 razy taniej niż Opus w wariancie max. Qwen to przeciwny biegun: kosztuje 5,41 USD za zadanie, bo przy indeksie wygenerował 190 mln tokenów.

Mój test po polsku: wyniki

Każdy model dostał przez OpenRouter te same 13 poleceń co w rankingu AI do pisania po polsku: 9 zadań pisarskich (artykuł, opis produktu, mail, post, opowiadanie, tytuły, streszczenie, tłumaczenie, tekst dla dziecka), dwie korekty i dwa quizy o Polsce. Ustawienia jak u wszystkich: effort=low, domyślna temperatura, te same limity tokenów. Odpowiedzi ocenili w ciemno trzej sędziowie z różnych firm (Claude Opus 5.5, GPT-6 Sol, Gemini 3.1 Pro), a sędzia z tej samej firmy co oceniany model był pomijany. Wynik to 70% ocen sędziów, 20% reguł z polecenia i 10% higieny tekstu (długie pauzy, wata).

Do puli dołożyłem cztery kotwice z pierwszej rundy: Claude Opus 5.5, GPT-6 Luna, Qwen3.8 Max i GLM-5.3. Ich wyniki różniły się od tamtych o 0,5-1,3 pkt, a kolejność się nie zmieniła, więc skala jest porównywalna (średnie przesunięcie wyszło +0,1 pkt). Muse Spark trafił do testu kilka godzin później, więc sędziowie ocenili go w osobnej puli z tymi samymi kotwicami. Tam kotwice różniły się od pierwszej rundy o 1,0-1,7 pkt, kolejność znów została ta sama, a przesunięcie skali wyszło -0,15 pkt.

ModelWynikSędziowie (1-10)RegułyKorekta trudnaQuiz trudnyKoszt 13 zadańCzas 9 zadań
Claude Opus 5.5 (kotwica)91,29,1525/2630/3048/480,3716 USD (1,43 zł)133 s
GPT-6 Luna (kotwica)81,58,0224/2629/3048/480,0041 USD (0,02 zł)39 s
Qwen3.8 Max76,4 (68,2*)7,7526/2630/3048/480,2357 USD (0,91 zł)572 s
MiMo-V2.6-Pro69,17,1225/2627/300/48 (pusta)0,0308 USD (0,12 zł)401 s
GLM-5.3 (routing OpenRoutera)63,66,3623/2626/3046/480,0304 USD (0,12 zł)27 s
GLM-5.3 (tylko Z.ai)61,86,2024/2626/3047/480,0322 USD (0,12 zł)83 s
Muse Spark 1.3**75,56,7825/2629/3048/480,1012 USD (0,39 zł)135 s
Wynik pisania po polsku (0-100), runda 27.09.2026
Claude Opus 5.591,2
GPT-6 Luna81,5
Qwen3.8 Max76,4
Muse Spark 1.375,5
MiMo-V2.6-Pro69,1
GLM-5.363,6
GLM-5.3 (Z.ai)61,8

* przy równych limitach tokenów, wyjaśnienie niżej. Koszt Qwena nie obejmuje pustej pierwszej próby z 26 września (0,0366 USD).
** oceniony w osobnej puli z tymi samymi kotwicami (Opus 5.5 - 91,8, Luna - 81,8, Qwen - 77,5, GLM-5.3 - 62,7). Po kalibracji do skali pierwszej rundy: 75,3 pkt.

W tabeli rankingu 16 modeli Muse Spark (75,3 po kalibracji) zająłby 11. miejsce, tuż za Qwenem (75,9) i przed DeepSeek V4 Pro (74,1). MiMo z wynikiem 69,1 wylądowałby na 14. miejscu, między Claude Sonnet 5 (71,9) a Mistral Medium 3.5 (68,0). Qwen jest tam dziesiąty, GLM przedostatni.

Poprawka do wyniku Qwena. W pierwszej rundzie (26 września) Qwen przy opisie produktu myślał do limitu 6000 tokenów i oddał pustą odpowiedź. Powtórzyłem wtedy próbę z wyższym limitem i to ją ocenili sędziowie - model zużył 14 460 tokenów na myślenie nad krótkim opisem produktu. Inne modele takiej drugiej szansy nie dostały, więc to był mój błąd metody. Jeśli policzyć to zadanie jako niezaliczone (średnia sędziów 1, reguły 0 z 3), Qwen ma 68,2 pkt, czyli prawie tyle co MiMo (69,1) i wyraźnie mniej niż Muse Spark (75,5). W tej rundzie niczego już nie powtarzałem z wyższym limitem. Pusty quiz MiMo nie wchodzi do wyniku pisania, bo liczą się w nim tylko zadania T1-T9.

Co wyszło w odpowiedziach

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Qwen3.8 Max jako jedyny z czwórki spełnił wszystkie 26 reguł z poleceń i bezbłędnie poprawił trudną korektę. Najwyżej sędziowie ocenili tekst o inflacji dla dziecka (8,89), opowiadanie (8,56) i tytuły SEO (8,56). Najsłabsze było streszczenie (6,22): „termin wdrożenia nie ustalono” zamiast „terminu” i pominięte szkolenia. W przekładzie idiomy wyszły dobrze („kubeł zimnej wody”, „szczęście w nieszczęściu”), ale obok zostały „onboardowanie” i „follow-up”.

Muse Spark 1.3 ma najbardziej nierówne wyniki. Przekład z idiomami dostał 8,67 („to nie fizyka kwantowa”, „zimny prysznic”), post na LinkedIn 8,56, ale opis produktu tylko 3,44, bo model dopchnął akapit do wymaganej długości, powtarzając całą specyfikację drugi raz. W artykule dopisał „(to przykład)” 20 razy i wstawił turecko-polskie „nie gerçekowa cena rynkowa”. Średnia sędziów (6,78) i naturalność (5,63) są u niego niższe niż u MiMo i Qwena, a wysoki wynik zawdzięcza regułom (25 z 26) i higienie tekstu: 3 długie pauzy na 1000 słów, najmniej w stawce, i zero waty. Poza pisaniem prawie bezbłędny: trudna korekta 29 z 30, oba quizy w całości.

MiMo-V2.6-Pro napisał najlepsze streszczenie w całej puli (9,44, wyżej niż Opus 5.5 z 9,33) i bezbłędną łatwą korektę. Za to opowiadanie dostało 5,0 przez błędy w rodzaju „Pachniało je zawsze wieczorem” i „zmoczne”, a w poście na LinkedIn pojawiło się niezrozumiałe „Nie kubki. Dla nich.”. Na 1000 słów wstawił 24,6 długiej pauzy, przy 5,1 u Opusa.

GLM-5.3 w obu przebiegach zrobił najwięcej błędów fleksyjnych i literówek: „w ramach przeprosiny” pojawiło się w obu wersjach maila. W wersji z routingiem OpenRoutera przekład dostał 3,0 („trzymaliśmy się po dachu”, „kwartalele”), a w wersji u Z.ai 8,78. W opowiadaniu z Z.ai sędziowie wyliczyli „wypłynął z niej koperta” i „sernak”. Pojedyncza próba na zadanie oznacza więc duży rozrzut, ale średnio obie wersje wypadły podobnie.

Puste odpowiedzi i myślenie po polsku

We wcześniejszym teście chińskich modeli po polsku MiMo-V2.6-Pro pięć razy myślał do końca limitu i nie oddał tekstu. Tym razem, z tym samym ustawieniem effort=low co u innych modeli, oddał 12 z 13 odpowiedzi, bo polecenia w Laboratorium są krótsze (teksty do 500 słów). Jedyna pusta to trudny quiz: 9000 tokenów myślenia, 613 sekund, zero tekstu. Nie podnosiłem limitu tylko dla niego, bo wtedy dostałby lepsze warunki niż reszta - quiz liczę jako niezaliczony. Myślenie zjadło 85% wszystkich tokenów, które MiMo wygenerował w teście (28,5 tys. z 33,6 tys.).

Sprawdziłem też, czy problem z długim tekstem zniknął. 27 września puściłem jeszcze raz tamto polecenie na 900 słów, z effort=low: 9000 tokenów myślenia, 204 sekundy, pusta odpowiedź, 0,0079 USD. Nic się nie zmieniło.

Qwen3.8 Max też dużo myśli: 33 tys. tokenów myślenia w 13 zadaniach i prawie 10 minut na 9 zadań pisarskich. Muse Spark przy effort=low też myśli sporo (17,2 tys. tokenów, 76% wyjścia), więc mimo 214-252 tokenów na sekundę w pomiarach AA 9 zadań pisarskich zajęło mu 135 sekund, prawie tyle co Opusowi 5.5. GLM-5.3 przy effort=low prawie nie myśli (211 tokenów w całym teście), dlatego jest najszybszy.

Ceny za milion tokenów

Ceny producentów bez VAT, sprawdzone 27 września 2026, przeliczone po kursie NBP 3,857 zł za dolara.

ModelWejście USDWyjście USDWejście złWyjście złGdzie ta cena
Muse Spark 1.31,254,254,8216,39Meta Model API, OpenRouter
MiMo-V2.6-Pro0,4350,871,683,36mimo.mi.com, OpenRouter
Qwen3.8 Max (0902)2,006,007,7123,14Alibaba Cloud (Singapur), OpenRouter
GLM-5.31,404,405,4016,97Z.ai; na OpenRouterze od 0,30 / 1,14 USD u innych dostawców
Claude Opus 5.54,0020,0015,4377,14OpenRouter
GPT-6 Luna0,100,500,391,93OpenRouter

Obie rundy kosztowały mnie 3,26 USD (12,57 zł): runda z MiMo i GLM - 1,66 USD (0,07 USD odpowiedzi modeli i kontroli, 1,59 USD sędziowie), runda z Muse Sparkiem - 1,60 USD (0,10 USD odpowiedzi, 1,50 USD sędziowie). Odpowiedzi kotwic pochodzą z pierwszej rundy, więc płaciłem tylko za ich ponowną ocenę.

Jak z nich skorzystać w Polsce

  • Muse Spark 1.3 - Meta Model API jest w publicznym podglądzie z „rozszerzonym dostępem globalnym”, ale Meta nie publikuje listy krajów, a we wrześniu użytkownicy z Europy zgłaszali komunikat o niedostępności w regionie. Na OpenRouterze model jest dostępny po potwierdzeniu wieku 18+ w ustawieniach konta. Aplikacja Muse (osobisty agent) działa tylko w USA. Więcej w tekście o Muse Spark 1.3.
  • MiMo-V2.6-Pro - API na mimo.mi.com, darmowy czat MiMo Studio według FAQ Xiaomi, trzech dostawców na OpenRouterze, wagi na Hugging Face na licencji MIT. Czatu z Polski nie sprawdzałem.
  • Qwen3.8 Max - Alibaba Cloud Model Studio w wersji międzynarodowej i OpenRouter (tylko Alibaba jako dostawca). Czy wersja 0902 jest do wybrania w darmowym Qwen Chat, nie udało mi się potwierdzić.
  • GLM-5.3 - API Z.ai, abonament GLM Coding Plan od 18 USD miesięcznie, ponad 30 dostawców na OpenRouterze. Czat na chat.z.ai działa według strony na GLM-5.3-Flash, nie na pełnym modelu.

Wszystkie cztery (poza aplikacjami Mety) najprościej wypróbować przez jedno konto na OpenRouterze, tak jak robiłem ten test. Przy Muse Sparku trzeba najpierw potwierdzić wiek w ustawieniach konta - bez tego OpenRouter zwraca błąd 403.

Najczęstsze pytania

Który z tych modeli najlepiej pisze po polsku?

W moim teście Qwen3.8 Max: 76,4 pkt na 100, tuż przed Muse Sparkiem 1.3 (75,5). Przy równych limitach tokenów Qwen ma 68,2 pkt i spada za Muse i MiMo-V2.6-Pro (69,1). Wszystkie przegrywają z GPT-6 Luną (81,5), która kosztuje ułamek ich ceny.

Czy MiMo-V2.6-Pro nadal zawiesza się przy polskich tekstach?

Przy krótszych poleceniach rzadko: z effort=low oddał 12 z 13 odpowiedzi, pusty był tylko trudny quiz. Przy tekście na 900 słów nadal myśli do limitu 9000 tokenów i nie oddaje nic.

Czy Muse Spark 1.3 jest dostępny w Polsce?

Przez OpenRouter tak, po potwierdzeniu wieku 18+ w ustawieniach konta - bez tego dostałem błąd 403, po potwierdzeniu test przeszedł bez problemów. Dostępu do Meta Model API z Polski Meta oficjalnie nie potwierdza, a aplikacja Muse działa tylko w USA.

Dlaczego wynik w benchmarkach różni się od mojego testu?

Indeks Artificial Analysis mierzy zadania agentowe, programowanie i wiedzę, głównie po angielsku, przy maksymalnym rozumowaniu. Mój test sprawdza pisanie po polsku przy effort=low.

Który jest najtańszy?

MiMo-V2.6-Pro: 0,435 USD za milion tokenów wejścia i 0,87 USD wyjścia. Mój test 13 zadań kosztował w nim 0,03 USD.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

Indeks, prędkość i koszt zadania: ranking Artificial Analysis, strony modeli Muse Spark 1.3, MiMo-V2.6-Pro, Qwen3.8 Max, GLM-5.3 i metodologia indeksu. Ceny: Meta, Xiaomi, Alibaba Cloud, Z.ai oraz lista modeli OpenRoutera. Dostęp: Meta Model API, GLM Coding Plan. Wyniki testu to moje pomiary przez OpenRouter, koszt z pola rozliczeniowego odpowiedzi; metoda jak w Laboratorium Promptowego. Sprawdzone 27 września 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro 500 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›