Przejdź do treści
Artykuły

Qwen3.8-Max: wszystko, co dziś wiadomo o największym modelu Alibaby

2,4 biliona parametrów, milion tokenów kontekstu i cena cztery razy niższa od Claude Opus 5. Zebrałem fakty, oddzieliłem je od deklaracji producenta i policzyłem koszty po swojemu.

5 min czytania
Qwen3.8-Max: wszystko, co dziś wiadomo o największym modelu Alibaby

👁 1,137 przeczytań

// w skrócie
  • Qwen3.8-Max to model mixture of experts o 2,4 biliona parametrów łącznie, dostępny od dnia premiery przez QwenCloud w cenie 2 USD za milion tokenów wejścia i 6 USD za milion wyjścia.
  • W niezależnym zestawieniu benchmarków model zajął 31. miejsce spośród 215 modeli z wynikiem 65,4 na 100, wygrywając m.in. w LongBench v2, CharXiv i IFBench, ale przegrywając w SWE-bench Pro (67,7 wobec 80,3 lidera).
  • Dla typowego artykułu o 1500 tokenów wejścia i 2200 tokenów wyjścia koszt wynosi 6 groszy, czyli ok. cztery razy mniej niż Claude Opus 5 i prawie osiem razy mniej niż Claude Fable 5.

Alibaba wypuściła dziś nad ranem Qwen3.8-Max, największy model w swojej historii. Akcje spółki poszły w górę o sześć procent, a branża od kilku godzin przerzuca się wykresami. Przeczytałem materiały premierowe, zestawiłem liczby z trzech niezależnych źródeł i policzyłem koszty po swojemu. Poniżej wszystko, co da się dziś powiedzieć z ręką na sercu, wraz z zaznaczeniem, co jest twardą liczbą, a co deklaracją producenta.

Co to właściwie jest

Qwen3.8-Max to model typu mixture of experts o 2,4 biliona parametrów. Doniesienia mówią o 95 miliardach parametrów aktywnych na zapytanie, ale tu od razu pierwsze zastrzeżenie: część serwisów technicznych zwraca uwagę, że Alibaba nie opublikowała oficjalnie liczby parametrów aktywnych, podobnie jak nie wypuściła pełnej tabeli benchmarków ani licencji. Traktuj więc te 95 miliardów jako liczbę powtarzaną, a nie potwierdzoną.

Mechanizm mixture of experts polega na tym, że model ma ogromną liczbę parametrów, ale przy każdym zapytaniu uruchamia tylko ich ułamek. Dzięki temu można mieć wielkość bez płacenia pełnym kosztem obliczeniowym za każde zdanie. To dlatego model o 2,4 biliona parametrów może kosztować mniej niż dużo mniejsze modele zachodnie.

ParametrWartość
Parametry łącznie2,4 biliona (mixture of experts)
Parametry aktywnepodawane 95 mld, oficjalnie niepotwierdzone
Okno kontekstu1 000 000 tokenów
Maksymalne wejście991 tys. tokenów, przy włączonym rozumowaniu 983 tys.
Maksymalne wyjście131 tys. tokenów
Budżet rozumowaniado 262 tys. tokenów
Wejścietekst, obraz, wideo
Wyjściewyłącznie tekst
Cena2 USD za milion tokenów wejścia, 6 USD za milion wyjścia

Zwróć uwagę na budżet rozumowania: 262 tysiące tokenów to więcej, niż wynosi całe okno kontekstu większości modeli sprzed dwóch lat. Model może przemyśleć problem dłużej, niż niejeden konkurent w ogóle potrafi przeczytać.

Główna obietnica: praca bez człowieka przez wiele dni

Alibaba nie sprzedaje tego modelu jako lepszego czatu. Sprzedaje go jako pracownika, który potrafi ciągnąć zadanie tygodniami. Trzy przykłady z materiałów premierowych:

Dziesięć dni samodzielnego kodowania. Model miał zbudować od pustego katalogu projekt na GitHubie o nazwie oh-my-cli. Sam zakładał sobie zgłoszenia, sam uruchamiał testy i sam scalał własne pull requesty, bez zatwierdzania każdego kroku przez człowieka.

Sto dwadzieścia pięć godzin nad publikacją naukową. Model odtworzył opublikowaną pracę o doborze danych do trenowania modeli językowych, a potem samodzielnie znalazł metodę, która pobiła wynik oryginału o 2,7 punktu na teście matematycznym AIME24.

Zawody z ludźmi. Alibaba wystawiła model w konkursie Tianchi przeciwko 526 zespołom ludzkim i twierdzi, że w ciągu doby wyprzedził 458 z nich.

I teraz rzecz, o której trzeba powiedzieć głośno: wszystkie trzy pochodzą z testów wewnętrznych producenta. Żadna z tych liczb nie została na razie potwierdzona niezależnie. To nie znaczy, że są nieprawdziwe. Znaczy, że jeszcze nie wiemy.

Gdzie jest naprawdę dobry

Niezależne zestawienie benchmarków plasuje Qwen3.8-Max na 31. miejscu spośród 215 modeli z wynikiem ogólnym 65,4 na 100. To nie jest pierwsze miejsce, ale rozkład wyników jest ciekawszy niż sama średnia, bo model jest bardzo nierówny.

Najmocniejsze strony to rozumowanie i praca z obrazem. W teście długiego kontekstu LongBench v2 ma najlepszy zweryfikowany wynik w stawce. W CharXiv 93,5, w MathVision 95,2, w OSWorld-Verified 86,1. W Terminal-Bench 2.1 osiąga 86,6, wyprzedzając Claude Opus 4.8 i Claude Fable 5, które mają po 84,6. W wykonywaniu instrukcji IFBench 82,8 przy 72,7 dla GPT-5.6 Sol i 63,5 dla Fable 5, czyli przewaga naprawdę wyraźna.

Gdzie jest słaby, mimo hasła o biciu wszystkich

Mam to spisane w całości

Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.

Pobierz ebooki

W klasycznych benchmarkach programistycznych model wypada wyraźnie gorzej, niż sugeruje komunikat prasowy. SWE-bench Pro 67,7 przy 80,3 u lidera. deepSwe 56,6 przy 72,7 dla GPT-5.6 Sol. FrontierSWE 73,5 przy 81,2 dla Kimi K3. W teście wiedzy HLE 43,6 przy 64,7 dla Claude Opus 5.

Najdziwniejszy wynik to OSWorld 2.0: 19,4 przy 70,6 dla Claude Opus 5. Przy jednoczesnych 86,1 w OSWorld-Verified. Taki rozjazd między dwiema wersjami tego samego testu zwykle oznacza, że coś w konfiguracji nie zagrało, a nie że model nagle zgłupiał. Ale dopóki nikt tego nie wyjaśni, zostaje w tabeli jako ostrzeżenie.

Zestawiłem to wszystko w osobnym tekście, razem z pełną tabelą wygranych i przegranych, bo różnica między tym, co mówi zapowiedź, a tym, co pokazują liczby, zasługuje na własne miejsce.

Ile kosztuje

Dwa dolary za milion tokenów wejścia i sześć za milion wyjścia. Po kursie 3,7425 zł za dolara, którego używam we wszystkich swoich wyliczeniach, jeden artykuł o wielkości półtora tysiąca tokenów wejścia i 2,2 tysiąca wyjścia kosztuje 6 groszy.

Dla porównania ten sam artykuł na Claude Opus 5 kosztuje 23 grosze, na GPT-5.6 Sol 28 groszy, a na Claude Fable 5 47 groszy. Qwen3.8-Max jest więc mniej więcej cztery razy tańszy od Opusa i prawie osiem razy tańszy od Fable. Rozpisałem to na trzy realne scenariusze pracy w osobnym tekście o kosztach.

Gdzie tego dziś użyć

Model jest dostępny przez QwenCloud od dnia premiery. Do Alibaba Cloud Model Studio ma trafić w przyszłym tygodniu. Wtedy też mają pojawić się otwarte wagi na Hugging Face i ModelScope, a razem z nimi mniejszy Qwen3.8-27B dla tych, którzy nie mają serwerowni.

To ostatnie jest ciekawsze, niż wygląda. Dotąd modele z linii Max były wyłącznie zamknięte, dostępne tylko przez API. Jeżeli Alibaba faktycznie wypuści wagi modelu tej klasy, będzie to pierwszy taki przypadek w tej rodzinie. Piszę „jeżeli”, bo na razie nie ma ani daty, ani licencji, ani repozytorium.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Dla kogo to ma sens

Jeżeli piszesz teksty, analizujesz dokumenty, pracujesz z obrazem albo potrzebujesz modelu, który rzetelnie trzyma się instrukcji, to przy tej cenie jest to jedna z najciekawszych propozycji na rynku. Milion tokenów kontekstu za dwa dolary od wejścia znaczy, że możesz wrzucić mu całą dokumentację projektu i zapłacić 7,49 zł.

Jeżeli natomiast szukasz [zdanie urwane - brak dalszej części] modelu do poważnej pracy z kodem, popatrz najpierw na wyniki SWE-bench Pro i deepSwe, bo tam różnica wobec czołówki jest realna i nie zniknie od tego, że w zapowiedzi napisano coś innego.

Przez najbliższe trzy dni rozbieram ten model na części. Kolejne teksty: pełne benchmarki, koszty w złotówkach na trzech scenariuszach, instrukcja dostępu i zestaw ustawień, które robią największą różnicę w rachunku.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Ile parametrów ma Qwen3.8-Max i ile z nich jest aktywnych przy jednym zapytaniu?

Model ma łącznie 2,4 biliona parametrów w architekturze mixture of experts. Liczba 95 miliardów parametrów aktywnych na zapytanie jest szeroko powtarzana, ale Alibaba nie potwierdziła jej oficjalnie.

Jak Qwen3.8-Max wypada w testach programistycznych w porównaniu do konkurencji?

W SWE-bench Pro model uzyskał 67,7 przy 80,3 u lidera, a w deepSwe 56,6 wobec 72,7 dla GPT-5.6 Sol. Wyniki te są wyraźnie słabsze, niż sugerują materiały prasowe Alibaby.

Kiedy pojawią się otwarte wagi Qwen3.8-Max na Hugging Face?

Alibaba zapowiedziała udostępnienie wag na Hugging Face i ModelScope w przyszłym tygodniu, razem z dostępem przez Alibaba Cloud Model Studio. Na razie nie ma ani konkretnej daty, ani licencji, ani repozytorium.

Jakie jest okno kontekstu Qwen3.8-Max i ile tokenów może model wygenerować na wyjściu?

Okno kontekstu wynosi 1 000 000 tokenów, przy czym maksymalne wejście to 991 tys. tokenów (lub 983 tys. przy włączonym rozumowaniu). Maksymalne wyjście to 131 tys. tokenów, a budżet rozumowania sięga 262 tys. tokenów.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie