Przejdź do treści
Benchmarki

Qwen3.8-Max w benchmarkach: gdzie wygrywa, a gdzie wyraźnie przegrywa

Zapowiedź mówi o biciu Fable 5 i GPT-5.6 Sol w siedmiu testach. Pełna tabela pokazuje coś innego: dominację w rozumowaniu i obrazie oraz realną słabość w programowaniu.

4 min czytania
Qwen3.8-Max w benchmarkach: gdzie wygrywa, a gdzie wyraźnie przegrywa

👁 237 przeczytań

// w skrócie
  • Qwen3.8-Max wygrywa w 9 z prezentowanych testów, m.in. w MathVision (95,2) i IFBench (82,8), ale w ogólnym zestawieniu 215 modeli zajmuje dopiero 31. miejsce z wynikiem 65,4/100.
  • Największa słabość modelu to realne programowanie w repozytoriach: w deepSwe osiąga 56,6 wobec 72,7 dla GPT-5.6 Sol, a w SWE-bench Pro 67,7 wobec 80,3 dla Claude Mythos 5.
  • Alibaba nie opublikowała pełnej tabeli benchmarków z metodologią, a wyniki dotyczące 10 dni samodzielnego kodowania pochodzą wyłącznie z testów wewnętrznych producenta.

Zapowiedź Qwen3.8-Max mówi, że model bije Claude Fable 5 i GPT-5.6 Sol w siedmiu ewaluacjach. To prawda. Problem w tym, że ewaluacji jest znacznie więcej niż siedem, a w kilku pozostałych model przegrywa tak wyraźnie, że warto o tym wiedzieć, zanim przestawi się na niego produkcję. Zebrałem wszystkie wyniki, do których udało mi się dotrzeć, i posortowałem je uczciwie: osobno wygrane, osobno porażki.

Najpierw jedna liczba, która ustawia perspektywę

W niezależnym zestawieniu obejmującym 215 modeli Qwen3.8-Max zajmuje 31. miejsce z wynikiem ogólnym 65,4 na 100. To bardzo dobry wynik, ale nie jest to szczyt tabeli. Model jest przy tym wyjątkowo nierówny: w jednej kategorii jest drugi na świecie, w innej dwudziesty piąty. Średnia zaciera to, co najciekawsze.

Tam, gdzie wygrywa

TestQwen3.8-MaxNajlepszy konkurentCo mierzy
MathVision95,2najlepszy wynik w stawcematematyka z obrazu
CharXiv93,5najlepszy wynik w stawceczytanie wykresów
PaperBench93,090,5odtwarzanie prac naukowych
Terminal-Bench 2.186,6Opus 4.8 i Fable 5: 84,6praca w terminalu
OSWorld-Verified86,1najlepszy wynik w stawceobsługa systemu operacyjnego
IFBench82,8Sol 72,7 / Fable 63,5trzymanie się instrukcji
AndroidBench75,1najlepszy wynik w stawcesterowanie telefonem
CoWorkBench74,8Sol 71,5praca zespołowa agentów
LongBench v266,3najlepszy wynik w stawcedługi kontekst

Dwie rzeczy warto tu zauważyć. Po pierwsze, IFBench. Przewaga 82,8 wobec 63,5 dla Fable 5 to nie jest niuans, tylko przepaść, a chodzi o rzecz najbardziej praktyczną z możliwych: czy model robi to, o co go poprosiłeś, czy to, co uznał za lepsze. Po drugie, cała grupa testów wizualnych. MathVision, CharXiv, AndroidBench. Model naprawdę dobrze czyta obrazy, wykresy i ekrany.

Tam, gdzie przegrywa

TestQwen3.8-MaxLiderRóżnica
OSWorld 2.019,4Claude Opus 5: 70,651,2
HLE43,6Claude Opus 5: 64,721,1
deepSwe56,6GPT-5.6 Sol: 72,716,1
SWE-bench Pro67,7Claude Mythos 5: 80,312,6
MMMU-Pro82,3GPT-5.4 Pro: 94,011,7
FrontierSWE73,5Kimi K3: 81,27,7
GPQA Diamond92,6Sakana Fugu-Ultra: 95,52,9
MRCRv292,9Sakana Fugu-Ultra: 93,60,7

Popatrz na trzy pozycje ze środka tabeli: deepSwe, SWE-bench Pro i FrontierSWE. To są testy, które sprawdzają realne poprawianie kodu w prawdziwych repozytoriach, a nie rozwiązywanie zadanek. We wszystkich trzech Qwen3.8-Max jest wyraźnie za czołówką. Przy modelu reklamowanym jako narzędzie do wielodniowego samodzielnego programowania to jest napięcie, którego nie da się zbyć.

Wynik, który wygląda na błąd

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

OSWorld 2.0: 19,4 punktu, przy 70,6 dla Claude Opus 5. Ta sama rodzina testów, w której model osiąga 86,1 w wersji Verified i jest w niej najlepszy w stawce.

Różnica 51 punktów między dwiema wersjami tego samego benchmarku prawie nigdy nie oznacza, że model coś potrafi w jednej wersji, a nie potrafi w drugiej. Zwykle oznacza problem z konfiguracją, ze środowiskiem albo z tym, jak model został podpięty do testu. Zostawiam to w tabeli, bo nie moją rolą jest ukrywanie niewygodnych liczb, ale traktowałbym je jako sygnał do sprawdzenia, a nie jako werdykt.

Jak czytać to wszystko razem

Wyłania się z tego dość spójny obraz, tylko inny niż w komunikacie prasowym. Qwen3.8-Max jest bardzo mocny w rozumowaniu, w pracy z obrazem, w długim kontekście i w posłuszeństwie wobec instrukcji. Jest przeciętny w twardym programowaniu i wyraźnie słabszy od czołówki w testach szerokiej wiedzy.

To nie jest model gorszy. To jest model o innym profilu. I dokładnie dlatego zdanie „bije Fable 5 i GPT-5.6 Sol” jest prawdziwe i mylące jednocześnie: prawdziwe w siedmiu testach, mylące jako opis całości.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Czego w tych liczbach nie ma

Trzy zastrzeżenia, które sam sobie stawiam przy każdej takiej tabeli.

Po pierwsze, Alibaba nie opublikowała pełnej tabeli benchmarków. Wyniki krążą po serwisach technicznych, ale bez oficjalnego zestawienia i bez metodologii. To znaczy, że część z nich może pochodzić z różnych konfiguracji.

Po drugie, spektakularne opowieści o dziesięciu dniach samodzielnego kodowania i o pobiciu publikacji naukowej o 2,7 punktu na AIME24 pochodzą wyłącznie z testów wewnętrznych producenta. Nikt ich na razie nie powtórzył.

Po trzecie, żaden benchmark nie mierzy tego, co interesuje Cię najbardziej, czyli czy model poradzi sobie z Twoim zadaniem, w Twoim języku, na Twoich danych. Polskiego nie ma w żadnym z tych testów. Sam sprawdzę to w swoim teście długiego kontekstu po polsku i wrócę z wynikiem, kiedy model trafi do OpenRoutera.

Do tego czasu traktowałbym te tabele tak, jak traktuje się dane katalogowe samochodu. Mówią sporo o tym, czego się spodziewać, i nic o tym, jak się nim jeździ.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Czy Qwen3.8-Max naprawdę bije Claude i GPT w benchmarkach?

Bije je w dokładnie siedmiu ewaluacjach, m.in. w IFBench (82,8 wobec 63,5 dla Fable 5) i MathVision, gdzie osiąga najlepszy wynik w stawce. W kilku innych testach, jak OSWorld 2.0 czy HLE, wyraźnie przegrywa - różnica sięga nawet 51 punktów.

W czym Qwen3.8-Max jest najlepszy spośród testowanych modeli?

Model osiąga najlepsze wyniki w stawce w MathVision (95,2), CharXiv (93,5), OSWorld-Verified (86,1), AndroidBench (75,1) i LongBench v2 (66,3). Szczególnie mocno wypada w rozumowaniu wizualnym i posłuszeństwie wobec instrukcji.

Dlaczego wynik 19,4 w OSWorld 2.0 jest podejrzany, skoro model ma 86,1 w OSWorld-Verified?

Różnica 51 punktów między dwiema wersjami tego samego benchmarku prawie nigdy nie wynika z faktycznej nieumiejętności modelu. Zwykle oznacza problem z konfiguracją, ze środowiskiem albo ze sposobem podpięcia modelu do testu.

Czy Qwen3.8-Max sprawdzi się do programowania w prawdziwych projektach?

W testach mierzących poprawianie kodu w prawdziwych repozytoriach model jest wyraźnie za czołówką: deepSwe 56,6 vs 72,7, SWE-bench Pro 67,7 vs 80,3, FrontierSWE 73,5 vs 81,2. To napięcie istotne przy modelu reklamowanym jako narzędzie do wielodniowego samodzielnego programowania.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka CapCut Pro 460 zł/rok ElevenLabs Creator 352 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie