Qwen3.8-Max w benchmarkach: gdzie wygrywa, a gdzie wyraźnie przegrywa
Zapowiedź mówi o biciu Fable 5 i GPT-5.6 Sol w siedmiu testach. Pełna tabela pokazuje coś innego: dominację w rozumowaniu i obrazie oraz realną słabość w programowaniu.

👁 237 przeczytań
- Qwen3.8-Max wygrywa w 9 z prezentowanych testów, m.in. w MathVision (95,2) i IFBench (82,8), ale w ogólnym zestawieniu 215 modeli zajmuje dopiero 31. miejsce z wynikiem 65,4/100.
- Największa słabość modelu to realne programowanie w repozytoriach: w deepSwe osiąga 56,6 wobec 72,7 dla GPT-5.6 Sol, a w SWE-bench Pro 67,7 wobec 80,3 dla Claude Mythos 5.
- Alibaba nie opublikowała pełnej tabeli benchmarków z metodologią, a wyniki dotyczące 10 dni samodzielnego kodowania pochodzą wyłącznie z testów wewnętrznych producenta.
Zapowiedź Qwen3.8-Max mówi, że model bije Claude Fable 5 i GPT-5.6 Sol w siedmiu ewaluacjach. To prawda. Problem w tym, że ewaluacji jest znacznie więcej niż siedem, a w kilku pozostałych model przegrywa tak wyraźnie, że warto o tym wiedzieć, zanim przestawi się na niego produkcję. Zebrałem wszystkie wyniki, do których udało mi się dotrzeć, i posortowałem je uczciwie: osobno wygrane, osobno porażki.
Najpierw jedna liczba, która ustawia perspektywę
W niezależnym zestawieniu obejmującym 215 modeli Qwen3.8-Max zajmuje 31. miejsce z wynikiem ogólnym 65,4 na 100. To bardzo dobry wynik, ale nie jest to szczyt tabeli. Model jest przy tym wyjątkowo nierówny: w jednej kategorii jest drugi na świecie, w innej dwudziesty piąty. Średnia zaciera to, co najciekawsze.
Tam, gdzie wygrywa
| Test | Qwen3.8-Max | Najlepszy konkurent | Co mierzy |
|---|---|---|---|
| MathVision | 95,2 | najlepszy wynik w stawce | matematyka z obrazu |
| CharXiv | 93,5 | najlepszy wynik w stawce | czytanie wykresów |
| PaperBench | 93,0 | 90,5 | odtwarzanie prac naukowych |
| Terminal-Bench 2.1 | 86,6 | Opus 4.8 i Fable 5: 84,6 | praca w terminalu |
| OSWorld-Verified | 86,1 | najlepszy wynik w stawce | obsługa systemu operacyjnego |
| IFBench | 82,8 | Sol 72,7 / Fable 63,5 | trzymanie się instrukcji |
| AndroidBench | 75,1 | najlepszy wynik w stawce | sterowanie telefonem |
| CoWorkBench | 74,8 | Sol 71,5 | praca zespołowa agentów |
| LongBench v2 | 66,3 | najlepszy wynik w stawce | długi kontekst |
Dwie rzeczy warto tu zauważyć. Po pierwsze, IFBench. Przewaga 82,8 wobec 63,5 dla Fable 5 to nie jest niuans, tylko przepaść, a chodzi o rzecz najbardziej praktyczną z możliwych: czy model robi to, o co go poprosiłeś, czy to, co uznał za lepsze. Po drugie, cała grupa testów wizualnych. MathVision, CharXiv, AndroidBench. Model naprawdę dobrze czyta obrazy, wykresy i ekrany.
Tam, gdzie przegrywa
| Test | Qwen3.8-Max | Lider | Różnica |
|---|---|---|---|
| OSWorld 2.0 | 19,4 | Claude Opus 5: 70,6 | 51,2 |
| HLE | 43,6 | Claude Opus 5: 64,7 | 21,1 |
| deepSwe | 56,6 | GPT-5.6 Sol: 72,7 | 16,1 |
| SWE-bench Pro | 67,7 | Claude Mythos 5: 80,3 | 12,6 |
| MMMU-Pro | 82,3 | GPT-5.4 Pro: 94,0 | 11,7 |
| FrontierSWE | 73,5 | Kimi K3: 81,2 | 7,7 |
| GPQA Diamond | 92,6 | Sakana Fugu-Ultra: 95,5 | 2,9 |
| MRCRv2 | 92,9 | Sakana Fugu-Ultra: 93,6 | 0,7 |
Popatrz na trzy pozycje ze środka tabeli: deepSwe, SWE-bench Pro i FrontierSWE. To są testy, które sprawdzają realne poprawianie kodu w prawdziwych repozytoriach, a nie rozwiązywanie zadanek. We wszystkich trzech Qwen3.8-Max jest wyraźnie za czołówką. Przy modelu reklamowanym jako narzędzie do wielodniowego samodzielnego programowania to jest napięcie, którego nie da się zbyć.
Wynik, który wygląda na błąd
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
OSWorld 2.0: 19,4 punktu, przy 70,6 dla Claude Opus 5. Ta sama rodzina testów, w której model osiąga 86,1 w wersji Verified i jest w niej najlepszy w stawce.
Różnica 51 punktów między dwiema wersjami tego samego benchmarku prawie nigdy nie oznacza, że model coś potrafi w jednej wersji, a nie potrafi w drugiej. Zwykle oznacza problem z konfiguracją, ze środowiskiem albo z tym, jak model został podpięty do testu. Zostawiam to w tabeli, bo nie moją rolą jest ukrywanie niewygodnych liczb, ale traktowałbym je jako sygnał do sprawdzenia, a nie jako werdykt.
Jak czytać to wszystko razem
Wyłania się z tego dość spójny obraz, tylko inny niż w komunikacie prasowym. Qwen3.8-Max jest bardzo mocny w rozumowaniu, w pracy z obrazem, w długim kontekście i w posłuszeństwie wobec instrukcji. Jest przeciętny w twardym programowaniu i wyraźnie słabszy od czołówki w testach szerokiej wiedzy.
To nie jest model gorszy. To jest model o innym profilu. I dokładnie dlatego zdanie „bije Fable 5 i GPT-5.6 Sol” jest prawdziwe i mylące jednocześnie: prawdziwe w siedmiu testach, mylące jako opis całości.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Czego w tych liczbach nie ma
Trzy zastrzeżenia, które sam sobie stawiam przy każdej takiej tabeli.
Po pierwsze, Alibaba nie opublikowała pełnej tabeli benchmarków. Wyniki krążą po serwisach technicznych, ale bez oficjalnego zestawienia i bez metodologii. To znaczy, że część z nich może pochodzić z różnych konfiguracji.
Po drugie, spektakularne opowieści o dziesięciu dniach samodzielnego kodowania i o pobiciu publikacji naukowej o 2,7 punktu na AIME24 pochodzą wyłącznie z testów wewnętrznych producenta. Nikt ich na razie nie powtórzył.
Po trzecie, żaden benchmark nie mierzy tego, co interesuje Cię najbardziej, czyli czy model poradzi sobie z Twoim zadaniem, w Twoim języku, na Twoich danych. Polskiego nie ma w żadnym z tych testów. Sam sprawdzę to w swoim teście długiego kontekstu po polsku i wrócę z wynikiem, kiedy model trafi do OpenRoutera.
Do tego czasu traktowałbym te tabele tak, jak traktuje się dane katalogowe samochodu. Mówią sporo o tym, czego się spodziewać, i nic o tym, jak się nim jeździ.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Czy Qwen3.8-Max naprawdę bije Claude i GPT w benchmarkach?
Bije je w dokładnie siedmiu ewaluacjach, m.in. w IFBench (82,8 wobec 63,5 dla Fable 5) i MathVision, gdzie osiąga najlepszy wynik w stawce. W kilku innych testach, jak OSWorld 2.0 czy HLE, wyraźnie przegrywa - różnica sięga nawet 51 punktów.
W czym Qwen3.8-Max jest najlepszy spośród testowanych modeli?
Model osiąga najlepsze wyniki w stawce w MathVision (95,2), CharXiv (93,5), OSWorld-Verified (86,1), AndroidBench (75,1) i LongBench v2 (66,3). Szczególnie mocno wypada w rozumowaniu wizualnym i posłuszeństwie wobec instrukcji.
Dlaczego wynik 19,4 w OSWorld 2.0 jest podejrzany, skoro model ma 86,1 w OSWorld-Verified?
Różnica 51 punktów między dwiema wersjami tego samego benchmarku prawie nigdy nie wynika z faktycznej nieumiejętności modelu. Zwykle oznacza problem z konfiguracją, ze środowiskiem albo ze sposobem podpięcia modelu do testu.
Czy Qwen3.8-Max sprawdzi się do programowania w prawdziwych projektach?
W testach mierzących poprawianie kodu w prawdziwych repozytoriach model jest wyraźnie za czołówką: deepSwe 56,6 vs 72,7, SWE-bench Pro 67,7 vs 80,3, FrontierSWE 73,5 vs 81,2. To napięcie istotne przy modelu reklamowanym jako narzędzie do wielodniowego samodzielnego programowania.



