PROMPTOWY_
Benchmarki

Qwen3.8-Max w benchmarkach: gdzie wygrywa, a gdzie wyraźnie przegrywa

promptowy@ai:~$ cat news_1

Zapowiedź Qwen3.8-Max mówi, że model bije Claude Fable 5 i GPT-5.6 Sol w siedmiu ewaluacjach.

promptowy@ai:~$ cat news_2

Problem w tym, że ewaluacji jest znacznie więcej niż siedem, a w kilku pozostałych model przegrywa tak wyraźnie, że warto o tym wiedzieć, zanim przestawi się na niego produkcję.

promptowy@ai:~$ cat news_3

Zebrałem wszystkie wyniki, do których udało mi się dotrzeć, i posortowałem je uczciwie: osobno wygrane, osobno porażki.

promptowy@ai:~$ cat news_4

Najpierw jedna liczba, która ustawia perspektywę W niezależnym zestawieniu obejmującym 215 modeli Qwen3.8-Max zajmuje 31.

promptowy@ai:~$ open --full
Czytaj całość

Qwen3.8-Max w benchmarkach: gdzie wygrywa, a gdzie wyraźnie przegrywa

Otwórz artykuł na promptowy.com