Benchmark wars: gdy chiński model ogłasza zwycięstwo nad GPT, a my musimy mu uwierzyć na słowo
Qwen3.8-Max pojawił się z twierdzeniem, że przewyższa GPT-5.6 Sol Max i Fable 5 w agentic computer use - i to zdanie mówi więcej o kondycji branży niż o samym modelu.

👁 133 przeczytań
Aktualizacja 18.09.2026: przy nazwach produktów i modeli, które od publikacji zmieniły nazwę lub zostały wycofane, dopisałem w nawiasach aktualny stan i link do bieżącego przewodnika. Resztę tekstu zostawiam z dnia publikacji.
Model ogłasza zwycięstwo. Prasa branżowa podaje dalej. Czytelnicy dzielą się postem. I nikt tak naprawdę nie sprawdził, czy to prawda.
Qwen3.8-Max - nowy model z chińskiego ekosystemu Alibaba/Qwen - przyszedł na świat z twierdzeniem, które natychmiast przykuwa uwagę: przewyższa GPT-5.6 Sol Max i Fable 5 w dziedzinie agentic computer use, czyli w autonomicznym sterowaniu komputerem przez AI. To nie jest skromna deklaracja. To jest wyzwanie rzucone wprost w twarz OpenAI i każdemu, kto uważa, że zachodnie modele wciąż dyktują warunki.

Problem w tym, że ta branża nauczyła nas już, żeby takie słowa przyjmować z chłodną głową.
Benchmark jako broń marketingowa
W świecie dużych modeli językowych benchmark stał się tym, czym kiedyś był „nagrodzony przez krytyków” na okładce książki - cytatem wyrwanym z kontekstu, wybranym tak, żeby sprzedawał. Każdy nowy model jest najlepszy w czymś. Wystarczy dobrać odpowiedni test, odpowiednią wersję rywala, odpowiedni moment pomiaru. Qwen2.5 był najlepszy w kodowaniu. Deepseek-R1 był najlepszy w rozumowaniu. Llama 4 była najlepsza w multimodalności - przynajmniej przez kilka tygodni, zanim okazało się, że wyniki były mierzone na zbiorze danych, który prawdopodobnie wyciekł do treningu.
To nie jest zarzut pod adresem Qwen3.8-Max w szczególności. To diagnoza całego ekosystemu.
Agentic computer use - zdolność modelu do samodzielnego obsługi interfejsów, klikania, wypełniania formularzy, wykonywania sekwencji zadań na prawdziwym komputerze - to jeden z najbardziej pożądanych obszarów frontier AI w 2025 roku. OpenAI wypuściło Operatora, Anthropic ma Computer Use, Google testuje własne rozwiązania. Kto wygra ten wyścig, dostanie klucze do automatyzacji całych warstw pracy biurowej. Stawki są realne.
Dlaczego Chiny są tu groźne - i dlaczego to ważne
Byłoby błędem zbagatelizować Qwen3.8-Max tylko dlatego, że debiut był efekciarski. Seria Qwen od Alibaby to jeden z najpoważniejszych projektów open-source w AI - modele z tej rodziny regularnie trafiają na Hugging Face Open LLM Leaderboard jako topowe alternatywy dla zamkniętych gigantów. Qwen2.5-Coder naprawdę był konkurencyjny z GPT-4o (model wycofany z ChatGPT; aktualne: GPT-6 Astra) w zadaniach programistycznych. To nie jest firma, która tylko mówi - to firma, która dowozi.
Problem nie leży w tym, czy model jest dobry. Problem leży w tym, jak branża komunikuje „dobry”. „Outperforms GPT-5.6 Sol Max and Fable 5″ to zdanie, które zakłada, że czytelnik wie, czym jest GPT-5.6 Sol Max. Ja nie wiem. Większość specjalistów nie wie. To może być wewnętrzna wersja, wariant fine-tunowany, snapshot z konkretnego dnia - albo po prostu marketingowe skrojenie benchmarku pod wynik, który chcemy pokazać.
Co naprawdę testuje agentic computer use
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Uczciwe testy agentów komputerowych są koszmarem metodologicznym. Agent musi działać w realnym środowisku - z prawdziwymi stronami www, które się zmieniają, z aplikacjami, które mają bugi, z interfejsami projektowanymi przez ludzi dla ludzi. ScreenSpot, OSWorld, WebArena - to benchmarki, które próbują uchwycić tę złożoność, ale każdy z nich jest tylko przybliżeniem. Wynik 60% na OSWorld nie znaczy, że agent wykona 60% zadań w twoim biurze. Może znaczyć, że był dobry na zestawie 369 scenariuszy zebranych w 2023 roku przez grupę badaczy z konkretnym zestawem aplikacji.
A mimo to liczby żyją własnym życiem. „Outperforms GPT” trafia w nagłówek, a metodologia zostaje w przypisach - jeśli w ogóle jest publicznie dostępna.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Dlaczego mimo wszystko warto śledzić Qwen3.8-Max
Tu jest paradoks: nawet jeśli twierdzenia o „zwycięstwie” są przesadzone lub nieweryfikowalne w tej chwili, sam fakt, że chiński ekosystem open-source dostarcza modele walczące na tym poziomie, jest informacją o realnej sile.
Jeszcze dwa lata temu rozmowa o chińskich modelach AI wyglądała inaczej - jako ciekawostka, nie jako rywalizacja. Dziś Qwen, Deepseek i ich następcy są częścią poważnych stosów technologicznych w firmach na całym świecie, w tym w Polsce. Wybór między GPT-4o a Qwen2.5 to dla wielu zespołów wybór realny, nie akademicki.
Dlatego Qwen3.8-Max warto zainstalować, przetestować i ocenić - nie na podstawie tego, co twierdzi jego twórca, ale na podstawie własnych zadań. Benchmark wars to sport dla mediów. Rzeczywistość weryfikuje się w produkcji.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


