Przejdź do treści
Newsy

Benchmark wars: gdy chiński model ogłasza zwycięstwo nad GPT, a my musimy mu uwierzyć na słowo

Qwen3.8-Max pojawił się z twierdzeniem, że przewyższa GPT-5.6 Sol Max i Fable 5 w agentic computer use - i to zdanie mówi więcej o kondycji branży niż o samym modelu.

4 min czytania
Ostatnia aktualizacja:
Benchmark wars: gdy chiński model ogłasza zwycięstwo nad GPT, a my musimy mu uwierzyć na słowo

👁 133 przeczytań

Aktualizacja 18.09.2026: przy nazwach produktów i modeli, które od publikacji zmieniły nazwę lub zostały wycofane, dopisałem w nawiasach aktualny stan i link do bieżącego przewodnika. Resztę tekstu zostawiam z dnia publikacji.

Model ogłasza zwycięstwo. Prasa branżowa podaje dalej. Czytelnicy dzielą się postem. I nikt tak naprawdę nie sprawdził, czy to prawda.

Qwen3.8-Max - nowy model z chińskiego ekosystemu Alibaba/Qwen - przyszedł na świat z twierdzeniem, które natychmiast przykuwa uwagę: przewyższa GPT-5.6 Sol Max i Fable 5 w dziedzinie agentic computer use, czyli w autonomicznym sterowaniu komputerem przez AI. To nie jest skromna deklaracja. To jest wyzwanie rzucone wprost w twarz OpenAI i każdemu, kto uważa, że zachodnie modele wciąż dyktują warunki.

Alibaba Center in Binjiang Hangzhou2021.jpg
fot. Charlie fong / Wikimedia Commons, CC BY-SA 4.0

Problem w tym, że ta branża nauczyła nas już, żeby takie słowa przyjmować z chłodną głową.

Benchmark jako broń marketingowa

W świecie dużych modeli językowych benchmark stał się tym, czym kiedyś był „nagrodzony przez krytyków” na okładce książki - cytatem wyrwanym z kontekstu, wybranym tak, żeby sprzedawał. Każdy nowy model jest najlepszy w czymś. Wystarczy dobrać odpowiedni test, odpowiednią wersję rywala, odpowiedni moment pomiaru. Qwen2.5 był najlepszy w kodowaniu. Deepseek-R1 był najlepszy w rozumowaniu. Llama 4 była najlepsza w multimodalności - przynajmniej przez kilka tygodni, zanim okazało się, że wyniki były mierzone na zbiorze danych, który prawdopodobnie wyciekł do treningu.

To nie jest zarzut pod adresem Qwen3.8-Max w szczególności. To diagnoza całego ekosystemu.

Agentic computer use - zdolność modelu do samodzielnego obsługi interfejsów, klikania, wypełniania formularzy, wykonywania sekwencji zadań na prawdziwym komputerze - to jeden z najbardziej pożądanych obszarów frontier AI w 2025 roku. OpenAI wypuściło Operatora, Anthropic ma Computer Use, Google testuje własne rozwiązania. Kto wygra ten wyścig, dostanie klucze do automatyzacji całych warstw pracy biurowej. Stawki są realne.

Dlaczego Chiny są tu groźne - i dlaczego to ważne

Byłoby błędem zbagatelizować Qwen3.8-Max tylko dlatego, że debiut był efekciarski. Seria Qwen od Alibaby to jeden z najpoważniejszych projektów open-source w AI - modele z tej rodziny regularnie trafiają na Hugging Face Open LLM Leaderboard jako topowe alternatywy dla zamkniętych gigantów. Qwen2.5-Coder naprawdę był konkurencyjny z GPT-4o (model wycofany z ChatGPT; aktualne: GPT-6 Astra) w zadaniach programistycznych. To nie jest firma, która tylko mówi - to firma, która dowozi.

Problem nie leży w tym, czy model jest dobry. Problem leży w tym, jak branża komunikuje „dobry”. „Outperforms GPT-5.6 Sol Max and Fable 5″ to zdanie, które zakłada, że czytelnik wie, czym jest GPT-5.6 Sol Max. Ja nie wiem. Większość specjalistów nie wie. To może być wewnętrzna wersja, wariant fine-tunowany, snapshot z konkretnego dnia - albo po prostu marketingowe skrojenie benchmarku pod wynik, który chcemy pokazać.

Co naprawdę testuje agentic computer use

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Uczciwe testy agentów komputerowych są koszmarem metodologicznym. Agent musi działać w realnym środowisku - z prawdziwymi stronami www, które się zmieniają, z aplikacjami, które mają bugi, z interfejsami projektowanymi przez ludzi dla ludzi. ScreenSpot, OSWorld, WebArena - to benchmarki, które próbują uchwycić tę złożoność, ale każdy z nich jest tylko przybliżeniem. Wynik 60% na OSWorld nie znaczy, że agent wykona 60% zadań w twoim biurze. Może znaczyć, że był dobry na zestawie 369 scenariuszy zebranych w 2023 roku przez grupę badaczy z konkretnym zestawem aplikacji.

A mimo to liczby żyją własnym życiem. „Outperforms GPT” trafia w nagłówek, a metodologia zostaje w przypisach - jeśli w ogóle jest publicznie dostępna.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Dlaczego mimo wszystko warto śledzić Qwen3.8-Max

Tu jest paradoks: nawet jeśli twierdzenia o „zwycięstwie” są przesadzone lub nieweryfikowalne w tej chwili, sam fakt, że chiński ekosystem open-source dostarcza modele walczące na tym poziomie, jest informacją o realnej sile.

Jeszcze dwa lata temu rozmowa o chińskich modelach AI wyglądała inaczej - jako ciekawostka, nie jako rywalizacja. Dziś Qwen, Deepseek i ich następcy są częścią poważnych stosów technologicznych w firmach na całym świecie, w tym w Polsce. Wybór między GPT-4o a Qwen2.5 to dla wielu zespołów wybór realny, nie akademicki.

Dlatego Qwen3.8-Max warto zainstalować, przetestować i ocenić - nie na podstawie tego, co twierdzi jego twórca, ale na podstawie własnych zadań. Benchmark wars to sport dla mediów. Rzeczywistość weryfikuje się w produkcji.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie