Przejdź do treści
Premium

Qwen3.8-Max: 9 ustawień, które robią różnicę w rachunku i w jakości

Pamięć jawna tnie koszt agenta trzykrotnie. Rozumowanie włączone bez potrzeby go zwielokrotnia. Dziewięć konkretów, każdy z liczbą albo z powodem.

5 min czytania
A hand moves red knobs on a control panel above a balance scale, tipping the scales toward the left with piles of coins vs a red star on the right pan (illustration of fairness or bias).

👁 177 przeczytań

// w skrócie
  • Qwen3.8-Max wygrywa z GPT-5.6 Sol i Claude Fable 5 w trzymaniu się instrukcji, osiągając 82,8 punktu w teście IFBench wobec 72,7 i 63,5.
  • Włączenie pamięci jawnej obniża koszt odczytu z 2 dolarów do 0,17 dolara za milion tokenów, co zwraca się już przy pierwszym ponownym użyciu.
  • W testach kodu SWE-bench Pro model osiąga 67,7 punktu wobec 80,3 u lidera, więc przy trudnych zadaniach częściej niż czołówka potrzebuje drugiego podejścia.

Cennik i benchmarki mówią, ile model kosztuje i co potrafi. Nie mówią, jak go ustawić, żeby nie przepalać pieniędzy i nie dostawać odpowiedzi obok tematu. Zebrałem dziewięć rzeczy, które przy Qwen3.8-Max robią realną różnicę, każdą z liczbą albo z konkretnym powodem. Kilka z nich wynika wprost z jego profilu, czyli z tego, w czym wygrywa, a w czym przegrywa.

1. Włącz pamięć jawną, zanim wyślesz drugie zapytanie

To jest najgrubszy pieniądz w całym zestawieniu. Zwykłe wejście kosztuje 2 dolary za milion tokenów, odczyt z pamięci jawnej 0,17 dolara, czyli prawie dwanaście razy mniej. Zapis kosztuje jednorazowo 2,50, więc dopłacasz pół dolara, żeby oszczędzać 1,83 przy każdym kolejnym odczycie.

Próg opłacalności wypada przy pierwszym ponownym użyciu. W praktyce: jeżeli wysyłasz ten sam regulamin, tę samą dokumentację albo ten sam prompt systemowy więcej niż raz, brak pamięci to po prostu wyrzucanie pieniędzy. W scenariuszu agenta pracującego godzinę różnica wynosi 2,54 zł kontra 0,83 zł.

2. Nie płać za rozumowanie, którego nie potrzebujesz

Model ma budżet rozumowania do 262 tysięcy tokenów. To ogromna przestrzeń, ale za każdy przemyślany token płacisz jak za wyjście, czyli 6 dolarów za milion. Przy zadaniach typu „przepisz ten akapit” albo „wyciągnij daty z tekstu” rozumowanie nie poprawia wyniku, a potrafi zwielokrotnić rachunek.

Zasada, którą stosuję: rozumowanie włączam tam, gdzie zadanie ma wiele kroków albo wymaga sprawdzenia własnej odpowiedzi. Wyłączam wszędzie tam, gdzie chodzi o przekształcenie tekstu.

3. Wykorzystaj to, w czym naprawdę wygrywa: instrukcje

W teście IFBench, który mierzy trzymanie się poleceń, model ma 82,8 punktu przy 72,7 dla GPT-5.6 Sol i 63,5 dla Claude Fable 5. To najbardziej praktyczna przewaga z całej tabeli i warto ją wykorzystać.

Konkretnie: pisz twarde, wyliczone wymagania zamiast opisowych próśb. Zamiast „napisz krótko i konkretnie” napisz „maksymalnie 120 słów, cztery akapity, każdy zaczyna się od czasownika, bez wykrzykników”. Modele słabsze w tym teście będą takie listy gubić. Ten trzyma się ich lepiej niż konkurencja, więc szczegółowość Ci się zwraca.

4. Do wykresów i zrzutów ekranu używaj go bez wahania

MathVision 95,2 i CharXiv 93,5 to najlepsze zweryfikowane wyniki w stawce, a CharXiv mierzy dokładnie to, co ludzie robią najczęściej: czytanie wykresów. Jeżeli masz raport w PDF-ie pełen słupków, tabel i osi, to jest zadanie, w którym ten model jest mocniejszy od droższej konkurencji.

Przyjmuje też wideo na wejściu, choć na wyjściu daje wyłącznie tekst.

5. Przy kodzie zachowaj ostrożność, mimo reklamy

To jest najważniejsza rada z całej listy, bo idzie pod prąd komunikatowi prasowemu. SWE-bench Pro 67,7 przy 80,3 u lidera, deepSwe 56,6 przy 72,7 dla GPT-5.6 Sol, FrontierSWE 73,5 przy 81,2 dla Kimi K3. To są testy realnego poprawiania kodu w prawdziwych repozytoriach.

Nie znaczy to, że model nie umie programować. Znaczy, że przy trudnym zadaniu częściej niż czołówka będzie potrzebował drugiego podejścia. Przy trzykrotnie niższej cenie to może się nadal opłacać, ale policz to na swoim zadaniu, zamiast zakładać.

6. Długi kontekst tak, ale sprawdź go na swoich danych

Mam to spisane w całości

Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.

Pobierz ebooki

LongBench v2 z wynikiem 66,3 to najlepszy zweryfikowany rezultat w stawce, a milion tokenów kontekstu za dwa dolary to naprawdę atrakcyjna oferta. Zastrzeżenie jest jedno i dotyczy każdego modelu: żaden z tych testów nie jest po polsku.

Nasz język dzieli się na tokeny mniej oszczędnie niż angielski, więc realna pojemność okna jest dla nas mniejsza, niż wynika z liczby. Zanim oprzesz proces na wielkim kontekście po polsku, zrób własny test: schowaj w dokumencie unikalny kod i sprawdź, czy model go znajdzie na różnych głębokościach.

7. Podmiana adresu zamiast przepisywania kodu

Model obsługuje jednocześnie protokół OpenAI i protokół Anthropic. Jeżeli masz działającą integrację z którymkolwiek z nich, przejście to podmiana adresu bazowego i klucza, a nie przepisywanie logiki. To dobra wiadomość również dlatego, że pozwala Ci go przetestować równolegle, bez rozbierania tego, co już działa.

8. Nie buduj produkcji na obietnicy otwartych wag

Zapowiedziano publikację wag w przyszłym tygodniu, razem z mniejszym Qwen3.8-27B. Na razie nie ma daty dziennej, licencji ani repozytorium. Jeżeli Twój plan zakłada uruchomienie modelu na własnym sprzęcie, poczekaj na plik, a nie na komunikat.

I miej z tyłu głowy skalę: 2,4 biliona parametrów to sprzęt za setki tysięcy złotych. Wersją realną dla większości ludzi będzie 27B, nie Max.

9. Traktuj opowieści o dziesięciu dniach jako marketing, dopóki ktoś ich nie powtórzy

Dziesięciodniowe samodzielne kodowanie, sto dwadzieścia pięć godzin nad odtworzeniem publikacji naukowej, wyprzedzenie 458 z 526 zespołów ludzkich w zawodach. Wszystkie te liczby pochodzą z testów wewnętrznych Alibaby. Nikt ich na razie niezależnie nie powtórzył.

To nie znaczy, że są nieprawdziwe. Znaczy, że przed przestawieniem procesu na wielodniową pracę bez nadzoru warto zrobić własną próbę na małym zadaniu i zobaczyć, gdzie model zaczyna dryfować. Ja taką próbę zrobię, gdy model trafi do OpenRoutera, i opublikuję wynik niezależnie od tego, jak wypadnie.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Trzy zdania podsumowania

Włącz pamięć jawną od pierwszego dnia, bo to jedyna zmiana, która potrafi ściąć rachunek trzykrotnie. Pisz twarde, wyliczone instrukcje, bo w tym ten model jest lepszy od droższej konkurencji. I zanim oprzesz na nim pracę z kodem, sprawdź go na swoim repozytorium, bo tu liczby mówią coś innego niż zapowiedź.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Ile kosztuje użycie pamięci jawnej w Qwen3.8-Max w porównaniu do zwykłego wejścia?

Odczyt z pamięci jawnej kosztuje 0,17 dolara za milion tokenów, podczas gdy zwykłe wejście to 2 dolary, czyli prawie 12 razy więcej. Zapis kosztuje jednorazowo 2,50 dolara, więc przy każdym kolejnym odczycie oszczędzasz 1,83 dolara.

Czy Qwen3.8-Max nadaje się do analizy wykresów i raportów PDF?

Tak, model osiąga 93,5 punktu w teście CharXiv, który mierzy dokładnie czytanie wykresów, i jest to najlepszy zweryfikowany wynik w stawce. Przyjmuje wideo i obrazy na wejściu, choć na wyjściu daje wyłącznie tekst.

Jak przejść z integracji OpenAI lub Anthropic na Qwen3.8-Max?

Wystarczy podmienić adres bazowy i klucz API, bo model obsługuje jednocześnie protokół OpenAI i protokół Anthropic. Nie trzeba przepisywać logiki istniejącej integracji.

Czy warto uruchomić Qwen3.8-Max na własnym sprzęcie po publikacji wag?

Model ma 2,4 biliona parametrów, co wymaga sprzętu za setki tysięcy złotych, więc dla większości realną opcją będzie mniejszy Qwen3.8-27B. Na dzień publikacji artykułu nie podano daty dziennej, licencji ani repozytorium, więc autor radzi czekać na plik, nie na komunikat.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka CapCut Pro 460 zł/rok ElevenLabs Creator 352 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie