Step 5 vs Kimi K3, GLM-5.3, Qwen i DeepSeek: porównanie na liczbach
Step 5 Preview na tle Kimi K3, GLM-5.3, Qwen3.8 i DeepSeek V4.1: wyniki Artificial Analysis, ceny za token, licencje wag i mój test po polsku.

👁 115 przeczytań
- Step 5 Preview remisuje z Kimi K3 na poziomie 44 pkt w indeksie Artificial Analysis, ustępując o punkt GLM-5.3 i Qwen3.8 Max (45 pkt).
- Step 5 osiąga wynik 44 pkt przy zaledwie 27 mld aktywnych parametrach, podczas gdy Kimi K3 potrzebuje 104 mld - stąd niższa cena wyjścia: 2,70 vs 15,00 USD za 1 mln tokenów.
- W teście po polsku Step 5 Preview zajął piąte miejsce z wynikiem 65,4 pkt, głównie przez trzy puste odpowiedzi, gdy limit tokenów pochłonęło rozumowanie.
Nowy Step 5 Preview od StepFun wchodzi do grupy, w której są już Kimi K3, GLM-5.3, Qwen3.8 i DeepSeek V4.1. W niezależnym indeksie Artificial Analysis remisuje z Kimi K3 (44 pkt) i jest punkt za GLM-5.3, a kosztuje mniej od obu. W moim teście po polsku wypadł jednak najsłabiej z tej piątki, razem z GLM. Poniżej porównanie wyłącznie na sprawdzonych liczbach: indeksy, ceny, kontekst, licencje i mój test.
W skrócie, stan na 9 października 2026
- Najmądrzejszy według AA: GLM-5.3 i Qwen3.8 Max (po 45 pkt), tuż za nimi Step 5 i Kimi K3 (44).
- Najtańszy: DeepSeek V4.1 Flash (0,30 / 1,20 USD za 1 mln tokenów), wśród modeli z 44-45 pkt - Step 5 (1,00 / 2,70 USD).
- Najlepszy po polsku: Kimi K3 (78,5 pkt w moim Laboratorium), Step 5: 65,4.
- Najszybszy: DeepSeek V4.1 Flash (217 tokenów/s według AA), Step 5: 87.
Tabela porównawcza
| Model | Firma | AA Index | Wej. / wyj., USD za 1 mln | Kontekst | Parametry (aktywne) | Wagi |
|---|---|---|---|---|---|---|
| Step 5 Preview | StepFun | 44 | 1,00 / 2,70 | 1 mln | 600B (27B) | zapowiedź 15.10 |
| Kimi K3 (Max) | Moonshot AI | 44 | 3,00 / 15,00 | 1 mln | 2,8T (104B) | tak, licencja Kimi K3 |
| GLM-5.3 (Max) | Z.ai (Zhipu) | 45 | 1,40 / 4,40 | 1 mln | 753B (40B) | tak, licencja GLM-5.3 |
| Qwen3.8 Max | Alibaba | 45 | 2,00 / 6,00 | 984 tys. | nie podano | nie |
| Qwen3.8 27B | Alibaba | 34 | 0,50 / 3,00 | 256 tys. | 27B | tak, Apache 2.0 |
| DeepSeek V4.1 Flash (Max) | DeepSeek | 39 | 0,30 / 1,20 | 1 mln | 552B (16B) | tak, MIT |
| DeepSeek V4 Pro (Max) | DeepSeek | 36 | 1,32 / 3,96 | 1 mln | 1,6T (49B) | tak, MIT |
Źródło indeksów, cen, kontekstu i parametrów: strony modeli Artificial Analysis, odczyt 9 października 2026. Ceny to stawki referencyjne producentów; na OpenRouterze bywają inne zależnie od dostawcy.
Inteligencja: remis w czołówce
Różnica jednego punktu między GLM-5.3, Qwen3.8 Max, Step 5 i Kimi K3 to w praktyce remis. Ciekawe jest co innego: Step 5 osiąga ten poziom z 27 mld aktywnych parametrów, a Kimi K3 potrzebuje 104 mld. To przekłada się na cenę. Na wykresie dołączonym do ogłoszenia StepFun pokazuje 65% niższy koszt zadania niż u GLM-5.3 i Kimi K3 w trybie max.
W deklarowanych wynikach producenta (znam je z przedruków w mediach, a nie ze strony StepFun) Step 5 prowadzi w programowaniu: DeepSWE 67,7 wobec 67,5 u Kimi K3 i 66,9 u GLM-5.3, ProgramBench 80,5 wobec 77,8 i 72,0. W Terminal-Bench v4 wyraźnie przegrywa z GLM-5.3 (33,3 wobec 41,9), za to bije Kimi K3 (12,6). Qwen i DeepSeek w tej tabeli producenta nie występują.
Cena: kto daje najwięcej za dolara
| Model | Wyjście, USD za 1 mln | Koszt 9 zadań pisarskich w moim teście | Uwagi |
|---|---|---|---|
| DeepSeek V4.1 Flash | 1,20 | 0,013 USD | najtańszy, ale 39 pkt w AA |
| Step 5 Preview | 2,70 | 0,11 USD | dużo tokenów rozumowania |
| GLM-5.3 | 4,40 | 0,018 USD | 45 pkt w AA, szybki |
| Qwen3.8 Max | 6,00 | 0,17 USD | zamknięty |
| Kimi K3 | 15,00 | 0,077 USD | najdroższy za token |
Cena za token myli. Step 5 ma tanie wyjście, ale myśli tak długo, że w zadaniach pisarskich kosztował sześć razy więcej niż GLM-5.3, a w całym teście (z powtórkami pustych odpowiedzi) dziesięć razy więcej: 0,31 wobec 0,03 USD. Artificial Analysis widzi to samo: w ich ewaluacji Step 5 wygenerował 160 mln tokenów przy medianie 94 mln. Jeśli płacisz za zadania agentowe z dużym kontekstem, policz koszt na swoich danych, a nie z cennika.
Po polsku: Kimi K3 wyraźnie przed Step 5
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Wszystkie modele dostały te same 13 zadań (9 tekstów, 2 korekty, 2 quizy), wysiłek rozumowania low i równe limity tokenów. Step 5, Qwen3.8 Max i GLM-5.3 były oceniane w jednej puli 9 października, Kimi K3 i DeepSeek - w pierwszej rundzie Laboratorium, z inną parą sędziów. Skala jest kalibrowana tymi samymi modelami-kotwicami, ale różnice do 2-3 punktów traktuję jako remis.
Step 5 przegrał głównie przez trzy puste odpowiedzi: w opisie produktu i obu korektach cały limit tokenów poszedł na rozumowanie. Gdzie odpowiedział, pisał poprawnie w krótkich formach (mail 8,5/10), słabiej w dłuższych (opowiadanie 5,0). Szczegóły: Step 5 po polsku: test na 13 zadaniach.
Otwartość i uruchamianie u siebie
- DeepSeek V4.1 Flash i V4 Pro - licencja MIT, najmniej ograniczeń.
- Qwen3.8 27B - Apache 2.0 i rozmiar, który zmieści się w 4 bitach na karcie z 24 GB. Qwen3.8 Max jest zamknięty.
- Kimi K3 i GLM-5.3 - otwarte wagi, ale na własnych licencjach z ograniczeniami komercyjnymi.
- Step 5 - wagi zapowiedziane na 15 października, licencji jeszcze nie ma. Przy 600 mld parametrów to ok. 1,2 TB w BF16, czyli sprzęt serwerowy.
Co wybrać
- Do pisania i korekty po polsku: Kimi K3 albo Qwen3.8 Max. Spośród tańszych - DeepSeek V4.1 Flash.
- Do programowania przez API, gdy liczy się cena: Step 5 Preview albo GLM-5.3. Step 5 ma lepsze wyniki producenta w DeepSWE i ProgramBench, GLM w pracy w terminalu.
- Do długich dokumentów i wideo na wejściu: Step 5, bo przyjmuje wideo do 128 MB i 1 mln tokenów kontekstu z cache za 0,05 USD.
- Do postawienia u siebie bez kłopotów z licencją: DeepSeek (MIT) albo mały Qwen (Apache 2.0). Przy Step 5 poczekaj na licencję 15 października.
To moja opinia na podstawie danych Artificial Analysis i jednego przebiegu mojego testu. Wszystkie modele z tego tekstu i wiele innych porównasz sam w Arenie modeli po polsku.
Źródła i data sprawdzenia
- AA - Step 5artificialanalysis.ai
- AA - Kimi K3artificialanalysis.ai
- AA - GLM-5.3artificialanalysis.ai
- AA - Qwen3.8 Maxartificialanalysis.ai
- AA - Qwen3.8 27Bartificialanalysis.ai
- AA - DeepSeek V4.1 Flashartificialanalysis.ai
- AA - DeepSeek V4 Proartificialanalysis.ai
- StepFun na X (20.09.2026)x.com
- cennik StepFunplatform.stepfun.ai
- Laboratorium Promptowe
Sprawdzone 9 października 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który model jest najlepszy do pisania po polsku spośród Step 5, Kimi K3, GLM i Qwen?
Najlepszy po polsku jest Kimi K3 z wynikiem 78,5 pkt w Laboratorium Promptowym, wyprzedzając Qwen3.8 Max (76,8 pkt) i DeepSeek V4 Pro (74,1 pkt). Step 5 Preview uzyskał 65,4 pkt, a GLM-5.3 jeszcze mniej - 64,8 pkt.
Ile kosztuje Step 5 Preview za 1 milion tokenów w porównaniu do konkurencji?
Step 5 Preview kosztuje 1,00 USD za wejście i 2,70 USD za wyjście na milion tokenów. Dla porównania najtańszy DeepSeek V4.1 Flash to 0,30 i 1,20 USD, a najdroższy Kimi K3 - 3,00 i 15,00 USD za milion tokenów.
Czy Step 5 Preview ma otwarte wagi i kiedy zostaną udostępnione?
Wagi Step 5 zostały zapowiedziane na 15 października, ale licencja nie była jeszcze znana w momencie pisania artykułu. Przy 600 mld parametrach model zajmuje ok. 1,2 TB w BF16, co wymaga sprzętu serwerowego.
Dlaczego Step 5 Preview jest drogi w praktycznym użyciu mimo niskiej ceny za token?
Step 5 generuje bardzo dużo tokenów rozumowania - w teście pisarskim kosztował 0,11 USD za 9 zadań, czyli sześć razy więcej niż GLM-5.3 (0,018 USD). Artificial Analysis odnotowało, że Step 5 wygenerował 160 mln tokenów przy medianie wynoszącej 94 mln dla pozostałych modeli.
