Step 5 po polsku: test na 13 zadaniach i 3 pustych odpowiedziach
Step 5 Preview na 13 zadaniach Laboratorium: 65,4 pkt, bezbłędny quiz z polskich realiów i trzy puste odpowiedzi, bo model przemyślał cały limit tokenów.

👁 117 przeczytań
- Step 5 Preview zdobył 65,4 pkt na 13 zadaniach Laboratorium Promptowego, tyle co GLM-5.3 i o 15 pkt mniej niż GPT-6 Luna.
- W trzech zadaniach model nie oddał ani słowa odpowiedzi, bo zużył cały limit tokenów (6000-8000) wyłącznie na rozumowanie.
- Step 5 Preview kosztował 0,31 USD za 13 zadań, czyli dziesięć razy więcej niż GLM-5.3 przy identycznym wyniku końcowym.
Sprawdziłem, jak nowy chiński model Step 5 Preview od StepFun radzi sobie z polskim. Na 13 zadaniach mojego Laboratorium zdobył 65,4 pkt, czyli tyle co GLM-5.3 i o 15 mniej niż GPT-6 Luna. Polszczyzna w krótkich formach jest poprawna, quiz z polskich realiów zdał bezbłędnie, ale w trzech zadaniach nie oddał ani słowa, bo przemyślał cały limit tokenów. Poniżej wszystkie zadania, oceny sędziów i cytaty.
Test z 9 października 2026 w skrócie
- Model:
stepfun/step-5-previewprzez OpenRouter, wysiłek rozumowania low, limity tokenów takie same jak dla wszystkich modeli w Laboratorium (6-9 tys.). - Wynik: 65,4 pkt (skalibrowany kotwicami). GLM-5.3: 64,8, Qwen3.8 Max: 76,8, GPT-6 Luna: 80,4, Claude Opus 5.5: 91,3.
- Puste odpowiedzi: 3 z 13 (opis produktu, korekta łatwa, korekta trudna), mimo trzech podejść do każdego.
- Koszt: 0,31 USD za 13 zadań razem z powtórkami.
Jak testowałem
Step 5 dostał dokładnie te same polecenia co wszystkie modele w Laboratorium Promptowym i w Arenie modeli po polsku:
- 9 zadań pisarskich: artykuł o oszczędzaniu prądu, opis czajnika z karty produktu, mail z przeprosinami, post na LinkedIn, opowiadanie w konwencji realizmu magicznego, 10 tytułów SEO, streszczenie notatki w 5 punktach, wyjaśnienie inflacji dla 12-latka, tłumaczenie z angielskiego bez kalek idiomów;
- 2 korekty: łatwa (22 błędy) i trudna (30 błędów);
- 2 quizy: łatwy (46 pytań) i trudny (48 pytań) z polskiej historii, geografii i języka.
Teksty oceniali na ślepo dwaj sędziowie: Claude Opus 5.5 i GPT-6 Sol. Dostawali odpowiedzi pięciu modeli pod losowymi kodami i wystawiali oceny 1-10 za poprawność, naturalność i wykonanie polecenia. Korekty i quizy liczy skrypt. Żeby wynik był porównywalny z tabelą Laboratorium, w tej samej puli ocenione zostały cztery modele-kotwice (Opus 5.5, GPT-6 Luna, Qwen3.8 Max, GLM-5.3), a skala przesunęła się o 0,78 pkt.
Wyniki
| Model | Wynik | Poprawność | Naturalność | Wykonanie | Korekta łatwa / trudna | Quiz łatwy / trudny |
|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 91,3 | 9,78 | 8,44 | 8,89 | 22/22 · 30/30 | 46/46 · 48/48 |
| GPT-6 Luna | 80,4 | 9,0 | 6,78 | 7,44 | 22/22 · 29/30 | 46/46 · 48/48 |
| Qwen3.8 Max | 76,8 | 8,89 | 7,11 | 7,06 | 21/22 · 30/30 | 46/46 · 48/48 |
| Step 5 Preview | 65,4 | 7,0 | 5,28 | 5,72 | 0/22 · 0/30 (pusto) | 46/46 · 11/48 |
| GLM-5.3 | 64,8 | 7,06 | 6,0 | 6,17 | 21/22 · 26/30 | 46/46 · 46/48 |
Problem numer jeden: puste odpowiedzi
Step 5 ma obowiązkowe rozumowanie i nawet na najniższym poziomie low myśli długo. W opisie produktu wygenerował 6000 tokenów, w łatwej korekcie 6000, w trudnej 8000 - za każdym razem do limitu i bez jednego słowa odpowiedzi. Skrypt próbował trzy razy, efekt był ten sam. W trudnym quizie limit 9000 tokenów wystarczył na odpowiedzi do 11 pytań z 48.
Żeby sprawdzić, czy to tylko kwestia budżetu, łatwą korektę powtórzyłem raz z limitem 16 tys. tokenów. Model myślał 4902 tokeny (ok. 16 tys. znaków rozumowania), po 96 sekundach oddał tekst i poprawił 19 z 22 błędów. Przepuścił trzy:
- „nikt się niepoddał” zamiast „nie poddał”,
- „na pułkach” zamiast „na półkach”,
- „przyniósł tą książkę” zamiast „tę książkę”.
Dla porównania GPT-6 Luna i Claude Opus 5.5 poprawiają wszystkie 22, a GLM-5.3 21. Wniosek praktyczny: jeśli używasz Step 5 przez API, ustaw max_tokens na 12-16 tys. albo wyżej, nawet przy krótkich zadaniach. Do oficjalnego wyniku tej poprawki nie liczę - w Laboratorium wszyscy mają równe limity.
Co wyszło dobrze
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Krótkie, rzeczowe formy. Mail do klienta o opóźnionej paczce sędziowie ocenili na 8,5, a GPT-6 Sol dał mu 10 za poprawność. Model zmieścił się w 59 słowach, podał przyczynę, nowy termin i kod rabatowy, niczego nie obiecał ponad polecenie:
bardzo przepraszamy za opóźnienie zamówienia nr 48213. Przesyłka utknęła w sortowni przewoźnika, przez co nie dotarła 29 września. Nowy termin doręczenia to 3 października.
Jedyne uwagi sędziów: dopisał niezamówioną linię „Temat” i niezgrabne „Szanowny Panie/Szanowna Pani”. Streszczenie notatki z zarządu (8,0) zmieściło się w 80 słowach i 5 punktach, choć według obu sędziów lekko przesunęło sens jednego zdania. Łatwy quiz z polskich realiów - 46 na 46, z wszystkimi sześcioma pytaniami-pułapkami.
Co wyszło słabo
Dłuższe teksty i proste wyjaśnienia. W tekście o inflacji dla 12-latka (5,3) pojawiło się zdanie, którego żaden z sędziów nie przepuścił:
Twoje oszczędności albo kieszonkowe mogą pozwolić kupić mniej, jeśli ceny wzrosną bardzo szybko.
W tym samym akapicie jest jeszcze „za tą samą kwotę” i „dzięki temu” przy negatywnym skutku. Opowiadanie o emerytowanej listonoszce (5,0) przekroczyło limit słów i miało obrazy w rodzaju „słońce z dwudziestu lat temu” albo bohaterkę, która „nosiła listy” ludzi. Artykuł o oszczędzaniu prądu (5,7) zawierał błędny rachunek: Claude Opus 5.5 wyliczył, że wentylator pracujący przez 1/6 czasu daje ok. 83% oszczędności, a nie 60%, jak napisał model.
W tłumaczeniu (8,0) wpadły kalki, których polecenie zabraniało: „nie jest żadną wielką nauką”, „dedykowany opiekun”, „piłka jest teraz po naszej stronie”. Tytuły SEO formalnie spełniały limit 60 znaków, ale według GPT-6 Sol połowa nie miała frazy w wymaganej formie, a „jak nie przegapić?” nie ma sensu.
Do tego półpauzy: 14,8 na 1000 słów. W opublikowanych tekstach trzeba je zamieniać.
Szybkość i koszt
| Model | Koszt 13 zadań | Czas 9 zadań pisarskich |
|---|---|---|
| GPT-6 Luna | 0,004 USD | 39 s |
| GLM-5.3 | 0,03 USD | 27 s |
| Qwen3.8 Max | 0,24 USD | 572 s |
| Step 5 Preview | 0,31 USD | 683 s |
| Claude Opus 5.5 | 0,37 USD | 133 s |
Cena za token jest niska (1 / 2,70 USD), ale model zużywa tak dużo tokenów na rozumowanie, że w moim teście wyszedł prawie tak drogo jak Claude Opus 5.5 i dziesięć razy drożej niż GLM-5.3. Czas 683 s to suma zadań uruchamianych równolegle, z powtórkami pustych odpowiedzi; sama generacja szła z prędkością ok. 88 tokenów na sekundę.
Werdykt
Do pisania po polsku Step 5 Preview w tej wersji się nie nadaje: ma wynik GLM-5.3, a kosztuje dziesięć razy więcej. Mocne strony producent pokazuje gdzie indziej - w programowaniu, pracy agentowej i finansach, czego mój test nie mierzy. Jeśli chcesz pisać, weź GPT-6 Luna albo Kimi K3. Pełne porównanie z chińską konkurencją jest w tekście Step 5 vs Kimi K3, GLM-5.3, Qwen i DeepSeek. Test powtórzę po premierze pełnej wersji. To moja opinia na podstawie jednego przebiegu.
Źródła i dane
- Laboratorium Promptowe, 9 października 2026, model stepfun/step-5-preview na OpenRouterze (dostawca StepFun, fp8)openrouter.ai
- Claude Opus 5.5 i GPT-6 Sol
- StepFun - Step 5 Previewplatform.stepfun.ai
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Jak Step 5 Preview radzi sobie z pisaniem po polsku?
Wynik to 65,4 pkt, co plasuje go na poziomie GLM-5.3 i wyraźnie poniżej GPT-6 Luna (80,4 pkt). Krótkie formy jak mail z przeprosinami model napisał poprawnie (8,5 pkt), ale dłuższe teksty, wyjaśnienia i opowiadania wypadły słabo - oceny między 5,0 a 5,7.
Dlaczego Step 5 Preview zwracał puste odpowiedzi?
Model ma obowiązkowe rozumowanie i nawet na poziomie low zużywa cały przydzielony limit tokenów na myślenie, nie zostawiając miejsca na odpowiedź. W opisie produktu i obu korektach wygenerował 6000-8000 tokenów rozumowania i nie napisał ani słowa - efekt był taki sam przy trzech próbach.
Ile kosztuje użycie Step 5 Preview przez API?
W teście 13 zadań koszt wyniósł 0,31 USD, prawie tyle co Claude Opus 5.5 (0,37 USD). Cena za token jest niska (1/2,70 USD), ale model zużywa tak dużo tokenów na rozumowanie, że całkowity koszt jest dziesięć razy wyższy niż GLM-5.3 przy tym samym wyniku.
Jak ustawić limit tokenów dla Step 5 Preview, żeby nie dostawać pustych odpowiedzi?
Należy ustawić max_tokens na 12 000-16 000 lub wyżej, nawet przy krótkich zadaniach. Przy limicie 16 000 tokenów model myślał przez 4902 tokeny, po 96 sekundach oddał tekst i poprawił 19 z 22 błędów w łatwej korekcie.
