Claude for Startups i 100+ programów z darmowymi kredytami AI dla startupów i JDG Darmowe kredyty AI dla Twojej firmy Sprawdź, co dostaniesz
✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Step 5 po polsku: test na 13 zadaniach i 3 pustych odpowiedziach

Step 5 Preview na 13 zadaniach Laboratorium: 65,4 pkt, bezbłędny quiz z polskich realiów i trzy puste odpowiedzi, bo model przemyślał cały limit tokenów.

5 min czytania
Logo StepFun i napis Step 5 po polsku: 65,4 pkt w moim teście

👁 118 przeczytań

// w skrócie
  • Step 5 Preview zdobył 65,4 pkt na 13 zadaniach Laboratorium Promptowego, tyle co GLM-5.3 i o 15 pkt mniej niż GPT-6 Luna.
  • W trzech zadaniach model nie oddał ani słowa odpowiedzi, bo zużył cały limit tokenów (6000-8000) wyłącznie na rozumowanie.
  • Step 5 Preview kosztował 0,31 USD za 13 zadań, czyli dziesięć razy więcej niż GLM-5.3 przy identycznym wyniku końcowym.

Sprawdziłem, jak nowy chiński model Step 5 Preview od StepFun radzi sobie z polskim. Na 13 zadaniach mojego Laboratorium zdobył 65,4 pkt, czyli tyle co GLM-5.3 i o 15 mniej niż GPT-6 Luna. Polszczyzna w krótkich formach jest poprawna, quiz z polskich realiów zdał bezbłędnie, ale w trzech zadaniach nie oddał ani słowa, bo przemyślał cały limit tokenów. Poniżej wszystkie zadania, oceny sędziów i cytaty.

Test z 9 października 2026 w skrócie

  • Model: stepfun/step-5-preview przez OpenRouter, wysiłek rozumowania low, limity tokenów takie same jak dla wszystkich modeli w Laboratorium (6-9 tys.).
  • Wynik: 65,4 pkt (skalibrowany kotwicami). GLM-5.3: 64,8, Qwen3.8 Max: 76,8, GPT-6 Luna: 80,4, Claude Opus 5.5: 91,3.
  • Puste odpowiedzi: 3 z 13 (opis produktu, korekta łatwa, korekta trudna), mimo trzech podejść do każdego.
  • Koszt: 0,31 USD za 13 zadań razem z powtórkami.

Jak testowałem

Step 5 dostał dokładnie te same polecenia co wszystkie modele w Laboratorium Promptowym i w Arenie modeli po polsku:

  • 9 zadań pisarskich: artykuł o oszczędzaniu prądu, opis czajnika z karty produktu, mail z przeprosinami, post na LinkedIn, opowiadanie w konwencji realizmu magicznego, 10 tytułów SEO, streszczenie notatki w 5 punktach, wyjaśnienie inflacji dla 12-latka, tłumaczenie z angielskiego bez kalek idiomów;
  • 2 korekty: łatwa (22 błędy) i trudna (30 błędów);
  • 2 quizy: łatwy (46 pytań) i trudny (48 pytań) z polskiej historii, geografii i języka.

Teksty oceniali na ślepo dwaj sędziowie: Claude Opus 5.5 i GPT-6 Sol. Dostawali odpowiedzi pięciu modeli pod losowymi kodami i wystawiali oceny 1-10 za poprawność, naturalność i wykonanie polecenia. Korekty i quizy liczy skrypt. Żeby wynik był porównywalny z tabelą Laboratorium, w tej samej puli ocenione zostały cztery modele-kotwice (Opus 5.5, GPT-6 Luna, Qwen3.8 Max, GLM-5.3), a skala przesunęła się o 0,78 pkt.

Wyniki

ModelWynikPoprawnośćNaturalnośćWykonanieKorekta łatwa / trudnaQuiz łatwy / trudny
Claude Opus 5.591,39,788,448,8922/22 · 30/3046/46 · 48/48
GPT-6 Luna80,49,06,787,4422/22 · 29/3046/46 · 48/48
Qwen3.8 Max76,88,897,117,0621/22 · 30/3046/46 · 48/48
Step 5 Preview65,47,05,285,720/22 · 0/30 (pusto)46/46 · 11/48
GLM-5.364,87,066,06,1721/22 · 26/3046/46 · 46/48
Step 5 Preview: średnia ocena sędziów w zadaniach pisarskich (0-10)
Mail z przeprosinami8,5
Streszczenie8,0
Tłumaczenie8,0
Tytuły SEO6,7
Post na LinkedIn5,8
Artykuł5,7
Prosty język5,3
Opowiadanie5,0
Opis produktu (pusty)1,0

Problem numer jeden: puste odpowiedzi

Step 5 ma obowiązkowe rozumowanie i nawet na najniższym poziomie low myśli długo. W opisie produktu wygenerował 6000 tokenów, w łatwej korekcie 6000, w trudnej 8000 - za każdym razem do limitu i bez jednego słowa odpowiedzi. Skrypt próbował trzy razy, efekt był ten sam. W trudnym quizie limit 9000 tokenów wystarczył na odpowiedzi do 11 pytań z 48.

Żeby sprawdzić, czy to tylko kwestia budżetu, łatwą korektę powtórzyłem raz z limitem 16 tys. tokenów. Model myślał 4902 tokeny (ok. 16 tys. znaków rozumowania), po 96 sekundach oddał tekst i poprawił 19 z 22 błędów. Przepuścił trzy:

  • „nikt się niepoddał” zamiast „nie poddał”,
  • „na pułkach” zamiast „na półkach”,
  • „przyniósł tą książkę” zamiast „tę książkę”.

Dla porównania GPT-6 Luna i Claude Opus 5.5 poprawiają wszystkie 22, a GLM-5.3 21. Wniosek praktyczny: jeśli używasz Step 5 przez API, ustaw max_tokens na 12-16 tys. albo wyżej, nawet przy krótkich zadaniach. Do oficjalnego wyniku tej poprawki nie liczę - w Laboratorium wszyscy mają równe limity.

Co wyszło dobrze

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Krótkie, rzeczowe formy. Mail do klienta o opóźnionej paczce sędziowie ocenili na 8,5, a GPT-6 Sol dał mu 10 za poprawność. Model zmieścił się w 59 słowach, podał przyczynę, nowy termin i kod rabatowy, niczego nie obiecał ponad polecenie:

bardzo przepraszamy za opóźnienie zamówienia nr 48213. Przesyłka utknęła w sortowni przewoźnika, przez co nie dotarła 29 września. Nowy termin doręczenia to 3 października.

Jedyne uwagi sędziów: dopisał niezamówioną linię „Temat” i niezgrabne „Szanowny Panie/Szanowna Pani”. Streszczenie notatki z zarządu (8,0) zmieściło się w 80 słowach i 5 punktach, choć według obu sędziów lekko przesunęło sens jednego zdania. Łatwy quiz z polskich realiów - 46 na 46, z wszystkimi sześcioma pytaniami-pułapkami.

Co wyszło słabo

Dłuższe teksty i proste wyjaśnienia. W tekście o inflacji dla 12-latka (5,3) pojawiło się zdanie, którego żaden z sędziów nie przepuścił:

Twoje oszczędności albo kieszonkowe mogą pozwolić kupić mniej, jeśli ceny wzrosną bardzo szybko.

W tym samym akapicie jest jeszcze „za tą samą kwotę” i „dzięki temu” przy negatywnym skutku. Opowiadanie o emerytowanej listonoszce (5,0) przekroczyło limit słów i miało obrazy w rodzaju „słońce z dwudziestu lat temu” albo bohaterkę, która „nosiła listy” ludzi. Artykuł o oszczędzaniu prądu (5,7) zawierał błędny rachunek: Claude Opus 5.5 wyliczył, że wentylator pracujący przez 1/6 czasu daje ok. 83% oszczędności, a nie 60%, jak napisał model.

W tłumaczeniu (8,0) wpadły kalki, których polecenie zabraniało: „nie jest żadną wielką nauką”, „dedykowany opiekun”, „piłka jest teraz po naszej stronie”. Tytuły SEO formalnie spełniały limit 60 znaków, ale według GPT-6 Sol połowa nie miała frazy w wymaganej formie, a „jak nie przegapić?” nie ma sensu.

Do tego półpauzy: 14,8 na 1000 słów. W opublikowanych tekstach trzeba je zamieniać.

Szybkość i koszt

ModelKoszt 13 zadańCzas 9 zadań pisarskich
GPT-6 Luna0,004 USD39 s
GLM-5.30,03 USD27 s
Qwen3.8 Max0,24 USD572 s
Step 5 Preview0,31 USD683 s
Claude Opus 5.50,37 USD133 s

Cena za token jest niska (1 / 2,70 USD), ale model zużywa tak dużo tokenów na rozumowanie, że w moim teście wyszedł prawie tak drogo jak Claude Opus 5.5 i dziesięć razy drożej niż GLM-5.3. Czas 683 s to suma zadań uruchamianych równolegle, z powtórkami pustych odpowiedzi; sama generacja szła z prędkością ok. 88 tokenów na sekundę.

Werdykt

Do pisania po polsku Step 5 Preview w tej wersji się nie nadaje: ma wynik GLM-5.3, a kosztuje dziesięć razy więcej. Mocne strony producent pokazuje gdzie indziej - w programowaniu, pracy agentowej i finansach, czego mój test nie mierzy. Jeśli chcesz pisać, weź GPT-6 Luna albo Kimi K3. Pełne porównanie z chińską konkurencją jest w tekście Step 5 vs Kimi K3, GLM-5.3, Qwen i DeepSeek. Test powtórzę po premierze pełnej wersji. To moja opinia na podstawie jednego przebiegu.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i dane

Test
  1. Laboratorium Promptowe, 9 października 2026, model stepfun/step-5-preview na OpenRouterze (dostawca StepFun, fp8)openrouter.ai
Sędziowie
  1. Claude Opus 5.5 i GPT-6 Sol
Dokumentacja
  1. StepFun - Step 5 Previewplatform.stepfun.ai
// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Jak Step 5 Preview radzi sobie z pisaniem po polsku?

Wynik to 65,4 pkt, co plasuje go na poziomie GLM-5.3 i wyraźnie poniżej GPT-6 Luna (80,4 pkt). Krótkie formy jak mail z przeprosinami model napisał poprawnie (8,5 pkt), ale dłuższe teksty, wyjaśnienia i opowiadania wypadły słabo - oceny między 5,0 a 5,7.

Dlaczego Step 5 Preview zwracał puste odpowiedzi?

Model ma obowiązkowe rozumowanie i nawet na poziomie low zużywa cały przydzielony limit tokenów na myślenie, nie zostawiając miejsca na odpowiedź. W opisie produktu i obu korektach wygenerował 6000-8000 tokenów rozumowania i nie napisał ani słowa - efekt był taki sam przy trzech próbach.

Ile kosztuje użycie Step 5 Preview przez API?

W teście 13 zadań koszt wyniósł 0,31 USD, prawie tyle co Claude Opus 5.5 (0,37 USD). Cena za token jest niska (1/2,70 USD), ale model zużywa tak dużo tokenów na rozumowanie, że całkowity koszt jest dziesięć razy wyższy niż GLM-5.3 przy tym samym wyniku.

Jak ustawić limit tokenów dla Step 5 Preview, żeby nie dostawać pustych odpowiedzi?

Należy ustawić max_tokens na 12 000-16 000 lub wyżej, nawet przy krótkich zadaniach. Przy limicie 16 000 tokenów model myślał przez 4902 tokeny, po 96 sekundach oddał tekst i poprawił 19 z 22 błędów w łatwej korekcie.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›