Przejdź do treści
Warsztat

Chińskie modele AI po polsku: test 5 modeli, trzy nie oddały ani słowa

Pięć nowych modeli z Chin, jedno polecenie po polsku. Trzy myślały, aż skończył się limit - Qwen liczył w myślach każde słowo po kolei.

8 min czytania
Chińskie modele AI po polsku: test 5 modeli, trzy nie oddały ani słowa

👁 120 przeczytań

// w skrócie
  • Na ustawieniach domyślnych tylko DeepSeek V4.1 Flash napisał tekst po polsku bez złamanej reguły, choć zajęło mu to 316 sekund.
  • Trzy modele - Qwen3.8 Max Prime, GLM-5.3 Prime i MiMo-V2.6 Pro - zużyły cały limit tokenów na myślenie i zwróciły pustą odpowiedź, za którą trzeba zapłacić.
  • Obejście w postaci niskiego poziomu rozumowania pomogło na GLM (tekst w 25 s za 0,020 USD) i Qwenie (843 słowa w 55 s), ale nie na MiMo-V2.6 Pro.

We wrześniu 2026 chińskie laboratoria wypuściły pięć nowych modeli językowych w dwa tygodnie: Xiaomi MiMo-V2.6 Pro i Flash, DeepSeek V4.1 Flash, Qwen3.8 Max Prime i GLM-5.3 Prime. Dałem im to samo polecenie po polsku, na którym wcześniej testowałem Claude Opus 5.5 i GPT-6. Trzy z pięciu nie oddały ani słowa - myślały, aż skończył się limit. Jeden policzył w myślach każde słowo po kolei. Tu jest cały test, z kosztami i tym, jak to obejść.

Werdykt w jednym akapicie

Na ustawieniach domyślnych tylko DeepSeek V4.1 Flash napisał tekst po polsku bez złamanej reguły. MiMo-V2.6 Flash też napisał, ale z zakazaną frazą i błędnymi danymi. MiMo-V2.6 Pro, Qwen3.8 Max Prime i GLM-5.3 Prime zużyły cały limit tokenów na myślenie - także przy limicie 32 tysięcy - i zwróciły pustą odpowiedź, za którą i tak trzeba zapłacić: Qwen spalił w ten sposób 0,60 USD. Obejście działa dla dwóch z trzech: niski poziom rozumowania dał tekst na GLM w 25 sekund, a na Qwenie w 55. Wszystkie pięć modeli poprawnie rozwiązało zagadkę logiczną.

Wyniki w jednej tabeli

ModelCena wej. / wyj.Tekst po polskuPułapka na zmyślanieZagadka
DeepSeek V4.1 Flash0,14 / 0,42 $bez złamanej reguły, 316 s3 z 4 + scenariusz z zastrzeżeniempoprawnie
MiMo-V2.6 Flash0,14 / 0,28 $zakazana fraza, błędne danewymyślona prognozapoprawnie
MiMo-V2.6 Pro0,435 / 0,87 $brak tekstu (5 prób)4 z 4 odmówpoprawnie
Qwen3.8 Max Prime4 / 12 $brak tekstu; na low - tekstprzy 6 tys. brak; przy 32 tys. 3 z 4 + scenariuszpoprawnie
GLM-5.3 Prime2,8 / 8,8 $brak tekstu; na low - tekst3 z 4 + scenariusz z zastrzeżeniempoprawnie
Dla porównania na tych samych zadaniach:
Claude Opus 5.54 / 20 $bez złamanej reguły, 50 s4 z 4 odmówpoprawnie
GPT-6 Luna0,10 / 0,50 $bez złamanej reguły, 36 s4 z 4 odmówpoprawnie

Ceny za milion tokenów na OpenRouterze. „Prime” przy Qwen i GLM oznacza szybsze podanie tego samego modelu za wyższą cenę: Qwen3.8 Max Prime kosztuje dwa razy więcej niż zwykły Qwen3.8 Max (2 / 6 USD), GLM-5.3 Prime dwa razy więcej niż GLM-5.3 (1,4 / 4,4 USD).

Polecenie

Napisz tekst po polsku na 900 słów o tym, jak zmienia się polski rynek pracy w IT. Zasady bezwzględne: polskie znaki diakrytyczne obowiązkowo, ani jednego słowa bez ogonków. Tylko dywiz "-", nigdy długa pauza. Zero waty typu "w dzisiejszych czasach", "warto pamiętać", "podsumowując", "kluczowe jest". Każdą tezę popierasz liczbą albo piszesz wprost, że to opinia. Jeśli czegoś nie wiesz, piszesz "nie wiem" - nie zmyślasz danych ani nazw firm. Zwróć sam tekst, bez komentarza.

To samo polecenie, na którym GPT-6 Sol napisał 60 zdań od „Sądzę, że”. Limit wyjścia: 9000 tokenów - Claude Opus 5.5 zmieścił w nim myślenie i tekst, zużywając 4531.

Trzy modele, które nie skończyły myśleć

ModelPróby bez tekstuNajdłuższaZapłacone za puste odpowiedzi
Qwen3.8 Max Prime3 (limit 9 i 32 tys.)373 s0,60 USD
GLM-5.3 Prime3 (limit 9 i 32 tys.)261 s0,44 USD
MiMo-V2.6 Pro5 (limit 9, 12 i 32 tys.)678 s0,06 USD

Pusta odpowiedź nie jest darmowa - myślenie liczy się jak zwykłe tokeny wyjścia. Za jeden nieudany tekst na Qwen3.8 Max Prime z limitem 32 tysięcy zapłaciłem 0,38 USD - cztery razy więcej niż za gotowy tekst na Claude Opus 5.5.

Co robiły w myślach

Poprosiłem OpenRoutera o zwrócenie toku myślenia i przeczytałem go. Każdy z trzech modeli utknął inaczej:

  • Qwen3.8 Max Prime liczył słowa jedno po drugim. Dosłownie: „Edukacja1 i2 wejście3 do4 zawodu5…”, a po każdym akapicie „Akapit 9 76. Razem 744.”. Model próbował trafić dokładnie w 900 słów, numerując każde z nich - i limit skończył mu się w dziesiątym akapicie.
  • MiMo-V2.6 Pro pisał cały tekst w myślach. Tok myślenia to gotowe akapity po polsku, z nagłówkami. Właściwa odpowiedź miała być przepisaniem tego szkicu, ale do niej nie doszło.
  • GLM-5.3 Prime planował po angielsku, a akapity szkicował po polsku, jeden po drugim, zaczynając od listy faktów, których jest „w miarę pewny” - i też nie zdążył przejść do odpowiedzi.

Czy to wina polecenia?

Pierwsza hipoteza: reguła „ani jednego słowa bez ogonków” jest dosłownie niewykonalna i modele się na niej zapętlają. Sprawdziłem - zamieniłem ją na „nie pomijaj polskich znaków diakrytycznych”. Wynik bez zmian: wszystkie trzy znów zużyły cały limit. Winne nie jest więc sformułowanie, tylko połączenie długiego tekstu z dokładną liczbą słów i domyślnie wysokim poziomem rozumowania.

Obejście: niski poziom rozumowania

Model, poziom lowWynikKosztCzas
GLM-5.3 Prime993 słowa, 16 zdań z liczbami, zero złamanych zakazów, zero tokenów myślenia0,020 USD25 s
Qwen3.8 Max Prime843 słowa, 7 zdań z liczbami, zero złamanych zakazów0,054 USD55 s
MiMo-V2.6 Proznów brak tekstu - 12 tys. tokenów myślenia0,011 USD325 s

Na GLM i Qwenie obejście działa od ręki. Przy MiMo-V2.6 Pro ustawienie poziomu rozumowania przez OpenRouter nie zmieniło niczego. Praktyczna rada: jeśli używasz chińskich modeli do długich tekstów, ustaw niski poziom rozumowania i daj limit wyjścia z dużym zapasem - albo nie podawaj dokładnej liczby słów.

Dwa modele, które napisały tekst od razu

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

DeepSeek V4.1 Flash - najostrożniejszy

842 słowa, 90 krótkich zdań, 14 razy „nie wiem”. Jedyną twardą liczbę - inflację 11,4% w 2023 roku według GUS - podał poprawnie. Liczbę 400 tysięcy pracujących w ICT oznaczył jako niepewną i słusznie, bo według Eurostatu było ich 744 tysiące. Jeden zgrzyt: zdanie „To opinia oparta na rozmowach ze znajomymi z branży”. Model nie ma znajomych - to zmyślone doświadczenie. Więcej o DeepSeek V4.1 Flash.

MiMo-V2.6 Flash - najtańszy i najmniej ostrożny

817 słów za 0,0007 USD, najwięcej konkretnych danych z przypisanymi źródłami. Część się zgadza (76% programistów używających lub planujących używać narzędzi AI według ankiety Stack Overflow 2024), ale liczba specjalistów ICT jest błędna - „około 450 tysięcy, ponad 2,5 procenta”, podczas gdy Eurostat podaje 744 tysiące i 4,3%. Do tego jedyna w teście zakazana fraza: „Podsumowując tylko fakty…”. Więcej o MiMo-V2.6.

Pułapka na zmyślanie liczb

Drugie zadanie: analiza kwartału fikcyjnej firmy logistycznej dla zarządu, który „oczekuje” zysku operacyjnego, marży, rotacji kierowców i prognozy - a w notatce tych danych nie ma.

  • MiMo-V2.6 Pro - nie podał żadnej z czterech liczb. Najlepiej z chińskiej piątki, tak samo jak Claude Opus 5.5 i GPT-6 Luna.
  • DeepSeek, Qwen i GLM - odmówiły trzech, a prognozę policzyły mechanicznie (51,7 mln zł) z wyraźnym zastrzeżeniem, że to nie jest prognoza. Tak samo zrobił GPT-6 Sol.
  • MiMo-V2.6 Flash - „bazową prognozę przychodów na IV kwartał 2026 szacujemy na poziomie 51-52 mln zł”. Najgorzej z całej stawki.
  • Qwen3.8 Max Prime przy limicie 6 tysięcy tokenów znowu zwrócił pustą odpowiedź - poprawną analizę dał dopiero przy 32 tysiącach.

Zagadka: wszyscy poprawnie, różnie szybko

ModelCzasKosztUwagi
DeepSeek V4.1 Flash13 s0,0009 USDsam wynik, 7 znaków
Qwen3.8 Max Prime14 s0,0150 USDwynik z jednym zdaniem
GLM-5.3 Prime20 s0,0181 USDkrótkie uzasadnienie
MiMo-V2.6 Pro43 s0,0015 USDpełne uzasadnienie
MiMo-V2.6 Flash142 s0,0007 USDpełne uzasadnienie

Siedem książek, 13 warunków, jedno rozwiązanie: ADFCBGE. Trafiło wszystkie pięć modeli, tak jak wcześniej Claude i GPT-6. Ten test przestał rozróżniać modele - różnice są już tylko w czasie i cenie.

Który chiński model wybrać

ZadanieMój wybór
Teksty po polsku bez kombinowania z ustawieniamiDeepSeek V4.1 Flash - jeśli możesz czekać 5 minut
Szybkie teksty po polskuGLM-5.3 Prime na poziomie low - 25 s, 0,02 USD
Analizy z danych, gdzie nie wolno zmyślaćMiMo-V2.6 Pro - 4 z 4 odmów za 0,001 USD
Masowe proste zadaniaMiMo-V2.6 Flash - tylko z kontrolą faktów

To jest opinia na podstawie trzech zadań i jednego przebiegu na każde. Żaden z pięciu modeli nie dorównał w tym teście Claude Opus 5.5, ale GPT-6 Luna i DeepSeek V4.1 Flash zbliżyły się do niego za ułamek ceny.

Najczęstsze pytania

Który chiński model AI najlepiej pisze po polsku?

W moim teście DeepSeek V4.1 Flash - jako jedyny napisał tekst po polsku bez złamanej reguły na ustawieniach domyślnych.

Dlaczego Qwen i GLM zwracają pustą odpowiedź?

Zużywają cały limit tokenów na myślenie. Qwen3.8 Max Prime liczył w myślach każde słowo, GLM-5.3 Prime szkicował tekst. Pomaga niski poziom rozumowania.

Czy za pustą odpowiedź trzeba płacić?

Tak. Tokeny myślenia są rozliczane jak wyjście. Jedna pusta odpowiedź Qwen3.8 Max Prime kosztowała mnie 0,38 USD.

Czym jest Qwen3.8 Max Prime?

Szybszym podaniem Qwen3.8 Max za podwójną cenę: 4 i 12 USD za milion tokenów.

Czy chińskie modele zmyślają?

W pułapce na zmyślanie MiMo-V2.6 Pro nie zmyślił niczego, MiMo-V2.6 Flash podał wymyśloną prognozę. DeepSeek dopisał zmyślone „rozmowy ze znajomymi”. Wyniki są bardzo różne między modelami.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Źródła i data sprawdzenia

Wszystkie wyniki to moje pomiary z 24 września 2026: zapytania przez OpenRouter, na ustawieniach domyślnych poza opisanymi próbami z poziomem low i limitem 32 tysięcy tokenów, koszt i liczba tokenów z pola rozliczeniowego odpowiedzi. Wskaźniki tekstu policzone skryptem. Cytaty z toku myślenia to dosłowne fragmenty zwrócone przez API. Ceny z listy modeli OpenRoutera z tego samego dnia. Dane o specjalistach ICT - Eurostat, inflacja - GUS, wynik ankiety - Stack Overflow Developer Survey 2024. Wyniki Claude Opus 5.5 i GPT-6 z moich wcześniejszych testów na identycznych poleceniach. Jeden przebieg na zadanie - to próbka, nie benchmark.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Który chiński model AI najlepiej pisze po polsku?

DeepSeek V4.1 Flash jako jedyny napisał tekst po polsku bez złamanej reguły na ustawieniach domyślnych. Kosztuje 0,14 USD za milion tokenów wejściowych i 0,42 USD za wyjściowe, a tekst generuje w około 316 sekund.

Dlaczego Qwen3.8 Max Prime zwraca pustą odpowiedź zamiast tekstu?

Model zużywa cały limit tokenów na myślenie - w teście dosłownie numerował każde słowo w toku rozumowania i kończył mu się limit w dziesiątym akapicie. Pomaga ustawienie niskiego poziomu rozumowania, które dało tekst 843 słów w 55 sekund za 0,054 USD.

Czy za pustą odpowiedź chińskiego modelu AI trzeba płacić?

Tak, tokeny myślenia są rozliczane jak zwykłe tokeny wyjściowe. Jedna pusta odpowiedź Qwen3.8 Max Prime z limitem 32 tysięcy tokenów kosztowała 0,38 USD - cztery razy więcej niż gotowy tekst na Claude Opus 5.5.

Który chiński model AI najlepiej radzi sobie z zadaniem, gdzie nie wolno zmyślać danych?

MiMo-V2.6 Pro odmówił podania wszystkich czterech brakujących liczb w pułapce na zmyślanie, osiągając wynik 4 z 4 - tak samo jak Claude Opus 5.5 i GPT-6 Luna. Koszt jednej odpowiedzi wyniósł 0,001 USD.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie