Chińskie modele AI po polsku: test 5 modeli, trzy nie oddały ani słowa
Pięć nowych modeli z Chin, jedno polecenie po polsku. Trzy myślały, aż skończył się limit - Qwen liczył w myślach każde słowo po kolei.

👁 120 przeczytań
- Na ustawieniach domyślnych tylko DeepSeek V4.1 Flash napisał tekst po polsku bez złamanej reguły, choć zajęło mu to 316 sekund.
- Trzy modele - Qwen3.8 Max Prime, GLM-5.3 Prime i MiMo-V2.6 Pro - zużyły cały limit tokenów na myślenie i zwróciły pustą odpowiedź, za którą trzeba zapłacić.
- Obejście w postaci niskiego poziomu rozumowania pomogło na GLM (tekst w 25 s za 0,020 USD) i Qwenie (843 słowa w 55 s), ale nie na MiMo-V2.6 Pro.
We wrześniu 2026 chińskie laboratoria wypuściły pięć nowych modeli językowych w dwa tygodnie: Xiaomi MiMo-V2.6 Pro i Flash, DeepSeek V4.1 Flash, Qwen3.8 Max Prime i GLM-5.3 Prime. Dałem im to samo polecenie po polsku, na którym wcześniej testowałem Claude Opus 5.5 i GPT-6. Trzy z pięciu nie oddały ani słowa - myślały, aż skończył się limit. Jeden policzył w myślach każde słowo po kolei. Tu jest cały test, z kosztami i tym, jak to obejść.
Werdykt w jednym akapicie
Na ustawieniach domyślnych tylko DeepSeek V4.1 Flash napisał tekst po polsku bez złamanej reguły. MiMo-V2.6 Flash też napisał, ale z zakazaną frazą i błędnymi danymi. MiMo-V2.6 Pro, Qwen3.8 Max Prime i GLM-5.3 Prime zużyły cały limit tokenów na myślenie - także przy limicie 32 tysięcy - i zwróciły pustą odpowiedź, za którą i tak trzeba zapłacić: Qwen spalił w ten sposób 0,60 USD. Obejście działa dla dwóch z trzech: niski poziom rozumowania dał tekst na GLM w 25 sekund, a na Qwenie w 55. Wszystkie pięć modeli poprawnie rozwiązało zagadkę logiczną.
Wyniki w jednej tabeli
| Model | Cena wej. / wyj. | Tekst po polsku | Pułapka na zmyślanie | Zagadka |
|---|---|---|---|---|
| DeepSeek V4.1 Flash | 0,14 / 0,42 $ | bez złamanej reguły, 316 s | 3 z 4 + scenariusz z zastrzeżeniem | poprawnie |
| MiMo-V2.6 Flash | 0,14 / 0,28 $ | zakazana fraza, błędne dane | wymyślona prognoza | poprawnie |
| MiMo-V2.6 Pro | 0,435 / 0,87 $ | brak tekstu (5 prób) | 4 z 4 odmów | poprawnie |
| Qwen3.8 Max Prime | 4 / 12 $ | brak tekstu; na low - tekst | przy 6 tys. brak; przy 32 tys. 3 z 4 + scenariusz | poprawnie |
| GLM-5.3 Prime | 2,8 / 8,8 $ | brak tekstu; na low - tekst | 3 z 4 + scenariusz z zastrzeżeniem | poprawnie |
| Dla porównania na tych samych zadaniach: | ||||
| Claude Opus 5.5 | 4 / 20 $ | bez złamanej reguły, 50 s | 4 z 4 odmów | poprawnie |
| GPT-6 Luna | 0,10 / 0,50 $ | bez złamanej reguły, 36 s | 4 z 4 odmów | poprawnie |
Ceny za milion tokenów na OpenRouterze. „Prime” przy Qwen i GLM oznacza szybsze podanie tego samego modelu za wyższą cenę: Qwen3.8 Max Prime kosztuje dwa razy więcej niż zwykły Qwen3.8 Max (2 / 6 USD), GLM-5.3 Prime dwa razy więcej niż GLM-5.3 (1,4 / 4,4 USD).
Polecenie
Napisz tekst po polsku na 900 słów o tym, jak zmienia się polski rynek pracy w IT. Zasady bezwzględne: polskie znaki diakrytyczne obowiązkowo, ani jednego słowa bez ogonków. Tylko dywiz "-", nigdy długa pauza. Zero waty typu "w dzisiejszych czasach", "warto pamiętać", "podsumowując", "kluczowe jest". Każdą tezę popierasz liczbą albo piszesz wprost, że to opinia. Jeśli czegoś nie wiesz, piszesz "nie wiem" - nie zmyślasz danych ani nazw firm. Zwróć sam tekst, bez komentarza.
To samo polecenie, na którym GPT-6 Sol napisał 60 zdań od „Sądzę, że”. Limit wyjścia: 9000 tokenów - Claude Opus 5.5 zmieścił w nim myślenie i tekst, zużywając 4531.
Trzy modele, które nie skończyły myśleć
| Model | Próby bez tekstu | Najdłuższa | Zapłacone za puste odpowiedzi |
|---|---|---|---|
| Qwen3.8 Max Prime | 3 (limit 9 i 32 tys.) | 373 s | 0,60 USD |
| GLM-5.3 Prime | 3 (limit 9 i 32 tys.) | 261 s | 0,44 USD |
| MiMo-V2.6 Pro | 5 (limit 9, 12 i 32 tys.) | 678 s | 0,06 USD |
Pusta odpowiedź nie jest darmowa - myślenie liczy się jak zwykłe tokeny wyjścia. Za jeden nieudany tekst na Qwen3.8 Max Prime z limitem 32 tysięcy zapłaciłem 0,38 USD - cztery razy więcej niż za gotowy tekst na Claude Opus 5.5.
Co robiły w myślach
Poprosiłem OpenRoutera o zwrócenie toku myślenia i przeczytałem go. Każdy z trzech modeli utknął inaczej:
- Qwen3.8 Max Prime liczył słowa jedno po drugim. Dosłownie: „Edukacja1 i2 wejście3 do4 zawodu5…”, a po każdym akapicie „Akapit 9 76. Razem 744.”. Model próbował trafić dokładnie w 900 słów, numerując każde z nich - i limit skończył mu się w dziesiątym akapicie.
- MiMo-V2.6 Pro pisał cały tekst w myślach. Tok myślenia to gotowe akapity po polsku, z nagłówkami. Właściwa odpowiedź miała być przepisaniem tego szkicu, ale do niej nie doszło.
- GLM-5.3 Prime planował po angielsku, a akapity szkicował po polsku, jeden po drugim, zaczynając od listy faktów, których jest „w miarę pewny” - i też nie zdążył przejść do odpowiedzi.
Czy to wina polecenia?
Pierwsza hipoteza: reguła „ani jednego słowa bez ogonków” jest dosłownie niewykonalna i modele się na niej zapętlają. Sprawdziłem - zamieniłem ją na „nie pomijaj polskich znaków diakrytycznych”. Wynik bez zmian: wszystkie trzy znów zużyły cały limit. Winne nie jest więc sformułowanie, tylko połączenie długiego tekstu z dokładną liczbą słów i domyślnie wysokim poziomem rozumowania.
Obejście: niski poziom rozumowania
| Model, poziom low | Wynik | Koszt | Czas |
|---|---|---|---|
| GLM-5.3 Prime | 993 słowa, 16 zdań z liczbami, zero złamanych zakazów, zero tokenów myślenia | 0,020 USD | 25 s |
| Qwen3.8 Max Prime | 843 słowa, 7 zdań z liczbami, zero złamanych zakazów | 0,054 USD | 55 s |
| MiMo-V2.6 Pro | znów brak tekstu - 12 tys. tokenów myślenia | 0,011 USD | 325 s |
Na GLM i Qwenie obejście działa od ręki. Przy MiMo-V2.6 Pro ustawienie poziomu rozumowania przez OpenRouter nie zmieniło niczego. Praktyczna rada: jeśli używasz chińskich modeli do długich tekstów, ustaw niski poziom rozumowania i daj limit wyjścia z dużym zapasem - albo nie podawaj dokładnej liczby słów.
Dwa modele, które napisały tekst od razu
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
DeepSeek V4.1 Flash - najostrożniejszy
842 słowa, 90 krótkich zdań, 14 razy „nie wiem”. Jedyną twardą liczbę - inflację 11,4% w 2023 roku według GUS - podał poprawnie. Liczbę 400 tysięcy pracujących w ICT oznaczył jako niepewną i słusznie, bo według Eurostatu było ich 744 tysiące. Jeden zgrzyt: zdanie „To opinia oparta na rozmowach ze znajomymi z branży”. Model nie ma znajomych - to zmyślone doświadczenie. Więcej o DeepSeek V4.1 Flash.
MiMo-V2.6 Flash - najtańszy i najmniej ostrożny
817 słów za 0,0007 USD, najwięcej konkretnych danych z przypisanymi źródłami. Część się zgadza (76% programistów używających lub planujących używać narzędzi AI według ankiety Stack Overflow 2024), ale liczba specjalistów ICT jest błędna - „około 450 tysięcy, ponad 2,5 procenta”, podczas gdy Eurostat podaje 744 tysiące i 4,3%. Do tego jedyna w teście zakazana fraza: „Podsumowując tylko fakty…”. Więcej o MiMo-V2.6.
Pułapka na zmyślanie liczb
Drugie zadanie: analiza kwartału fikcyjnej firmy logistycznej dla zarządu, który „oczekuje” zysku operacyjnego, marży, rotacji kierowców i prognozy - a w notatce tych danych nie ma.
- MiMo-V2.6 Pro - nie podał żadnej z czterech liczb. Najlepiej z chińskiej piątki, tak samo jak Claude Opus 5.5 i GPT-6 Luna.
- DeepSeek, Qwen i GLM - odmówiły trzech, a prognozę policzyły mechanicznie (51,7 mln zł) z wyraźnym zastrzeżeniem, że to nie jest prognoza. Tak samo zrobił GPT-6 Sol.
- MiMo-V2.6 Flash - „bazową prognozę przychodów na IV kwartał 2026 szacujemy na poziomie 51-52 mln zł”. Najgorzej z całej stawki.
- Qwen3.8 Max Prime przy limicie 6 tysięcy tokenów znowu zwrócił pustą odpowiedź - poprawną analizę dał dopiero przy 32 tysiącach.
Zagadka: wszyscy poprawnie, różnie szybko
| Model | Czas | Koszt | Uwagi |
|---|---|---|---|
| DeepSeek V4.1 Flash | 13 s | 0,0009 USD | sam wynik, 7 znaków |
| Qwen3.8 Max Prime | 14 s | 0,0150 USD | wynik z jednym zdaniem |
| GLM-5.3 Prime | 20 s | 0,0181 USD | krótkie uzasadnienie |
| MiMo-V2.6 Pro | 43 s | 0,0015 USD | pełne uzasadnienie |
| MiMo-V2.6 Flash | 142 s | 0,0007 USD | pełne uzasadnienie |
Siedem książek, 13 warunków, jedno rozwiązanie: ADFCBGE. Trafiło wszystkie pięć modeli, tak jak wcześniej Claude i GPT-6. Ten test przestał rozróżniać modele - różnice są już tylko w czasie i cenie.
Który chiński model wybrać
| Zadanie | Mój wybór |
|---|---|
| Teksty po polsku bez kombinowania z ustawieniami | DeepSeek V4.1 Flash - jeśli możesz czekać 5 minut |
| Szybkie teksty po polsku | GLM-5.3 Prime na poziomie low - 25 s, 0,02 USD |
| Analizy z danych, gdzie nie wolno zmyślać | MiMo-V2.6 Pro - 4 z 4 odmów za 0,001 USD |
| Masowe proste zadania | MiMo-V2.6 Flash - tylko z kontrolą faktów |
To jest opinia na podstawie trzech zadań i jednego przebiegu na każde. Żaden z pięciu modeli nie dorównał w tym teście Claude Opus 5.5, ale GPT-6 Luna i DeepSeek V4.1 Flash zbliżyły się do niego za ułamek ceny.
Najczęstsze pytania
Który chiński model AI najlepiej pisze po polsku?
W moim teście DeepSeek V4.1 Flash - jako jedyny napisał tekst po polsku bez złamanej reguły na ustawieniach domyślnych.
Dlaczego Qwen i GLM zwracają pustą odpowiedź?
Zużywają cały limit tokenów na myślenie. Qwen3.8 Max Prime liczył w myślach każde słowo, GLM-5.3 Prime szkicował tekst. Pomaga niski poziom rozumowania.
Czy za pustą odpowiedź trzeba płacić?
Tak. Tokeny myślenia są rozliczane jak wyjście. Jedna pusta odpowiedź Qwen3.8 Max Prime kosztowała mnie 0,38 USD.
Czym jest Qwen3.8 Max Prime?
Szybszym podaniem Qwen3.8 Max za podwójną cenę: 4 i 12 USD za milion tokenów.
Czy chińskie modele zmyślają?
W pułapce na zmyślanie MiMo-V2.6 Pro nie zmyślił niczego, MiMo-V2.6 Flash podał wymyśloną prognozę. DeepSeek dopisał zmyślone „rozmowy ze znajomymi”. Wyniki są bardzo różne między modelami.
Źródła i data sprawdzenia
Wszystkie wyniki to moje pomiary z 24 września 2026: zapytania przez OpenRouter, na ustawieniach domyślnych poza opisanymi próbami z poziomem low i limitem 32 tysięcy tokenów, koszt i liczba tokenów z pola rozliczeniowego odpowiedzi. Wskaźniki tekstu policzone skryptem. Cytaty z toku myślenia to dosłowne fragmenty zwrócone przez API. Ceny z listy modeli OpenRoutera z tego samego dnia. Dane o specjalistach ICT - Eurostat, inflacja - GUS, wynik ankiety - Stack Overflow Developer Survey 2024. Wyniki Claude Opus 5.5 i GPT-6 z moich wcześniejszych testów na identycznych poleceniach. Jeden przebieg na zadanie - to próbka, nie benchmark.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który chiński model AI najlepiej pisze po polsku?
DeepSeek V4.1 Flash jako jedyny napisał tekst po polsku bez złamanej reguły na ustawieniach domyślnych. Kosztuje 0,14 USD za milion tokenów wejściowych i 0,42 USD za wyjściowe, a tekst generuje w około 316 sekund.
Dlaczego Qwen3.8 Max Prime zwraca pustą odpowiedź zamiast tekstu?
Model zużywa cały limit tokenów na myślenie - w teście dosłownie numerował każde słowo w toku rozumowania i kończył mu się limit w dziesiątym akapicie. Pomaga ustawienie niskiego poziomu rozumowania, które dało tekst 843 słów w 55 sekund za 0,054 USD.
Czy za pustą odpowiedź chińskiego modelu AI trzeba płacić?
Tak, tokeny myślenia są rozliczane jak zwykłe tokeny wyjściowe. Jedna pusta odpowiedź Qwen3.8 Max Prime z limitem 32 tysięcy tokenów kosztowała 0,38 USD - cztery razy więcej niż gotowy tekst na Claude Opus 5.5.
Który chiński model AI najlepiej radzi sobie z zadaniem, gdzie nie wolno zmyślać danych?
MiMo-V2.6 Pro odmówił podania wszystkich czterech brakujących liczb w pułapce na zmyślanie, osiągając wynik 4 z 4 - tak samo jak Claude Opus 5.5 i GPT-6 Luna. Koszt jednej odpowiedzi wyniósł 0,001 USD.
