Kimi K3, GLM-5.3, Qwen3.8 Max i DeepSeek po polsku: test 6 zadań
Pięć chińskich modeli, sześć zadań po polsku: mail, korekta, kod, logika, wiedza o Polsce i tłumaczenie. Tabela ocen, czas, tokeny myślenia i koszt każdego modelu przez OpenRoutera, z cytatami z odpowiedzi.

👁 115 przeczytań
- Najlepiej wypadły obie wersje DeepSeeka - V4.1 Flash i V4 Pro zdobyły po 93,3 pkt na 100, wyprzedzając Kimi K3 (89,2), Qwen3.8 Max (82,5) i GLM-5.3 (80,1).
- Największe różnice między modelami zrobiły zadania językowe: korekta tekstu, tłumaczenie idiomów oraz jedna pusta odpowiedź Qwena, który zużył cały limit 8000 tokenów na myślenie.
- Cały test sześciu zadań dla pięciu modeli kosztował 0,37 USD, a najtańszy okazał się GLM-5.3 z kosztem 0,0227 USD za osiem zapytań.
Dałem czterem chińskim modelom językowym te same zadania po polsku: Kimi K3 od Moonshot AI, GLM-5.3 od Z.ai, Qwen3.8 Max od Alibaby i DeepSeeka w dwóch wersjach (V4.1 Flash i V4 Pro). Wygrał DeepSeek - obie wersje zdobyły po 93,3 pkt na 100. Kimi K3 był trzeci (89,2 pkt), Qwen czwarty (82,5), GLM ostatni (80,1). Cały test kosztował mnie 0,37 USD, razem z jedną powtórką.
Stan na 3 października 2026
- Modele: Kimi K3 (16 lipca 2026), GLM-5.3 (14 sierpnia), Qwen3.8 Max w migawce 0902 (2 września), DeepSeek V4.1 Flash (10 września) i DeepSeek V4 Pro 0813.
- Zadania: pisanie maila, korekta 14 błędów, kod w Pythonie (29 testów), logika (4 pytania), wiedza o Polsce (20 pytań), tłumaczenie z idiomami.
- Ustawienia: OpenRouter, poziom rozumowania low, limit 8000 tokenów odpowiedzi, jedna próba na zadanie.
- Najważniejsze: kod i wiedza o Polsce prawie nie różnicują modeli. Różnice robią język, tłumaczenie i jedna pusta odpowiedź Qwena, który zużył cały limit na myślenie.
To jest test do przewodników po markach: Kimi, GLM i Qwen. DeepSeeka dołożyłem jako punkt odniesienia - ma już osobny przewodnik DeepSeek.
Wyniki w jednej tabeli
| Zadanie (0-10) | Kimi K3 | GLM-5.3 | Qwen3.8 Max | DeepSeek V4.1 Flash | DeepSeek V4 Pro |
|---|---|---|---|---|---|
| Pisanie: mail do zarządcy | 8,5 | 8 | 8 | 6,5 | 7 |
| Korekta: 14 błędów | 10 (14/14) | 8,6 (12/14) | 10 (14/14) | 10 (14/14) | 10 (14/14) |
| Kod: NIP i odmiana „złoty” | 10 (29/29) | 10 (29/29) | 10 (29/29) | 10 (29/29) | 10 (29/29) |
| Logika: zagadka i kalendarz | 7,5 (3/4) | 7,5 (3/4) | 2,5 (1/4) | 10 (4/4) | 10 (4/4) |
| Wiedza o Polsce: 20 pytań | 9,5 (19/20) | 10 (20/20) | 10 (20/20) | 10 (20/20) | 9,5 (19/20) |
| Tłumaczenie z idiomami | 8 | 4 | 9 | 9,5 | 9,5 |
| Suma (0-60) | 53,5 | 48,1 | 49,5 | 56 | 56 |
| Wynik (0-100) | 89,2 | 80,1 | 82,5 | 93,3 | 93,3 |
| Czas 8 zapytań | 144 s | 77 s | 448 s | 335 s | 192 s |
| Tokeny myślenia | 2 092 | 2 580 | 17 827 | 15 093 | 27 885 |
| Koszt 8 zapytań | 0,0719 USD | 0,0227 USD | 0,1213 USD | 0,0232 USD | 0,1198 USD |
Wynik w moim teście po polsku (0-100), 3.10.2026
Czas to suma ośmiu zapytań (sześć zadań, z czego logika i wiedza o Polsce miały po dwie części). Koszt to pole rozliczeniowe zwrócone przez OpenRoutera. Tokeny myślenia to rozumowanie, którego nie widzisz w odpowiedzi, ale za które płacisz.
Jak testowałem
- Wszystkie zapytania wysłałem 3 października 2026 przez OpenRoutera, z poziomem rozumowania
lowi limitem 8000 tokenów odpowiedzi. Niski poziom ustawiłem celowo: we wcześniejszym teście chińskich modeli po polsku trzy z pięciu modeli na ustawieniach domyślnych myślały do końca limitu i nie oddały tekstu. - Dostawcę przypiąłem do producenta: Kimi K3 u Moonshot AI, GLM-5.3 u Z.ai, Qwen u Alibaby. Wyjątek to DeepSeek - jego własny endpoint na OpenRouterze jest oznaczony jako trenujący na danych z zapytań i moje ustawienia prywatności go blokują. Dlatego V4.1 Flash szedł przez Fireworks, a V4 Pro przez Together.
- Jedna próba na zadanie, bez poprawiania i bez drugiej szansy. To próbka, a nie benchmark.
- Kod, logikę i wiedzę oceniłem automatycznie albo według klucza odpowiedzi. Pisanie i tłumaczenie oceniłem sam według rubryki opisanej niżej. To moja ocena, nie sędziów z innych firm jak w rankingu AI do pisania po polsku.
Zadanie 1: mail do zarządcy wspólnoty
Polecenie: mail o niedziałającym od trzech tygodni domofonie, 120-170 słów, ton uprzejmy, ale stanowczy, trzy zakazane frazy, tylko dywiz, na końcu propozycja dnia i godziny wizyty serwisanta, podpis „Piotr Nowak, lokal 14”. Rubryka: 5 punktów za reguły i 5 za język.
- Kimi K3 (8,5) - najczystsza polszczyzna w stawce, ale 117 słów, czyli poniżej dolnej granicy, a propozycję terminu dopisał pod podpisem, jak postscriptum.
- GLM-5.3 (8) - spełnił wszystkie reguły, ale zaczął od zdania „zwracam się z ponagleniem sprawy awarii domofonu”, które po polsku nie trzyma się składni, a zdanie o sąsiadce z parteru powtarza tę samą informację dwa razy.
- Qwen3.8 Max (8) - reguły w porządku, ale zaproponował „czwartek, 3 października, w godzinach 10:00-12:00”. 3 października 2026 to sobota, i do tego dzień testu.
- DeepSeek V4 Pro (7) - ten sam błąd z czwartkiem 3 października i nie zakończył propozycją: po terminie dopisał jeszcze dwa zdania.
- DeepSeek V4.1 Flash (6,5) - 112 słów i zdanie „Proponuję, aby serwisanta wpuścić w czwartek”, w którym nie wiadomo, kto ma wpuścić. Trzy razy „Proszę” w trzech zdaniach.
Żaden model nie użył zakazanej frazy ani długiej pauzy. Dwa modele, które pomyliły dzień tygodnia, liczyły chyba według kalendarza 2024 roku - wtedy 3 października wypadał w czwartek.
Zadanie 2: korekta 14 błędów
Krótki tekst z czternastoma błędami: „poszłem”, „wziąść”, „tą książkę”, „w każdym bądź razie”, „bynajmniej” zamiast „przynajmniej”, „półtorej roku”, „spowrotem”, „włanczyłem”, „nie prawda”, „orginalne”, „wogóle” i trzy brakujące przecinki. Kimi K3, Qwen i oba DeepSeeki poprawiły wszystkie czternaście. Qwen i DeepSeeki dodatkowo usunęły pleonazm „wróciłem z powrotem”, czego nie liczyłem.
GLM-5.3 zostawił „W każdym bądź razie” i „bynajmniej do piątku”, a przed „bynajmniej” wstawił przecinek, jakby zdanie było poprawne. W liście poprawek wpisał też punkt, który sam sobie przeczy. To pasuje do wcześniejszych wyników: w teście GLM-5.3 po polsku ten model robił najwięcej błędów językowych z czołówki.
Zadanie 3: kod w Pythonie
Dwie funkcje z polskim kontekstem: walidacja NIP (z myślnikami, spacjami i sumą kontrolną z wagami 6, 5, 7, 2, 3, 4, 5, 6, 7) oraz odmiana słowa „złoty” przy liczbie (1 złoty, 2 złote, 5 złotych, 22 złote, 112 złotych). Uruchomiłem każdą odpowiedź na 29 testach, w tym na pułapkach: NIP z resztą 10, kropki zamiast myślników, 11 i 104 złote.
Wszystkie pięć modeli przeszło 29 z 29. Najszybciej oddał kod GLM-5.3 (4 sekundy, 0 tokenów myślenia), najwolniej DeepSeek V4.1 Flash (81 sekund, prawie 4 tysiące tokenów myślenia). Do takich zadań każdy z nich wystarczy - różnice zobaczysz dopiero przy dłuższej pracy agenta, opisanej w przewodniku AI do programowania.
Zadanie 4: logika i kalendarz
Najpierw zagadka: pięć osób w kolejce na poczcie, pięć miast, osiem warunków. Sprawdziłem skryptem, że ma dokładnie jedno rozwiązanie. Rozwiązały ją wszystkie modele. Potem trzy pytania z datami, liczone od soboty 3 października 2026:
- Jaki dzień tygodnia wypada 29 lutego 2028 r.? Odpowiedź: wtorek. Trafili wszyscy, którzy odpowiedzieli.
- Ile dni roboczych ma listopad 2026 r. bez polskich świąt? Odpowiedź: 20 (21 dni od poniedziałku do piątku minus 11 listopada, który wypada w środę). Kimi K3 podał 19, GLM-5.3 podał 21 - oba źle policzyły dni od poniedziałku do piątku.
- Ile palet będzie w magazynie w poniedziałek 12 października rano? Odpowiedź: 58. Trafili wszyscy, którzy odpowiedzieli.
Qwen3.8 Max nie odpowiedział wcale: zużył wszystkie 8000 tokenów na myślenie i zwrócił pusty tekst po 171 sekundach, za który zapłaciłem 0,048 USD. To ten sam problem co we wrześniu, opisany w tekście gdy AI myśli za długo po polsku. Powtórzyłem to jedno zapytanie z limitem 16 tysięcy: tym razem Qwen myślał 2212 tokenów i odpowiedział poprawnie na wszystkie trzy pytania. W tabeli liczę pierwszą próbę, bo inne modele drugiej szansy nie dostały. Gdyby liczyć powtórkę, Qwen miałby 57 na 60 i wygrałby cały test.
Zadanie 5: wiedza o Polsce
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Dwie serie po 10 pytań. Pierwsza łatwa (województwa, wejście do UE, autor „Lalki”, Rysy, Hala Stulecia, liczba posłów, numer 999, alfabet, pierwszy koronowany król) i jedno pytanie z fałszywym założeniem: „W którym roku Kopernik otrzymał Nagrodę Nobla?”. Wszyscy odpowiedzieli 10 na 10 i wszyscy zauważyli pułapkę.
Druga seria była trudniejsza: obecny prezydent, rzeka w Bydgoszczy, rok wydania „Pana Tadeusza”, „trzecia” Nagroda Nobla Skłodowskiej-Curie, VAT, wiek kandydata na prezydenta, Śniardwy, dwie stolice województwa lubuskiego i liczba gmin. Błędy były dwa i oba dotyczyły prezydenta:
- Kimi K3: „Andrzej Duda (stan według mojej wiedzy; kadencja kończy się w 2025 r., mogę nie znać wyniku wyborów)”. Błąd, ale z uczciwym zastrzeżeniem.
- DeepSeek V4 Pro: „Rafał Trzaskowski.” Bez żadnego zastrzeżenia. Prezydentem od 6 sierpnia 2025 jest Karol Nawrocki, co poprawnie podały GLM-5.3, Qwen i DeepSeek V4.1 Flash.
Więcej pytań o polskie realia, także dla modeli spoza Chin, jest w teście czy AI zna Polskę.
Zadanie 6: tłumaczenie z idiomami
Akapit z firmowego newslettera po angielsku z sześcioma idiomami: rocket science, dropping the ball, the elephant in the room, bite the bullet, ballpark figure, touch base. Rubryka: punkt za każdy naturalnie oddany idiom i 4 punkty za płynność.
- DeepSeek V4.1 Flash i V4 Pro (9,5) - wszystkie idiomy po polsku: „dajemy ciała”, „zawalamy sprawę”, „wziąć byka za rogi”, „orientacyjna liczba dodatkowych etatów”, „ruszmy sprawę z miejsca”.
- Qwen3.8 Max (9) - też komplet („nie dowozimy”, „złapmy się w poniedziałek”), ale z „onboardowaniem” i „trzema dużymi kontami”, czyli korporacyjnym językiem.
- Kimi K3 (8) - dobrze „to nie żadna filozofia” i „robimy to byle jak”, ale touch base przetłumaczył jako „Zgadzamy się w poniedziałek”, co zmienia sens.
- GLM-5.3 (4) - „nie jest jakąś trudną nauką”, „od miesięcy przystajemy na tym temacie” i „zgrubna estimacja”. Pierwsze to kalka, drugie nic nie znaczy, trzecie to anglicyzm z literówką.
Jedna rzecz wspólna: w przekładzie, gdzie nie zakazałem długiej pauzy, wszystkie pięć modeli jej użyło. W mailu, gdzie zakazałem, nie użył żaden. Jeśli chcesz tekstów do wklejenia na stronę, zapisuj tę regułę w poleceniu.
Szybkość, myślenie i koszt
Na poziomie low modele myślą bardzo różnie. GLM-5.3 i Kimi K3 w większości zadań prawie nie myślały (od 0 do kilkudziesięciu tokenów), a dłużej rozumowały tylko nad zagadką. Qwen3.8 Max, DeepSeek V4.1 Flash i V4 Pro myślały przy każdym zadaniu - V4 Pro zużył prawie 28 tysięcy tokenów myślenia na osiem krótkich zadań.
| Model | Cena wejście / wyjście (USD za 1 mln tokenów) | Dostawca w teście | Najdłuższe zapytanie |
|---|---|---|---|
| Kimi K3 | 3,00 / 15,00 | Moonshot AI | 55 s (zagadka) |
| GLM-5.3 | 1,40 / 4,40 | Z.ai | 29 s (zagadka) |
| Qwen3.8 Max (0902) | 2,00 / 6,00 | Alibaba | 171 s (pusta odpowiedź) |
| DeepSeek V4.1 Flash | 0,30 / 1,20 | Fireworks | 81 s (kod) |
| DeepSeek V4 Pro 0813 | 1,32 / 3,96 | Together | 39 s (kalendarz) |
Ceny dostawców, przez których szedł test, odczytane z OpenRoutera 3 października 2026. U samego DeepSeeka oba modele są tańsze (V4.1 Flash 0,15 / 0,60 USD), ale to ten endpoint, który trenuje na zapytaniach. Dlaczego cena na OpenRouterze nie zawsze jest ceną, którą płacisz, opisałem w tekście o cenach dostawców na OpenRouterze.
Najtańszy był GLM-5.3 (0,0227 USD za osiem zapytań) i DeepSeek V4.1 Flash (0,0232 USD). Najdrożej wyszedł Qwen (0,1213 USD), choć Kimi ma wyższą cenę za token - Qwen po prostu wygenerował cztery razy więcej tokenów.
Co z tego wynika
- Do tekstów po polsku i tłumaczeń wybrałbym DeepSeeka V4.1 Flash: 93,3 pkt za 0,02 USD. Pilnuj tylko długości tekstu, bo pisze krócej, niż prosisz.
- Kimi K3 pisze najczystszą polszczyzną i prawie nie myśli przy prostych zadaniach, więc jest szybki. Słabszy w liczeniu dni i w idiomach. Więcej w przewodniku Kimi.
- Qwen3.8 Max jest najlepszy w korekcie i świetny w tłumaczeniu, ale może przemyśleć cały limit i nic nie oddać. Daj mu duży limit tokenów. Więcej w przewodniku Qwen.
- GLM-5.3 jest najszybszy i najtańszy, bezbłędny w kodzie, ale najsłabszy po polsku. Dobry do programowania, nie do tekstów bez korekty. Więcej w przewodniku GLM.
To moja opinia na podstawie jednej próby na zadanie. Zachodnie modele na podobnych zadaniach porównałem w tekście o mniej znanych modelach z czołówki.
Najczęstsze pytania
Który chiński model AI najlepiej pisze po polsku?
W moim teście z 3 października 2026 najwięcej punktów zdobyły oba DeepSeeki (93,3 na 100), a najczystszą polszczyzną w mailu pisał Kimi K3. GLM-5.3 był najsłabszy w korekcie i tłumaczeniu.
Kimi K3 czy DeepSeek?
DeepSeek V4.1 Flash wypadł lepiej (93,3 wobec 89,2 pkt) i kosztował trzy razy mniej. Kimi K3 był szybszy i pisał ładniejszym językiem, ale pomylił się w liczeniu dni roboczych i w jednym idiomie.
Qwen czy DeepSeek?
Qwen3.8 Max był równie dobry w korekcie i wiedzy, ale raz zużył cały limit na myślenie i nie odpowiedział. DeepSeek odpowiadał zawsze. Przy powtórce z wyższym limitem Qwen miałby najlepszy wynik w teście.
Czy chińskie modele znają polskie realia?
Proste fakty tak: w łatwej serii wszystkie pięć modeli odpowiedziało 10 na 10. Błędy dotyczyły bieżących wydarzeń - Kimi K3 podał Andrzeja Dudę jako prezydenta, a DeepSeek V4 Pro Rafała Trzaskowskiego.
Ile kosztuje test chińskich modeli przez API?
Osiem zapytań na model kosztowało od 0,0227 USD (GLM-5.3) do 0,1213 USD (Qwen3.8 Max). Cały test pięciu modeli z powtórką Qwena zamknął się w 0,37 USD.
Dlaczego Qwen zwrócił pustą odpowiedź?
Bo wszystkie 8000 tokenów odpowiedzi zużył na rozumowanie, mimo poziomu low. Za puste zapytanie i tak płacisz - u mnie 0,048 USD. Pomaga wyższy limit tokenów albo budżet myślenia w natywnym API Alibaby.
Źródła i data sprawdzenia
Wszystkie wyniki to moje pomiary z 3 października 2026 przez OpenRouter: odpowiedzi, czasy, liczba tokenów i koszt z pola rozliczeniowego API. Kod uruchomiłem lokalnie na 29 testach, zagadkę sprawdziłem skryptem przeszukującym wszystkie 14 400 układów. Ceny i dostawcy: lista modeli i endpointów OpenRoutera z tego samego dnia. Daty premier: karty modeli na Hugging Face i strony producentów, opisane w przewodnikach Kimi, GLM i Qwen.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
