✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Kimi K3, GLM-5.3, Qwen3.8 Max i DeepSeek po polsku: test 6 zadań

Pięć chińskich modeli, sześć zadań po polsku: mail, korekta, kod, logika, wiedza o Polsce i tłumaczenie. Tabela ocen, czas, tokeny myślenia i koszt każdego modelu przez OpenRoutera, z cytatami z odpowiedzi.

10 min czytania
Logo Kimi, Z.ai, Qwen i DeepSeek - test chińskich modeli po polsku

👁 115 przeczytań

// w skrócie
  • Najlepiej wypadły obie wersje DeepSeeka - V4.1 Flash i V4 Pro zdobyły po 93,3 pkt na 100, wyprzedzając Kimi K3 (89,2), Qwen3.8 Max (82,5) i GLM-5.3 (80,1).
  • Największe różnice między modelami zrobiły zadania językowe: korekta tekstu, tłumaczenie idiomów oraz jedna pusta odpowiedź Qwena, który zużył cały limit 8000 tokenów na myślenie.
  • Cały test sześciu zadań dla pięciu modeli kosztował 0,37 USD, a najtańszy okazał się GLM-5.3 z kosztem 0,0227 USD za osiem zapytań.

Dałem czterem chińskim modelom językowym te same zadania po polsku: Kimi K3 od Moonshot AI, GLM-5.3 od Z.ai, Qwen3.8 Max od Alibaby i DeepSeeka w dwóch wersjach (V4.1 Flash i V4 Pro). Wygrał DeepSeek - obie wersje zdobyły po 93,3 pkt na 100. Kimi K3 był trzeci (89,2 pkt), Qwen czwarty (82,5), GLM ostatni (80,1). Cały test kosztował mnie 0,37 USD, razem z jedną powtórką.

Stan na 3 października 2026

  • Modele: Kimi K3 (16 lipca 2026), GLM-5.3 (14 sierpnia), Qwen3.8 Max w migawce 0902 (2 września), DeepSeek V4.1 Flash (10 września) i DeepSeek V4 Pro 0813.
  • Zadania: pisanie maila, korekta 14 błędów, kod w Pythonie (29 testów), logika (4 pytania), wiedza o Polsce (20 pytań), tłumaczenie z idiomami.
  • Ustawienia: OpenRouter, poziom rozumowania low, limit 8000 tokenów odpowiedzi, jedna próba na zadanie.
  • Najważniejsze: kod i wiedza o Polsce prawie nie różnicują modeli. Różnice robią język, tłumaczenie i jedna pusta odpowiedź Qwena, który zużył cały limit na myślenie.

To jest test do przewodników po markach: Kimi, GLM i Qwen. DeepSeeka dołożyłem jako punkt odniesienia - ma już osobny przewodnik DeepSeek.

Wyniki w jednej tabeli

Zadanie (0-10)Kimi K3GLM-5.3Qwen3.8 MaxDeepSeek V4.1 FlashDeepSeek V4 Pro
Pisanie: mail do zarządcy8,5886,57
Korekta: 14 błędów10 (14/14)8,6 (12/14)10 (14/14)10 (14/14)10 (14/14)
Kod: NIP i odmiana „złoty”10 (29/29)10 (29/29)10 (29/29)10 (29/29)10 (29/29)
Logika: zagadka i kalendarz7,5 (3/4)7,5 (3/4)2,5 (1/4)10 (4/4)10 (4/4)
Wiedza o Polsce: 20 pytań9,5 (19/20)10 (20/20)10 (20/20)10 (20/20)9,5 (19/20)
Tłumaczenie z idiomami8499,59,5
Suma (0-60)53,548,149,55656
Wynik (0-100)89,280,182,593,393,3
Czas 8 zapytań144 s77 s448 s335 s192 s
Tokeny myślenia2 0922 58017 82715 09327 885
Koszt 8 zapytań0,0719 USD0,0227 USD0,1213 USD0,0232 USD0,1198 USD

Wynik w moim teście po polsku (0-100), 3.10.2026

DeepSeek V4.1 Flash93,3
DeepSeek V4 Pro93,3
Kimi K389,2
Qwen3.8 Max82,5
GLM-5.380,1

Czas to suma ośmiu zapytań (sześć zadań, z czego logika i wiedza o Polsce miały po dwie części). Koszt to pole rozliczeniowe zwrócone przez OpenRoutera. Tokeny myślenia to rozumowanie, którego nie widzisz w odpowiedzi, ale za które płacisz.

Jak testowałem

  • Wszystkie zapytania wysłałem 3 października 2026 przez OpenRoutera, z poziomem rozumowania low i limitem 8000 tokenów odpowiedzi. Niski poziom ustawiłem celowo: we wcześniejszym teście chińskich modeli po polsku trzy z pięciu modeli na ustawieniach domyślnych myślały do końca limitu i nie oddały tekstu.
  • Dostawcę przypiąłem do producenta: Kimi K3 u Moonshot AI, GLM-5.3 u Z.ai, Qwen u Alibaby. Wyjątek to DeepSeek - jego własny endpoint na OpenRouterze jest oznaczony jako trenujący na danych z zapytań i moje ustawienia prywatności go blokują. Dlatego V4.1 Flash szedł przez Fireworks, a V4 Pro przez Together.
  • Jedna próba na zadanie, bez poprawiania i bez drugiej szansy. To próbka, a nie benchmark.
  • Kod, logikę i wiedzę oceniłem automatycznie albo według klucza odpowiedzi. Pisanie i tłumaczenie oceniłem sam według rubryki opisanej niżej. To moja ocena, nie sędziów z innych firm jak w rankingu AI do pisania po polsku.

Zadanie 1: mail do zarządcy wspólnoty

Polecenie: mail o niedziałającym od trzech tygodni domofonie, 120-170 słów, ton uprzejmy, ale stanowczy, trzy zakazane frazy, tylko dywiz, na końcu propozycja dnia i godziny wizyty serwisanta, podpis „Piotr Nowak, lokal 14”. Rubryka: 5 punktów za reguły i 5 za język.

  • Kimi K3 (8,5) - najczystsza polszczyzna w stawce, ale 117 słów, czyli poniżej dolnej granicy, a propozycję terminu dopisał pod podpisem, jak postscriptum.
  • GLM-5.3 (8) - spełnił wszystkie reguły, ale zaczął od zdania „zwracam się z ponagleniem sprawy awarii domofonu”, które po polsku nie trzyma się składni, a zdanie o sąsiadce z parteru powtarza tę samą informację dwa razy.
  • Qwen3.8 Max (8) - reguły w porządku, ale zaproponował „czwartek, 3 października, w godzinach 10:00-12:00”. 3 października 2026 to sobota, i do tego dzień testu.
  • DeepSeek V4 Pro (7) - ten sam błąd z czwartkiem 3 października i nie zakończył propozycją: po terminie dopisał jeszcze dwa zdania.
  • DeepSeek V4.1 Flash (6,5) - 112 słów i zdanie „Proponuję, aby serwisanta wpuścić w czwartek”, w którym nie wiadomo, kto ma wpuścić. Trzy razy „Proszę” w trzech zdaniach.

Żaden model nie użył zakazanej frazy ani długiej pauzy. Dwa modele, które pomyliły dzień tygodnia, liczyły chyba według kalendarza 2024 roku - wtedy 3 października wypadał w czwartek.

Zadanie 2: korekta 14 błędów

Krótki tekst z czternastoma błędami: „poszłem”, „wziąść”, „tą książkę”, „w każdym bądź razie”, „bynajmniej” zamiast „przynajmniej”, „półtorej roku”, „spowrotem”, „włanczyłem”, „nie prawda”, „orginalne”, „wogóle” i trzy brakujące przecinki. Kimi K3, Qwen i oba DeepSeeki poprawiły wszystkie czternaście. Qwen i DeepSeeki dodatkowo usunęły pleonazm „wróciłem z powrotem”, czego nie liczyłem.

GLM-5.3 zostawił „W każdym bądź razie” i „bynajmniej do piątku”, a przed „bynajmniej” wstawił przecinek, jakby zdanie było poprawne. W liście poprawek wpisał też punkt, który sam sobie przeczy. To pasuje do wcześniejszych wyników: w teście GLM-5.3 po polsku ten model robił najwięcej błędów językowych z czołówki.

Zadanie 3: kod w Pythonie

Dwie funkcje z polskim kontekstem: walidacja NIP (z myślnikami, spacjami i sumą kontrolną z wagami 6, 5, 7, 2, 3, 4, 5, 6, 7) oraz odmiana słowa „złoty” przy liczbie (1 złoty, 2 złote, 5 złotych, 22 złote, 112 złotych). Uruchomiłem każdą odpowiedź na 29 testach, w tym na pułapkach: NIP z resztą 10, kropki zamiast myślników, 11 i 104 złote.

Wszystkie pięć modeli przeszło 29 z 29. Najszybciej oddał kod GLM-5.3 (4 sekundy, 0 tokenów myślenia), najwolniej DeepSeek V4.1 Flash (81 sekund, prawie 4 tysiące tokenów myślenia). Do takich zadań każdy z nich wystarczy - różnice zobaczysz dopiero przy dłuższej pracy agenta, opisanej w przewodniku AI do programowania.

Zadanie 4: logika i kalendarz

Najpierw zagadka: pięć osób w kolejce na poczcie, pięć miast, osiem warunków. Sprawdziłem skryptem, że ma dokładnie jedno rozwiązanie. Rozwiązały ją wszystkie modele. Potem trzy pytania z datami, liczone od soboty 3 października 2026:

  1. Jaki dzień tygodnia wypada 29 lutego 2028 r.? Odpowiedź: wtorek. Trafili wszyscy, którzy odpowiedzieli.
  2. Ile dni roboczych ma listopad 2026 r. bez polskich świąt? Odpowiedź: 20 (21 dni od poniedziałku do piątku minus 11 listopada, który wypada w środę). Kimi K3 podał 19, GLM-5.3 podał 21 - oba źle policzyły dni od poniedziałku do piątku.
  3. Ile palet będzie w magazynie w poniedziałek 12 października rano? Odpowiedź: 58. Trafili wszyscy, którzy odpowiedzieli.

Qwen3.8 Max nie odpowiedział wcale: zużył wszystkie 8000 tokenów na myślenie i zwrócił pusty tekst po 171 sekundach, za który zapłaciłem 0,048 USD. To ten sam problem co we wrześniu, opisany w tekście gdy AI myśli za długo po polsku. Powtórzyłem to jedno zapytanie z limitem 16 tysięcy: tym razem Qwen myślał 2212 tokenów i odpowiedział poprawnie na wszystkie trzy pytania. W tabeli liczę pierwszą próbę, bo inne modele drugiej szansy nie dostały. Gdyby liczyć powtórkę, Qwen miałby 57 na 60 i wygrałby cały test.

Zadanie 5: wiedza o Polsce

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Dwie serie po 10 pytań. Pierwsza łatwa (województwa, wejście do UE, autor „Lalki”, Rysy, Hala Stulecia, liczba posłów, numer 999, alfabet, pierwszy koronowany król) i jedno pytanie z fałszywym założeniem: „W którym roku Kopernik otrzymał Nagrodę Nobla?”. Wszyscy odpowiedzieli 10 na 10 i wszyscy zauważyli pułapkę.

Druga seria była trudniejsza: obecny prezydent, rzeka w Bydgoszczy, rok wydania „Pana Tadeusza”, „trzecia” Nagroda Nobla Skłodowskiej-Curie, VAT, wiek kandydata na prezydenta, Śniardwy, dwie stolice województwa lubuskiego i liczba gmin. Błędy były dwa i oba dotyczyły prezydenta:

  • Kimi K3: „Andrzej Duda (stan według mojej wiedzy; kadencja kończy się w 2025 r., mogę nie znać wyniku wyborów)”. Błąd, ale z uczciwym zastrzeżeniem.
  • DeepSeek V4 Pro: „Rafał Trzaskowski.” Bez żadnego zastrzeżenia. Prezydentem od 6 sierpnia 2025 jest Karol Nawrocki, co poprawnie podały GLM-5.3, Qwen i DeepSeek V4.1 Flash.

Więcej pytań o polskie realia, także dla modeli spoza Chin, jest w teście czy AI zna Polskę.

Zadanie 6: tłumaczenie z idiomami

Akapit z firmowego newslettera po angielsku z sześcioma idiomami: rocket science, dropping the ball, the elephant in the room, bite the bullet, ballpark figure, touch base. Rubryka: punkt za każdy naturalnie oddany idiom i 4 punkty za płynność.

  • DeepSeek V4.1 Flash i V4 Pro (9,5) - wszystkie idiomy po polsku: „dajemy ciała”, „zawalamy sprawę”, „wziąć byka za rogi”, „orientacyjna liczba dodatkowych etatów”, „ruszmy sprawę z miejsca”.
  • Qwen3.8 Max (9) - też komplet („nie dowozimy”, „złapmy się w poniedziałek”), ale z „onboardowaniem” i „trzema dużymi kontami”, czyli korporacyjnym językiem.
  • Kimi K3 (8) - dobrze „to nie żadna filozofia” i „robimy to byle jak”, ale touch base przetłumaczył jako „Zgadzamy się w poniedziałek”, co zmienia sens.
  • GLM-5.3 (4) - „nie jest jakąś trudną nauką”, „od miesięcy przystajemy na tym temacie” i „zgrubna estimacja”. Pierwsze to kalka, drugie nic nie znaczy, trzecie to anglicyzm z literówką.

Jedna rzecz wspólna: w przekładzie, gdzie nie zakazałem długiej pauzy, wszystkie pięć modeli jej użyło. W mailu, gdzie zakazałem, nie użył żaden. Jeśli chcesz tekstów do wklejenia na stronę, zapisuj tę regułę w poleceniu.

Szybkość, myślenie i koszt

Na poziomie low modele myślą bardzo różnie. GLM-5.3 i Kimi K3 w większości zadań prawie nie myślały (od 0 do kilkudziesięciu tokenów), a dłużej rozumowały tylko nad zagadką. Qwen3.8 Max, DeepSeek V4.1 Flash i V4 Pro myślały przy każdym zadaniu - V4 Pro zużył prawie 28 tysięcy tokenów myślenia na osiem krótkich zadań.

ModelCena wejście / wyjście (USD za 1 mln tokenów)Dostawca w teścieNajdłuższe zapytanie
Kimi K33,00 / 15,00Moonshot AI55 s (zagadka)
GLM-5.31,40 / 4,40Z.ai29 s (zagadka)
Qwen3.8 Max (0902)2,00 / 6,00Alibaba171 s (pusta odpowiedź)
DeepSeek V4.1 Flash0,30 / 1,20Fireworks81 s (kod)
DeepSeek V4 Pro 08131,32 / 3,96Together39 s (kalendarz)

Ceny dostawców, przez których szedł test, odczytane z OpenRoutera 3 października 2026. U samego DeepSeeka oba modele są tańsze (V4.1 Flash 0,15 / 0,60 USD), ale to ten endpoint, który trenuje na zapytaniach. Dlaczego cena na OpenRouterze nie zawsze jest ceną, którą płacisz, opisałem w tekście o cenach dostawców na OpenRouterze.

Najtańszy był GLM-5.3 (0,0227 USD za osiem zapytań) i DeepSeek V4.1 Flash (0,0232 USD). Najdrożej wyszedł Qwen (0,1213 USD), choć Kimi ma wyższą cenę za token - Qwen po prostu wygenerował cztery razy więcej tokenów.

Co z tego wynika

  • Do tekstów po polsku i tłumaczeń wybrałbym DeepSeeka V4.1 Flash: 93,3 pkt za 0,02 USD. Pilnuj tylko długości tekstu, bo pisze krócej, niż prosisz.
  • Kimi K3 pisze najczystszą polszczyzną i prawie nie myśli przy prostych zadaniach, więc jest szybki. Słabszy w liczeniu dni i w idiomach. Więcej w przewodniku Kimi.
  • Qwen3.8 Max jest najlepszy w korekcie i świetny w tłumaczeniu, ale może przemyśleć cały limit i nic nie oddać. Daj mu duży limit tokenów. Więcej w przewodniku Qwen.
  • GLM-5.3 jest najszybszy i najtańszy, bezbłędny w kodzie, ale najsłabszy po polsku. Dobry do programowania, nie do tekstów bez korekty. Więcej w przewodniku GLM.

To moja opinia na podstawie jednej próby na zadanie. Zachodnie modele na podobnych zadaniach porównałem w tekście o mniej znanych modelach z czołówki.

Najczęstsze pytania

Który chiński model AI najlepiej pisze po polsku?

W moim teście z 3 października 2026 najwięcej punktów zdobyły oba DeepSeeki (93,3 na 100), a najczystszą polszczyzną w mailu pisał Kimi K3. GLM-5.3 był najsłabszy w korekcie i tłumaczeniu.

Kimi K3 czy DeepSeek?

DeepSeek V4.1 Flash wypadł lepiej (93,3 wobec 89,2 pkt) i kosztował trzy razy mniej. Kimi K3 był szybszy i pisał ładniejszym językiem, ale pomylił się w liczeniu dni roboczych i w jednym idiomie.

Qwen czy DeepSeek?

Qwen3.8 Max był równie dobry w korekcie i wiedzy, ale raz zużył cały limit na myślenie i nie odpowiedział. DeepSeek odpowiadał zawsze. Przy powtórce z wyższym limitem Qwen miałby najlepszy wynik w teście.

Czy chińskie modele znają polskie realia?

Proste fakty tak: w łatwej serii wszystkie pięć modeli odpowiedziało 10 na 10. Błędy dotyczyły bieżących wydarzeń - Kimi K3 podał Andrzeja Dudę jako prezydenta, a DeepSeek V4 Pro Rafała Trzaskowskiego.

Ile kosztuje test chińskich modeli przez API?

Osiem zapytań na model kosztowało od 0,0227 USD (GLM-5.3) do 0,1213 USD (Qwen3.8 Max). Cały test pięciu modeli z powtórką Qwena zamknął się w 0,37 USD.

Dlaczego Qwen zwrócił pustą odpowiedź?

Bo wszystkie 8000 tokenów odpowiedzi zużył na rozumowanie, mimo poziomu low. Za puste zapytanie i tak płacisz - u mnie 0,048 USD. Pomaga wyższy limit tokenów albo budżet myślenia w natywnym API Alibaby.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

Wszystkie wyniki to moje pomiary z 3 października 2026 przez OpenRouter: odpowiedzi, czasy, liczba tokenów i koszt z pola rozliczeniowego API. Kod uruchomiłem lokalnie na 29 testach, zagadkę sprawdziłem skryptem przeszukującym wszystkie 14 400 układów. Ceny i dostawcy: lista modeli i endpointów OpenRoutera z tego samego dnia. Daty premier: karty modeli na Hugging Face i strony producentów, opisane w przewodnikach Kimi, GLM i Qwen.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›