Chatbot i długi kontekst
Kimi
Kimi K3 zaliczył wszystkie moje zadania po polsku. Płacisz za to czasem oczekiwania.
Kimi to chatbot i model K3 od chińskiego Moonshot AI. W moim protokole z 16.09.2026 przeszedł komplet zadań po polsku (redakcja bez zmiany liczb, tabela z PDF, kod PESEL uruchomiony w piaskownicy), a od lipca nie zgubił ani jednego faktu w cotygodniowym teście kontekstu. Był za to jednym z najwolniejszych modeli w przebiegu, a cennik aplikacji w dolarach nie wyświetla się z Polski.
Piotr Olszewski · aktualizacja 16.09.2026 · 6 min czytania
Przejdź do wnioskuWERDYKT W JEDNYM EKRANIE
Dla kogo tak
Osoby, które wrzucają do czatu długie umowy, raporty i PDF-y po polsku i chcą odpowiedzi z cytatem. W teście kontekstu Kimi K3 znalazł ukryty kod 6 razy na 6 prób przy 8, 32 i 128 tys. tokenów w każdym z 7 przebiegów od 31.07.2026.
Dla kogo nie
Ktoś, kto potrzebuje szybkiej wymiany zdań: na zadaniu z kodem K3 myślał 155 s, na redakcji tekstu 59 s, gdy Claude Opus 5 zrobił to samo w 8 i 6 s. Nie dla osób, które chcą kupić abonament z Polski bez kombinowania z wersją językową strony.
Przy jakim budżecie
API: 3 USD za milion tokenów wejścia i 15 USD za milion wyjścia (0,30 USD przy trafieniu w cache). Aplikacja: plany od 49 do 699 juanów miesięcznie w oficjalnym cenniku; wersja w dolarach przekierowała mnie na stronę chińską, więc cen w USD nie potwierdzam.
zadania zaliczone
Protokół Promptowego z 16.09.2026: redakcja, tabela, kod, kontekst. [3]
czas na zadaniu z kodem
Najwolniejszy wynik przebiegu; Claude Opus 5 potrzebował 8 s. [3]
za milion tokenów API
K3 bez cache; trafienie w cache 0,30 USD. Sprawdzone 16.09.2026. [2]
Czy Kimi działa po polsku
Tak, i to jest mierzalne, a nie deklarowane: wszystkie trzy zadania protokołu są po polsku, a oceniacz sprawdza, czy w odpowiedzi są polskie znaki i czy trzy literówki („przebódowa”, „ostrzga”, „mieszkanca”) zostały poprawione. K3 poprawił wszystkie trzy i nie ruszył żadnej z 18 liczb w tekście, łącznie z zapisem „3 850 000 zł” i godziną 17:30.
Interfejs to inna sprawa. Strona kimi.com otwarta z Polski 16.09.2026 przekierowała mnie na wersję chińską z modelem K2.8 w oknie czatu i menu Language; nie sprawdzałem, czy jest tam polski. Jeśli szukasz „Kimi po polsku”, odpowiedź brzmi: model rozumie i pisze po polsku, interfejs jest chiński lub angielski.
Co zrobił w moim protokole 16.09.2026
Redakcja tekstu urzędowego bez zmiany liczb: zaliczone w 59,3 s. Tabela z warstwy tekstowej PDF do JSON, z dwiema nazwami łamanymi na dwie linie i wierszem bez danych: 8 z 8 wierszy w 8,6 s. Walidator PESEL w Pythonie, uruchomiony w zewnętrznej piaskownicy na 10 wektorach (w tym 31 lutego z poprawną sumą kontrolną i rok 1899): 10 z 10 w 155,1 s.
Ten ostatni czas to 15 s przed limitem 170 s, po którym protokół zapisuje brak odpowiedzi. K3 rozumuje ukrycie przed odpowiedzią i w tym przebiegu był najwolniejszy z siedmiu modeli. Pełny prompt każdego zadania, surowa odpowiedź K3 i identyfikator modelu zwrócony przez API są we wpisie z przebiegiem, żebyś mógł to sprawdzić sam.
Źródło danych: [3]
Test kontekstu: siedem tygodni bez pudła
W cotygodniowym teście „igła w stogu siana” chowam w polskim dokumencie o długości 8, 32 i 128 tys. tokenów jeden kod i proszę o jego podanie, dwa razy na każdą długość. Kimi K3 trafił 6 na 6 w każdym z siedmiu przebiegów od 31.07 do 14.09.2026. Czas przy 128 tys. tokenów: 10,1, 15,4, 15,1, 92, 11,3, 10,9 i 10,2 s; skok do 92 s z 24.08 to jedyna anomalia.
Dla porównania GPT-5.6 Terra w tym samym teście zgubił kod przy 8 tys. tokenów 17.08 i 7.09 oraz przy 128 tys. 7.09, a DeepSeek V4 Pro trafiał 6 na 6 tak jak Kimi. Claude Opus 5 miał w tabeli „brak odpowiedzi” we wszystkich przebiegach. 16.09 sprawdziłem przyczynę: Opus 5 odrzuca każdy dokument dłuższy niż około 2 tys. tokenów jako „treść cybernetyczną”, nawet tekst o ogrodzie botanicznym bez żadnego kodu, u każdego dostawcy w OpenRouterze. Krótkie pytania przechodzą. To klasyfikator Anthropica, nie pamięć modelu, więc od 16.09 w teście kontekstu jest Claude Sonnet 5.
Źródło danych: [4]
Ile to kosztuje naprawdę
Cennik API K3 z 16.09.2026: 3 USD za milion tokenów wejścia bez cache, 0,30 USD z trafieniem w cache, 15 USD za milion tokenów wyjścia. Przez OpenRouter (dostawca Together) ten sam model kosztował tego dnia 2,65 i 13,28 USD. Haczyk: ukryte rozumowanie liczy się jako wyjście. W wywołaniu kontrolnym z limitem 60 tokenów K3 zużył cały limit na myślenie i oddał urwane „Wars” zamiast „Warszawa”.
Aplikacja ma cztery plany w oficjalnym centrum pomocy: Andante 49, Moderato 99, Allegretto 199 i Allegro 699 juanów miesięcznie, ze wspólną pulą kredytów, która nie przechodzi na kolejny miesiąc, i osobnym limitem 5-godzinnym dla Kimi Code. Strona z cenami w dolarach przekierowała mnie na wersję chińską, więc kwot 19-199 USD krążących w sieci nie potwierdzam u źródła.
Źródło danych: [2]
CO KONKRETNIE SPRAWDZIŁEM
Co sprawdziłem, kiedy i co nie zadziałało
Wszystko poniżej ma datę i sposób pomiaru. Nie ma tu wrażeń z „tygodnia używania”, bo takiego tygodnia nie było.
| Co | Jak i kiedy | Wynik |
|---|---|---|
| Redakcja tekstu bez zmiany 18 liczb | protokół v1, 16.09.2026, temperatura 0 | zadziałało zaliczone w 59,3 s: wszystkie liczby, 3 literówki i format [3] |
| Tabela z warstwy tekstowej PDF do JSON | 8 wierszy, dwa łamane, jeden bez danych; 16.09.2026 | zadziałało 8 z 8 wierszy w 8,6 s [3] |
| Kod: walidator PESEL uruchomiony w piaskownicy | 10 wektorów, w tym 31 lutego i rok 1899; 16.09.2026 | zadziałało 10 z 10 w 155,1 s, czyli 15 s przed limitem czasu [3] |
| Igła w stogu siana przy 8, 32 i 128 tys. tokenów | co tydzień od 31.07.2026, 7 przebiegów | zadziałało 6 z 6 w każdym przebiegu; 24.08 czas przy 128 tys. skoczył do 92 s [4] |
| Cennik aplikacji w dolarach | kimi.com/membership/pricing, 16.09.2026 | NIE zadziałało strona przekierowała na wersję chińską; cen w USD nie potwierdzam [1] |
| Odpowiedź przy limicie 60 tokenów | wywołanie kontrolne API, 16.09.2026 | NIE zadziałało cały limit poszedł na ukryte rozumowanie, odpowiedź urwana na „Wars” [2] |
| Transkrypcja polskiego audio, obrazy, wideo | poza protokołem v1 | nie sprawdzałem wynik dopiszę po rozszerzeniu protokołu o audio i obraz |
Zadania są jawne i krótkie, więc to podłoga, nie sufit: model, który je oblewa, na pewno nie poradzi sobie z trudniejszymi; model, który je zalicza, nadal trzeba sprawdzić na własnych dokumentach.
ZMIERZONE, NIE DEKLAROWANE
Wyniki w teście Promptowego
Ten model przeszedł przez stały protokół testowy serwisu (przebieg z 16.09.2026). Te same prompty dostały wszystkie testowane modele, ocena jest automatyczna, a pełny prompt i surowa odpowiedź są do wglądu we wpisie z przebiegiem.
| Zadanie | Wynik | Czas |
|---|---|---|
| Redakcja bez zmiany liczb | zaliczone | 59.3 s |
| Tabela z PDF do JSON | 8/8 wierszy | 8.6 s |
| Kod: walidator PESEL z testami | 10/10 wektorów | 155.1 s |
| Kontekst: igła w stogu siana (przebieg 14.09.2026) | 2/2 przy 8 tys., 2/2 przy 32 tys., 2/2 przy 128 tys. | |
Pełny zapis przebiegu: prompty, surowe odpowiedzi, wersje modeli ↗
RACHUNEK PRZED ZAKUPEM
Koszty i warunki
| Wariant | Stawka | Co z tego wynika |
|---|---|---|
| K3 API: milion tokenów wejścia | 3,00 USD | 0,30 USD przy trafieniu w cache; sprawdzone 16.09.2026 |
| K3 API: milion tokenów wyjścia | 15,00 USD | Ukryte rozumowanie liczy się jako wyjście |
| K3 przez OpenRouter | 2,65 / 13,28 USD | Wejście / wyjście, dostawca Together, 16.09.2026 |
| Aplikacja: Andante / Moderato | 49 / 99 CNY mies. | Wspólna pula kredytów, bez przenoszenia na kolejny miesiąc |
| Aplikacja: Allegretto / Allegro | 199 / 699 CNY mies. | Allegro: rozmowy do miliona tokenów, 4 zadania równolegle |
Ceny sprawdzone 16.09.2026 u źródła. Cennik aplikacji w dolarach nie wyświetlił się z Polski (przekierowanie na wersję chińską), dlatego podaję kwoty w juanach z oficjalnego centrum pomocy.
Te same prompty, temperatura 0, jedno wywołanie na model. Cztery pierwsze modele zaliczyły 10 z 10 wektorów; DeepSeek V4 Pro przekroczył limit 170 s i nie oddał kodu. Pełny zapis we wpisie z przebiegiem. [2]
DWIE REALNE ALTERNATYWY I ROZSTRZYGNIĘCIE
Kimi czy DeepSeek, Kimi czy Claude
Obie alternatywy przeszły ten sam przebieg protokołu 16.09.2026 i ten sam test kontekstu, więc porównuję wynik z wynikiem, nie kartę produktu z kartą produktu.
DeepSeek V4 Pro
Redakcja zaliczona w 40,2 s, tabela 8 z 8 w 24,5 s, kontekst 6 z 6 w każdym przebiegu od lipca. Na zadaniu z kodem nie zdążył: przekroczył limit 170 s i protokół zapisał brak odpowiedzi, gdy Kimi oddał poprawny kod w 155 s. W OpenRouter 1,60 / 3,20 USD za milion tokenów, czyli wejście za 60% ceny K3, a wyjście za jedną czwartą.
Rozstrzygnięcie: Do redakcji i ekstrakcji z dokumentów DeepSeek daje ten sam wynik za ułamek ceny i tam wygrywa. Do kodu i wszędzie tam, gdzie odpowiedź musi przyjść w rozsądnym czasie, Kimi, bo w tym przebiegu jako jedyny z tej pary zmieścił się w limicie.
Claude Opus 5
Komplet zaliczony w 6,2, 5,0 i 8,0 s, czyli od 7 do 19 razy szybciej niż Kimi, ale za 5 / 25 USD za milion tokenów w OpenRouter. Uwaga: Opus 5 odrzuca dokumenty dłuższe niż około 2 tys. tokenów (opis w sekcji o teście kontekstu), więc do długich plików bierz Sonnet 5, nie Opus 5.
Rozstrzygnięcie: Jeśli pracujesz interaktywnie i czas odpowiedzi ma znaczenie, bierz Claude. Kimi zostaje wyborem, gdy zadania idą wsadowo, a rachunek za wyjście ma być o 40% niższy.
Ceny z OpenRouter i cenników producentów z 16.09.2026, wyniki z jednego przebiegu, jedno wywołanie na zadanie. To mała próba: trzy krótkie zadania i jeden test pamięci.
MOJA OPINIA, NIE POMIAR
Co o tym myślę
Kimi jest dla mnie modelem do pracy wsadowej: wrzucam materiał, robię coś innego, wracam po wynik. W tej roli jest bardzo dobry i tańszy od Claude. Jako czat do szybkiej wymiany zdań mnie irytuje, bo minuta czekania na prostą redakcję to za dużo.
Największą przewagę widzę w stabilności: siedem tygodni z rzędu bez pudła w teście kontekstu, gdy GPT-5.6 Terra potrafił zgubić fakt już przy 8 tys. tokenów. To opinia oparta na małej próbie jednego zadania, nie na branżowym benchmarku, i tak ją traktuj.
SPRAWDŹ NA WŁASNYM MATERIALE
Trzy zadania przed decyzją
Poniżej są scenariusze próby i kryteria oceny. To nie są deklarowane wyniki testów tego narzędzia.
Wyjątek od reguły
Ustal termin z tego dokumentu, uwzględniając wyjątki w załącznikach. Cytuj podstawę.
Kryterium odbioru: Sprawdź, czy model połączył regułę z właściwym wyjątkiem.
Pytanie bez odpowiedzi
Odpowiedz tylko na podstawie pliku. Brak informacji oznacz wprost.
Kryterium odbioru: Nie uznawaj prawdopodobnego domysłu za trafienie.
Kontrola eksportu
Przygotuj tabelę faktów z lokalizacją każdego dowodu.
Kryterium odbioru: Otwórz wynik i zweryfikuj cytaty oraz jednostki w tabeli.
MÓJ WNIOSEK
Kiedy ten wybór ma sens
Kimi ma sens, jeśli pracujesz na długich dokumentach po polsku i możesz poczekać na odpowiedź kilkadziesiąt sekund; w API kosztuje 3 USD za milion tokenów wejścia i 15 USD za wyjście, czyli mniej niż Claude Opus 5. Nie ma sensu jako główny czat, jeśli liczy się szybkość odpowiedzi albo chcesz kupić abonament z jasnym cennikiem w złotych lub dolarach.
Źródła i metodologia
Ceny i funkcje sprawdzone 16 września 2026 w dokumentacji producentów. Wnioski są analizą redakcyjną. Wynik własnego testu podaję tylko wtedy, gdy można wskazać jego przebieg i warunki. Nie przyznaję oceny liczbowej bez wspólnej skali i porównywalnych pomiarów.
- Kimi: cennik członkostwa (oficjalne centrum pomocy, ceny w juanach) ↗
- Kimi Open Platform: cennik API K3 ↗
- Promptowy: przebieg protokołu testowego z 16.09.2026 (prompty i surowe odpowiedzi) ↗
- Promptowy: test okna kontekstu, historia przebiegów ↗
- OpenRouter: Kimi K3, cena dostawcy z 16.09.2026 ↗
Oferta w Kinetyce jest osobną ofertą handlową. Porównanie powyżej opisuje wskazane plany i stawki producentów.