Modele obiecują milion tokenów kontekstu. Sprawdziłem na trzech procentach i dwa poległy
👁 124 przeczytań
- Na 25 tys. tokenów (3% obiecanego okna) tylko 3 z 5 modeli znalazły ukryte zdanie na każdej głębokości tekstu.
- GPT-6 Astra i Gemini 3.8 Flash osiągnęły identyczny wynik, ale GPT-6 kosztował 1,00 USD, a Gemini 0,059 USD - 17 razy mniej.
- Kimi K3 potrzebuje na ten sam polski tekst o 43% więcej tokenów niż Gemini, co oznacza o 43% wyższy rachunek za tę samą pracę.
Każdy producent chwali się dziś oknem kontekstu na milion tokenów. Brzmi to jak obietnica, że można wrzucić modelowi całą książkę i pytać o szczegóły. Postanowiłem sprawdzić, czy to działa po polsku, i zacząłem ostrożnie: nie od miliona, tylko od dwudziestu pięciu tysięcy tokenów, czyli mniej więcej trzech procent obiecywanego okna.
Już na tym poziomie dwa modele z pięciu poległy. Jeden nie znalazł ukrytego zdania, drugi dwukrotnie nie odpowiedział wcale, mimo pięciu minut czekania.
Jak to sprawdziłem
Zbudowałem długi tekst po polsku z własnych opublikowanych artykułów, czyli z naturalnej polszczyzny, a nie z generowanego wypełniacza. Dziewięćdziesiąt tysięcy znaków ciągłego tekstu.
W środku ukryłem jedno zdanie, którego w tym tekście nie ma prawa być: informację o kodzie serwisowym do skrzynki na strychu. Zdanie wstawiałem na trzech głębokościach: po dziesięciu procentach tekstu, w połowie i po dziewięćdziesięciu procentach. Potem prosiłem model o podanie samego kodu.
To jest test na jedną rzecz: czy model faktycznie przeczytał całość, czy tylko początek i koniec.
Wyniki
| Model | Trafienia | Koszt trzech pytań | Średni czas |
|---|---|---|---|
| Gemini 3.8 Flash | 3 / 3 | 0,05889 USD | 3,3 s |
| Kimi K3 | 3 / 3 | 0,23751 USD | 5,1 s |
| GPT-6 Astra | 3 / 3 | 1,00205 USD | 2,0 s |
| DeepSeek V4 Flash | 2 / 3 | 0,00777 USD | 4,0 s |
| GLM 5.3 Flash | 1 / 3 | 0,00429 USD | 5,4 s |
Cały test kosztował 1,31 dolara.
Trzy z pięciu zdały, ale zapłaciłem za to bardzo różnie
promptowy.com/google-deepmind-gemini-3-8-flash-i-flash-cyber/">Gemini 3.8 Flash, Kimi K3 i GPT-6 Astra znalazły ukryte zdanie na każdej głębokości. Różnica jest w rachunku.
GPT-6 Astra policzył 1,00 dolara za trzy pytania. Gemini 3.8 Flash zrobił dokładnie to samo za 0,059, czyli siedemnaście razy taniej. Przy pojedynczym pytaniu to trzydzieści trzy centy różnicy. Przy narzędziu, które przeszukuje dokumenty codziennie, to różnica między rachunkiem, którego się nie zauważa, a takim, który trzeba uzasadnić.
Astra ma za to jedną przewagę, która przy pracy na żywo bywa rozstrzygająca: odpowiadał w dwie sekundy, najszybciej z całej piątki, i to niezależnie od tego, gdzie ukryłem zdanie.
GLM 5.3 Flash nie odpowiedział dwa razy z trzech
Model, który wygrał mój test polskiej gramatyki, tu wypadł najgorzej z całej stawki. Przy zdaniu ukrytym na dziesięciu procentach i na dziewięćdziesięciu przekroczył limit pięciu minut i nie zwrócił nic. Znalazł tylko to wstawione dokładnie w połowie.
To już trzeci raz, gdy ten sam model zawodzi mi w ten sam sposób. Wcześniej przepalił cały limit tokenów na rozumowanie i oddał zero słów przy prośbie o artykuł, a w teście dziewięciu zadań trzykrotnie zwrócił pustą odpowiedź i potrzebował 353 sekund.
Przyczyna jest za każdym razem ta sama: w tym modelu nie da się wyłączyć rozumowania. Przy krótkim zadaniu podnosi to tylko rachunek. Przy dłuższym wejściu potrafi zablokować odpowiedź całkowicie.
Wniosek jest niewygodny, ale trzeba go wyciągnąć: model może być bardzo dobry w polszczyźnie i jednocześnie nie nadawać się do niczego, co pracuje na dłuższym tekście.
Najciekawsze wyszło przy okazji: ten sam tekst, różna liczba tokenów
Wysłałem wszystkim modelom identyczny tekst. Każdy policzył go inaczej, bo każdy dzieli polszczyznę na tokeny po swojemu.
| Model | Tokenów na ten sam tekst | Względem najlepszego |
|---|---|---|
| Gemini 3.8 Flash | 24 857 | punkt odniesienia |
| GPT-6 Astra | 26 662 | o 7% więcej |
| GLM 5.3 Flash | 27 757 | o 12% więcej |
| DeepSeek V4 Flash | 27 998 | o 13% więcej |
| Kimi K3 | 35 642 | o 43% więcej |
To jest ukryty koszt, o którym nikt nie mówi przy porównywaniu cenników. Kimi K3 potrzebuje na ten sam polski tekst o czterdzieści trzy procent więcej tokenów niż Gemini. Przy identycznej stawce za milion tokenów oznacza to o czterdzieści trzy procent wyższy rachunek za dokładnie tę samą pracę.
Polszczyzna jest tu w gorszej sytuacji niż angielski, bo modele dzielone są głównie na tekstach angielskich, a nasze końcówki fleksyjne rozbijają się na więcej kawałków. Im gorszy podział, tym więcej płacisz za to samo zdanie.
Zaskoczenie, którego nie umiem wytłumaczyć
DeepSeek V4 Flash nie znalazł zdania ukrytego na dziesięciu procentach tekstu, czyli blisko początku, a znalazł je bez problemu w połowie i na końcu. To odwrotnie, niż podpowiada intuicja, bo początek zwykle jest najłatwiejszy.
Nie mam na to wyjaśnienia i nie zamierzam go zmyślać. Jedno podejście na głębokość to za mało, żeby mówić o prawidłowości. Odnotowuję jako fakt z tego pomiaru, nie jako regułę.
Czego ten test nie mówi
Nie sprawdzałem miliona tokenów, tylko dwadzieścia pięć tysięcy. Nie wiem więc, jak te modele zachowują się przy pełnym oknie, i nikt tego nie wie, dopóki nie zapłaci za sprawdzenie.
Nie sprawdzałem też rozumienia, tylko odnalezienie. Znalezienie jednego zdania to najprostsze możliwe zadanie na długim tekście. Trudniejsze pytania, wymagające połączenia informacji z kilku miejsc, wypadłyby gorzej u wszystkich.
I rzecz, o której trzeba pamiętać przy każdym takim porównaniu: cena z karty modelu nie musi być ceną, którą zapłacisz, bo ten sam model hostuje kilkanaście firm z własnymi stawkami.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika praktycznie
Do przeszukiwania dokumentów po polsku weź Gemini 3.8 Flash. Komplet trafień, trzy sekundy i rachunek siedemnaście razy niższy od najdroższego modelu z takim samym wynikiem. Do tego najlepszy podział polszczyzny na tokeny, co obniża koszt jeszcze przed zadaniem pytania.
Nie zakładaj, że deklarowane okno kontekstu działa. Sprawdź to na własnym materiale, ukrywając w nim coś, czego tam być nie powinno. Zajmuje to kwadrans i rozstrzyga więcej niż wszystkie tabele producentów.
Licz tokeny, nie znaki. Przy wyborze modelu do pracy na polskich tekstach różnica w podziale potrafi kosztować więcej niż różnica w cenniku.
Ile realnie kosztuje praca tymi modelami przy pisaniu, a nie przy czytaniu, zmierzyłem osobno w tekście o tym, ile kosztuje artykuł napisany przez AI.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który model najlepiej radzi sobie z przeszukiwaniem długich polskich tekstów?
Gemini 3.8 Flash znalazł ukryte zdanie na każdej z trzech głębokości tekstu i był najtańszy - trzy pytania kosztowały 0,059 USD. Średni czas odpowiedzi wyniósł 3,3 sekundy, a podział polszczyzny na tokeny był najoszczędniejszy z całej piątki.
Dlaczego GLM 5.3 Flash nie odpowiedział na dwa pytania z trzech?
GLM 5.3 Flash nie zwrócił żadnej odpowiedzi przy zdaniu ukrytym na 10% i 90% tekstu, przekraczając limit 5 minut. Przyczyną jest brak możliwości wyłączenia rozumowania - przy dłuższym wejściu model przepala limit tokenów na rozumowanie i blokuje odpowiedź całkowicie.
Czy liczba tokenów jest taka sama we wszystkich modelach dla tego samego tekstu?
Nie - na identycznym polskim tekście Gemini naliczył 24 857 tokenów, a Kimi K3 aż 35 642, czyli o 43% więcej. Różnica wynika z tego, że modele są trenowane głównie na tekstach angielskich, a polskie końcówki fleksyjne rozbijają się na więcej kawałków.
Ile kosztował cały test pięciu modeli na 25 tys. tokenów?
Łączny koszt wszystkich piętnastu pytań (trzy pytania do każdego z pięciu modeli) wyniósł 1,31 USD. Najtańszy był GLM 5.3 Flash - 0,00429 USD za trzy pytania, najdroższy GPT-6 Astra - 1,00205 USD za tę samą liczbę zapytań.



