Przejdź do treści
Artykuły

14 tysięcy tokenów myślenia nad opisem czajnika: gdy AI myśli za długo

Qwen 3.8 Max myślał 14 460 tokenów nad opisem czajnika, Mistral trzy razy oddał pustą odpowiedź. Ile to kosztuje, ile trwa i jak się bronić w API.

6 min czytania
14 tysięcy tokenów myślenia nad opisem czajnika: gdy AI myśli za długo

👁 118 przeczytań

// w skrócie
  • Qwen 3.8 Max zużył 14 460 tokenów na rozumowanie nad opisem czajnika i dostał wynik 6,44, podczas gdy GPT-6 Sol rozumował 43 tokeny i dostał 7,00.
  • Korelacja rang między sumą tokenów rozumowania a wynikiem pisania 16 modeli wyniosła -0,34, co oznacza, że więcej myślenia dawało gorsze, nie lepsze teksty.
  • Puste i ucięte odpowiedzi kosztowały łącznie 0,1833 USD - 45 razy więcej niż GPT-6 Luna za wszystkie 13 zadań (0,0041 USD).

Model AI, który myśli za długo, potrafi zużyć cały limit tokenów i nie oddać ani słowa. W teście 16 modeli Qwen 3.8 Max myślał 14 460 tokenów nad opisem czajnika na 182 słowa, a wcześniej, przy limicie 6000, oddał pustą odpowiedź. Mistral Medium 3.5 zrobił to samo trzy razy. Policzyłem, ile każdy model rozumował w 13 zadaniach, ile to trwało i kosztowało, i czy dłuższe myślenie dało lepszy tekst.

W skrócie

W 13 zadaniach modele zużyły od 211 (GLM-5.3) do 54 275 tokenów rozumowania (Mistral Medium 3.5), wszystkie z tym samym ustawieniem effort=low. Dłuższe myślenie nie szło w parze z lepszym pisaniem: korelacja rang między sumą tokenów rozumowania a wynikiem pisania wyniosła -0,34. Cztery puste odpowiedzi i jedna ucięta próba kosztowały 0,1833 USD, czyli 45 razy więcej niż cały przebieg GPT-6 Luna. Jeśli korzystasz z API, ustaw zapas w limicie i sprawdzaj, czy odpowiedź nie urwała się na limicie; w czacie długie „myślenie” nie jest obietnicą lepszego tekstu.

Co to są tokeny rozumowania

Modele z rozumowaniem piszą przed odpowiedzią ukryty szkic: rozpisują polecenie, liczą słowa, poprawiają się. Te tokeny nie trafiają do odpowiedzi, ale są liczone i opłacane jak tokeny wyjścia. Test pokazał też, że wliczają się do limitu długości: gdy Qwen 3.8 Max zużył na rozumowanie 6000 z 6000 dostępnych tokenów, na sam tekst nie zostało nic.

Wszystkie modele dostały przez OpenRouter to samo ustawienie: reasoning effort=low, czyli prośbę o krótkie rozumowanie. Każdy model interpretuje je jednak po swojemu. Liczby pochodzą z pola usage, które zwraca API, więc pokazują to, za co zapłaciłem. Zadania i ranking opisałem w tekście który AI pisze najlepiej po polsku.

Kto ile myślał

Tokeny rozumowania na 13 zadań (odpowiedzi ocenione, bez pustych prób)
Mistral Medium 3.554 275
DeepSeek V4 Pro33 158
Qwen 3.8 Max32 959
DeepSeek V4.1 Flash31 932
Gemini 3.1 Pro23 293
Grok 4.718 304
Claude Opus 5.58 867
Claude Haiku 4.57 206
Kimi K34 472
Gemini 3.8 Flash3 499
GPT-6 Luna2 547
Claude Sonnet 51 031
Claude Fable 5.1990
GPT-6 Sol676
GPT-6 Astra268
GLM-5.3211
ModelRozumowanie, 13 zadańUdział w tokenach wyjściaNajdłuższe jednorazowoCzas 13 zadań (s)Wynik pisania
Mistral Medium 3.554 27564,5%6789 (mail)844,968,0
DeepSeek V4 Pro33 15886,7%6571 (trudna korekta)563,374,1
Qwen 3.8 Max32 95987,5%14 460 (opis czajnika)750,975,9
DeepSeek V4.1 Flash31 93286,5%6153 (trudna korekta)517,172,9
Gemini 3.1 Pro23 29380,8%4405 (opowiadanie)220,077,8
Grok 4.718 30480,5%3817 (opis czajnika)287,377,4
Claude Opus 5.58 86751,4%1911 (opis czajnika)188,290,1
Claude Haiku 4.57 20656,8%1773 (inflacja)125,859,2
Kimi K34 47239,0%4298 (trudna korekta)244,178,5
Gemini 3.8 Flash3 49940,4%1424 (tytuły)89,879,4
GPT-6 Luna2 54735,3%711 (trudna korekta)70,182,8
Claude Sonnet 51 03111,5%821 (trudny quiz)139,871,9
Claude Fable 5.199010,4%990 (tytuły)204,383,9
GPT-6 Sol67612,8%342 (trudna korekta)100,986,4
GPT-6 Astra2684,6%107 (trudna korekta)146,085,3
GLM-5.32113,7%91 (łatwy quiz)49,964,4

Łącznie ocenione odpowiedzi zawierały 223 688 tokenów rozumowania na 341 060 tokenów wyjścia, czyli 65,6%. Trzy z czterech najlepszych modeli w pisaniu (Sol, Astra, Fable) zmieściły się w tysiącu tokenów rozumowania na 13 zadań. DeepSeek V4 Pro myślał 5767 tokenów nad dziesięcioma tytułami SEO i dostał w tym zadaniu najniższą ocenę (4,67) za tytuł „Może mocy powinien mieć dobry odkurzacz bezworkowy”.

Czajnik za 14 460 tokenów

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Zadanie było proste: akapit 120-150 słów i 5 korzyści z karty czajnika Nordvik K17. Qwen 3.8 Max w pierwszym podejściu, z limitem 6000 tokenów, przez 346,2 sekundy zużył wszystkie 6000 na rozumowanie i nie oddał tekstu. W drugiej próbie, z limitem 30 000, myślał 14 460 tokenów przez 288,9 sekundy. Razem ponad 10 minut i 0,1262 USD za jeden opis, który sędziowie ocenili na 6,44, bo akapit miał ok. 114 słów zamiast wymaganych 120. Sam ten opis to 51% kosztu wszystkich 9 zadań pisarskich Qwena. Dla porównania GPT-6 Sol rozumował nad tym samym poleceniem 43 tokeny, odpowiedział w 6,7 sekundy za 0,0042 USD i dostał 7,00.

Puste odpowiedzi przy limicie

Mistral Medium 3.5 w pierwszym podejściu oddał pusty tekst w trzech zadaniach: opisie, mailu i streszczeniu. Za każdym razem API zgłosiło koniec na limicie 6000 tokenów, z czego jako rozumowanie zaraportowało 4519, 3981 i 4097. W drugiej próbie, z limitem 30 000, mail do klienta kosztował 11 172 tokeny wyjścia (6789 rozumowania), a gotowy mail ma 43 słowa. Skrypt przy pustej odpowiedzi ponawia pytanie do trzech razy, zanim zapisze wynik. Zapisany czas pierwszych podejść (u Mistrala 113,7-130,6 s, u Qwena 346,2 s) obejmuje więc wszystkie ponowienia, a zapisany koszt tylko ostatnie.

Gorsze od pustej odpowiedzi bywa ucięcie w pół zdania, bo łatwo go nie zauważyć. DeepSeek V4.1 Flash w opisie czajnika zużył 5857 z 6000 tokenów na rozumowanie i oddał 70 słów bez listy korzyści, z powtórzeniami i urwanym ostatnim zdaniem. Mistral urwał post na LinkedIn na słowach „przede wszystkim z”. Oba teksty poszły do oceny tak, jak przyszły: 3,33 i 5,11 na 10. Podobne przypadki opisałem wcześniej w teście chińskich modeli.

Ta sama prośba, dwa różne przebiegi

DeepSeek V4.1 Flash w trudnym quizie o Polsce przy pierwszym podejściu wykorzystał 8970 z 9000 tokenów na rozumowanie i oddał tylko trzy odpowiedzi z 48. Druga próba z tym samym poleceniem: 3171 tokenów rozumowania i 47 poprawnych odpowiedzi. Oba przebiegi obsłużyli różni dostawcy (Novita i DeepInfra), bo OpenRouter sam kieruje zapytania do firm hostujących model. Podobnie nierówno myśli Kimi K3: w większości zadań 5-30 tokenów, w trudnej korekcie 4298 tokenów i 117,4 sekundy. Wyniki quizu opisuję w tekście czy AI zna Polskę, a korekty w teście korekty.

Ile kosztuje nadmiarowe myślenie

  • Puste i ucięte próby kosztowały 0,1833 USD (ok. 0,71 zł): 3% kosztu całego testu (6,12 USD) i 45 razy więcej niż GPT-6 Luna za wszystkie 13 zadań (0,0041 USD).
  • Mistral Medium 3.5 był najdroższy w pisaniu (0,4394 USD za 9 zadań) i zajął 14. miejsce na 16. Za 13 zadań zapłaciłem 0,638 USD, więcej niż za Claude Fable 5.1 (0,5426 USD).
  • Czas: Mistral i Qwen potrzebowały na 13 zadań 844,9 i 750,9 sekundy, GLM-5.3 49,9 sekundy, a GPT-6 Luna 70,1.

Ten sam efekt, czyli więcej tokenów bez lepszego wyniku, widziałem przy porównaniu trybów Wysoki i Ultra w GPT-6 Astra.

Jak się bronić

W API:

  • ustaw limit tokenów z zapasem na rozumowanie; w tym teście 6000 nie wystarczyło Mistralowi na 43-słowny mail,
  • sprawdzaj, czy odpowiedź nie skończyła się na limicie (finish_reason „length”) i czy nie jest pusta; ucięty tekst odrzucaj tak samo jak pusty,
  • zapisuj z pola usage liczbę tokenów rozumowania, żeby widzieć, który model przepala budżet,
  • ustaw timeout i plan B: druga próba z wyższym limitem albo innym modelem,
  • do krótkich tekstów wybieraj modele, które rozumują oszczędnie; w tym teście Sol, Astra i Fable zmieściły się w tysiącu tokenów na 13 zadań.

W czacie: długo kręcący się wskaźnik myślenia nie oznacza lepszej odpowiedzi. Jeśli model myśli minutami nad prostym mailem, przerwij i zapytaj jeszcze raz albo przełącz go w szybszy tryb. To opinia redakcji.

Najczęstsze pytania

Dlaczego AI zwraca pustą odpowiedź?

Najczęściej dlatego, że zużył cały limit tokenów na rozumowanie. W teście Qwen 3.8 Max wydał 6000 z 6000 tokenów na myślenie nad opisem czajnika i nie oddał tekstu.

Czy dłuższe myślenie AI daje lepszy tekst?

W tym teście nie. Korelacja rang między sumą tokenów rozumowania a wynikiem pisania 16 modeli wyniosła -0,34, a najwięcej myślący Mistral Medium 3.5 zajął 14. miejsce.

Czy tokeny rozumowania są płatne?

Tak, rozliczane są jak tokeny wyjścia. Qwen 3.8 Max zapłacił za opis czajnika w dwóch próbach 0,1262 USD, a GPT-6 Sol za ten sam opis 0,0042 USD.

Jaki limit tokenów ustawić w API?

Z zapasem na rozumowanie. Przy effort=low limit 6000 nie wystarczył Mistralowi w trzech zadaniach, a z limitem 30 000 najdłuższa odpowiedź zajęła 14 852 tokeny.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

Liczby pochodzą z własnego testu redakcji z 26 września 2026 roku: pola usage (tokeny wyjścia, tokeny rozumowania, koszt) i finish_reason zwrócone przez OpenRouter dla 208 ocenionych odpowiedzi, 4 pustych pierwszych prób i dodatkowej próby DeepSeek V4.1 Flash z limitem 9000; czas mierzony w skrypcie run.py. Surowe dane (odpowiedzi, oceny, skrypty) są dostępne na życzenie oraz w paczce: 2026-09-pisanie-po-polsku.zip. Sprawdzone 26 września 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Dlaczego model AI zwraca pustą odpowiedź zamiast tekstu?

Model zwraca pustą odpowiedź, gdy zużyje cały limit tokenów na rozumowanie przed napisaniem czegokolwiek. W teście Qwen 3.8 Max wydał wszystkie 6000 tokenów na myślenie nad opisem czajnika i nie oddał ani słowa, a Mistral Medium 3.5 zrobił to samo w trzech zadaniach.

Czy dłuższe myślenie modelu AI przekłada się na lepszy tekst?

Nie - w tym teście korelacja rang między sumą tokenów rozumowania a wynikiem pisania wyniosła -0,34. Mistral Medium 3.5 myślał najwięcej (54 275 tokenów) i zajął 14. miejsce na 16, a trzy z czterech najlepszych modeli zmieściły się poniżej 1000 tokenów rozumowania na 13 zadań.

Czy tokeny rozumowania są płatne tak samo jak tokeny odpowiedzi?

Tak, tokeny rozumowania są rozliczane jak tokeny wyjścia. Za opis czajnika Qwen 3.8 Max w dwóch próbach zapłacił 0,1262 USD, podczas gdy GPT-6 Sol za ten sam opis zapłacił 0,0042 USD.

Jaki limit tokenów ustawić w API, żeby model nie zwracał pustych odpowiedzi?

Limit należy ustawić z zapasem na rozumowanie, bo 6000 tokenów nie wystarczyło Mistralowi nawet na 43-słowny mail. Z limitem 30 000 tokenów najdłuższa odpowiedź w teście zajęła 14 852 tokeny.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›