🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 8 szt. albo Pro na rok 464 zł Kup teraz →
Przejdź do treści
Artykuły

Nowe modele AI odbierają Ci wybór. Sprawdziłem 18 i siedem nie pozwala wyłączyć rozumowania

4 min czytania
Siedem z osiemnastu modeli AI nie pozwala wylaczyc rozumowania, wszystkie z najnowszego pokolenia

👁 112 przeczytań

// w skrócie
  • Spośród 18 sprawdzonych modeli 7 najnowszych nie pozwala wyłączyć rozumowania i zwraca błąd: "Reasoning is mandatory for this endpoint and cannot be disabled".
  • Tokeny rozumowania są rozliczane jak zwykłe tokeny wyjścia - w skrajnym przypadku model wyprodukował 625 tokenów myślenia, by zwrócić 2 zdania, co dało rachunek za 20 razy więcej tekstu niż odebrano.
  • DeepSeek V4 Flash z wyłączonym rozumowaniem napisał artykuł na 900 słów za 0,00039 dolara, co czyni go opłacalną alternatywą przy prostych, masowych zadaniach.

Przy pracy z modelami przez interfejs programistyczny można było dotąd wyłączyć rozumowanie jednym parametrem. Model przestawał myśleć na głos i od razu odpowiadał, co przy prostych zadaniach oszczędzało czas i pieniądze. Sprawdziłem dziś osiemnaście modeli i wyszła rzecz, której się nie spodziewałem.

Siedem z nich odrzuca taką próbę błędem. Wszystkie siedem to modele najnowszego pokolenia. Wszystkich jedenaście, które nadal na to pozwalają, to modele starsze.

Kto zabiera wybór

Komunikat jest za każdym razem ten sam i nie zostawia pola do dyskusji:

Reasoning is mandatory for this endpoint and cannot be disabled.

Nie da się wyłączyć Nadal można wyłączyć
GPT-6 Astra Claude Opus 5
GPT-6 Astra Pro Claude Sonnet 4.6
Claude Fable 5.1 Claude Haiku 4.5
Gemini 3.8 Flash DeepSeek V4 Flash
Gemini 3.7 Flash DeepSeek V4 Pro
GLM 5.3 DeepSeek V3.2
GLM 5.3 Flash GLM 5.2
Kimi K3
Qwen3.8 27B
Ministral 14B
Llama 4 Maverick

Podział jest zaskakująco czysty. Nie chodzi o producenta ani o cenę, bo po obu stronach stoją modele OpenAI, Anthropic, Google i Z.ai. Chodzi o pokolenie. GLM 5.2 pozwala, GLM 5.3 już nie. Claude Sonnet 4.6 pozwala, Claude promptowy.com/claude-fable-5-1/">Fable 5.1 już nie. Ta sama firma, ten sam parametr, inna odpowiedź.

Dlaczego to kosztuje, a nie tylko irytuje

Tokeny rozumowania rozliczane są jak zwykłe tokeny wyjścia, czyli po droższej stronie cennika. Płacisz za tekst, którego nigdy nie zobaczysz.

Zmierzyłem, ile go jest. W teście sześciu krótkich zadań po polsku udział rozumowania w całym wyjściu wyniósł:

  • GPT-6 Astra: od 52 do 95 procent
  • GLM 5.3 Flash: od 68 do 96 procent
  • Gemini 3.8 Flash przy pisaniu artykułu: 985 tokenów rozumowania
  • Kimi K3 przy tym samym artykule: 4 667 tokenów rozumowania

Przy zadaniu, w którym prosiłem o dwa zdania, jeden z modeli wyprodukował 659 tokenów wyjścia, z czego 625 to było myślenie. Dostałem dwa zdania i rachunek za dwadzieścia razy więcej tekstu.

Najostrzejszy przypadek opisałem osobno: przy prośbie o artykuł GLM 5.3 Flash zużył cały limit ośmiu tysięcy tokenów na rozumowanie i oddał zero słów, wystawiając przy tym rachunek.

Co to znaczy dla ceny z cennika

Jeśli rozumowanie stanowi średnio osiemdziesiąt pięć procent tokenów wyjścia, a wyłączyć go nie można, to cena widoczna na karcie modelu opisuje coś innego niż to, za co realnie płacisz. Za każdy token, który zobaczysz, płacisz mniej więcej tyle, co za sześć, których nie zobaczysz.

To jest drugi mnożnik po tym, który opisałem wcześniej: ten sam model hostuje kilkanaście firm z własnymi stawkami, a rozrzut sięga czternastu razy. Oba działają w tę samą stronę i oba są niewidoczne, dopóki nie zaczniesz odczytywać kosztu z rachunku zamiast szacować go z cennika.

Czy to jest złe

Nie w każdym zastosowaniu. Przy trudnym zadaniu rozumowanie realnie poprawia wynik i wtedy płacenie za nie jest uzasadnione. Problem polega na tym, że przy zadaniu banalnym płacisz dokładnie tak samo, a wyboru nie masz.

Producent ma tu swoją logikę: model z wyłączonym rozumowaniem wypada gorzej w testach i psuje wrażenie z produktu. Rozumiem to. Nie zmienia to jednak faktu, że przy przepisywaniu tekstu z jednego formatu na drugi nikt nie potrzebuje, żeby model najpierw rozważył trzy podejścia.

Co z tym zrobić w praktyce

Do zadań prostych i masowych wybieraj modele poprzedniego pokolenia. Przy przepisywaniu, streszczaniu i porządkowaniu danych DeepSeek V4 Flash z wyłączonym rozumowaniem robi to samo za ułamek ceny. Zmierzyłem, że napisał artykuł na dziewięćset słów za 0,00039 dolara, bez ani jednego tokena rozumowania.

Obsłuż błąd 400 w swoim kodzie. Jeśli Twój program wysyła ten parametr na sztywno, po zmianie modelu przestanie działać w całości. U mnie tak właśnie było: generator newsów wysyłał wyłączenie rozumowania przy każdym zapytaniu i po przełączeniu na nowszy model zwróciłby błąd zamiast tekstu. Dopisałem wykrywanie tego błędu i jedno ponowienie bez tego parametru.

Zapisuj koszt z odpowiedzi, nie z cennika. Wystarczy poprosić interfejs o rozliczenie, a przy każdej odpowiedzi dostaniesz rzeczywistą kwotę i liczbę tokenów rozumowania. Bez tego nie zauważysz, że połowa rachunku idzie na tekst, którego nie ma na ekranie.

Przy modelach z obowiązkowym rozumowaniem dawaj większy limit tokenów. Inaczej model przepali go na myślenie i zwróci pustą odpowiedź przy statusie sukcesu. To jest awaria, której nie widać w logach, bo formalnie nic się nie zepsuło.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Jak to sprawdziłem

Osiemnaście modeli, 10 września 2026, jedno minimalne zapytanie do każdego z parametrem wyłączającym rozumowanie i limitem dziesięciu tokenów, żeby test był tani. Liczy się wyłącznie kod odpowiedzi i treść komunikatu błędu, więc wynik jest jednoznaczny i łatwy do powtórzenia.

Lista modeli, które blokują wyłączenie, będzie rosła, bo idzie za nowymi wersjami. Zaktualizuję ten tekst, gdy dojdą kolejne.

Więcej pomiarów tych samych modeli, ale od strony jakości i rachunku, zebrałem w tekstach o tym, który model pisze najlepiej po polsku, ile kosztuje artykuł napisany przez AI oraz czy obiecywane okno kontekstu naprawdę działa.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Które modele AI nie pozwalają wyłączyć rozumowania?

Siedem modeli najnowszego pokolenia blokuje wyłączenie rozumowania: GPT-6 Astra, GPT-6 Astra Pro, Claude Fable 5.1, Claude Haiku 4.5, Gemini 3.8 Flash, DeepSeek V4 Pro i GLM 5.3. Wszystkie starsze jedenaście modeli nadal pozwala na wyłączenie tego parametru.

Ile kosztuje rozumowanie w modelach AI, których nie można wyłączyć?

Przy założeniu, że rozumowanie stanowi średnio 85 procent tokenów wyjścia, za każdy widoczny token płacisz mniej więcej tyle, ile za sześć tokenów ukrytych. Kimi K3 przy pisaniu artykułu zużył 4 667 tokenów rozumowania, a Gemini 3.8 Flash 985 tokenów przy tym samym zadaniu.

Co zrobić, gdy model zwraca błąd 400 przy wyłączaniu rozumowania?

Należy obsłużyć błąd 400 w kodzie i dodać automatyczne ponowienie zapytania bez parametru wyłączającego rozumowanie. Bez tej poprawki program przestanie działać w całości po przełączeniu na nowszy model, bo zwróci błąd zamiast tekstu.

Czy GLM 5.3 Flash może zużyć wszystkie tokeny na rozumowanie i nic nie zwrócić?

Tak - GLM 5.3 Flash zużył cały limit 8 000 tokenów na rozumowanie, oddał zero słów i mimo to wystawił rachunek. Dlatego przy modelach z obowiązkowym rozumowaniem trzeba ustawiać większy limit tokenów, inaczej model przepali go na myślenie i zwróci pustą odpowiedź bez żadnego błędu w logach.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro 440 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie