🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 8 szt. albo Pro na rok 464 zł Kup teraz →
Przejdź do treści
Artykuły

GLM 5.3: policzyłem, ile ten tani model naprawdę kosztuje. Trzy liczby z karty modelu się nie zgadzają

7 min czytania
Koszt trzech identycznych zadań u czterech modeli: GLM 5.3, GLM 5.2, GLM 5.3 Flash i DeepSeek V4 Flash

👁 115 przeczytań

// w skrócie
  • GLM 5.3 Flash kosztuje w praktyce nawet 5,4 razy więcej niż cena z karty modelu, bo tylko 2 z 26 dostawców na OpenRouter liczy 0,25 USD za milion tokenów.
  • Kontekst 1 310 720 tokenów reklamowany na karcie modelu oferuje dokładnie jeden dostawca - Cloudflare - spośród 26 dostępnych na OpenRouter.
  • DeepSeek V4 Flash wykonał te same trzy zadania tekstowe 61 razy taniej niż GLM 5.3 i 16 razy taniej niż GLM 5.3 Flash, przy takiej samej jakości polszczyzny.

Na kartę modelu GLM 5.3 patrzy się przyjemnie: milion tokenów kontekstu, cena wejścia poniżej dziesięciu centów w wersji Flash, obsługa obrazu i wideo. Wygląda to jak najtańszy sposób na duży kontekst, jaki da się dziś kupić. Odpaliłem więc własny test i policzyłem, ile ta oferta kosztuje naprawdę. Wyszło, że trzy z czterech liczb z karty modelu są prawdziwe wyłącznie w bardzo szczególnych warunkach.

Co to w ogóle jest

GLM 5.3 to model chińskiej firmy Z.ai, następca linii GLM 5. Na OpenRouter dostępny jest w dwóch wariantach, a różnica między nimi jest większa, niż sugeruje nazwa.

Model Wejście / wyjście za mln tokenów Kontekst Co przyjmuje
GLM 5.3 1,40 / 4,40 USD 1 048 576 tekst
GLM 5.3 Flash 0,075 / 0,25 USD 1 310 720 tekst, obraz, wideo
GLM 5.2 0,28 / 0,88 USD 1 048 576 tekst
DeepSeek V4 Flash 0,07 / 0,14 USD 1 048 576 tekst

Pierwsza rzecz, która rzuca się w oczy: tańsza wersja Flash ma większy kontekst niż wersja pełna i przyjmuje obraz oraz wideo, których flagowiec nie przyjmuje wcale. Przy dziewiętnastokrotnie niższej cenie wejścia. To nie jest układ, który spotyka się często, więc zacząłem właśnie od tego.

Kontekstu 1,31 miliona nie dostaniesz u prawie nikogo

GLM 5.3 Flash ma na OpenRouter dwudziestu sześciu dostawców. Sprawdziłem każdego z osobna i okno kontekstu 1 310 720 tokenów oferuje dokładnie jeden: Cloudflare. Dwudziestu czterech pozostałych daje 1 048 576, a jeden 262 144.

Liczba z karty modelu jest więc prawdziwa, tylko opisuje najlepszego dostawcę, a nie to, co dostaniesz przy zwykłym zapytaniu. Jeśli budujesz coś, co realnie potrzebuje 1,3 miliona tokenów, musisz wymusić konkretnego dostawcę. Inaczej trafisz na milion i zapytanie odbije się od limitu w najgorszym możliwym momencie.

Cena z karty modelu to cena najtańszego dostawcy, nie Twoja

Tu robi się ciekawiej. OpenRouter pokazuje na karcie stawkę najtańszego dostawcy, ale zapytanie kieruje do tego, który akurat jest dostępny. Rozrzut policzyłem dla każdego z czterech modeli.

Model Cena wyjścia z karty Realny rozrzut u dostawców Ilu dostawców
GLM 5.2 0,88 USD 0,88 do 7,26 USD (8,2 razy) 33
GLM 5.3 Flash 0,25 USD 0,25 do 1,36 USD (5,4 razy) 26
DeepSeek V4 Flash 0,14 USD 0,14 do 0,56 USD (4,1 razy) 15
GLM 5.3 4,40 USD 3,50 do 6,60 USD (1,9 razy) 27

Przy GLM 5.3 Flash stawkę z karty, czyli 0,25 dolara, daje dwóch dostawców z dwudziestu sześciu. Dwudziestu liczy 0,50, czyli dwa razy tyle. Moje zapytania trafiły do Together i zapłaciłem właśnie 0,50.

Przy GLM 5.2 było gorzej. Karta mówi 0,88 dolara za milion tokenów wyjścia. Moje zapytanie trafiło do dostawcy, który liczy 4,40, czyli pięć razy więcej niż cena, na podstawie której podejmowałem decyzję. Nie jest to błąd ani ukryta opłata, wszystko jest jawne w danych o dostawcach. Po prostu nikt nie czyta danych o dostawcach, a karta modelu pokazuje jedną liczbę.

Rozumowania nie da się wyłączyć

Mój standardowy sposób pomiaru zaczyna się od wyłączenia rozumowania, bo inaczej porównuję modele, które myślą, z modelami, które od razu odpowiadają. Przy GLM 5.3 to nie działa. API oddaje błąd 400 i komunikat, który nie zostawia pola do dyskusji:

Reasoning is mandatory for this endpoint and cannot be disabled.

Ten sam błąd dostaje wersja Flash. Konsekwencja jest finansowa, nie techniczna: tokeny rozumowania są rozliczane jak zwykłe tokeny wyjścia, a wyjście jest droższą stroną cennika. Płacisz za myślenie modelu i nie możesz z tego zrezygnować.

Sprawdziłem, ile tego myślenia jest. W trzech zadaniach udział tokenów rozumowania w całym wyjściu wyniósł:

  • GLM 5.3: 95%, 84% i 52%
  • GLM 5.3 Flash: 96%, 93% i 68%
  • DeepSeek V4 Flash: 89%, 16% i 90%

Przy zadaniu, w którym prosiłem o dwa zdania po polsku, GLM 5.3 wyprodukował 659 tokenów wyjścia, z czego 625 to było rozumowanie. Dostałem dwa zdania i rachunek za dwadzieścia razy więcej tekstu, niż zobaczyłem.

Trzy zadania po polsku, cztery modele

Test był prosty i celowo krótki, bo w takich zadaniach różnice w kosztach robią się najbardziej bolesne. Poprosiłem o dwa zdania z trudną odmianą, o streszczenie w dokładnie trzech zdaniach i o rachunek na cenniku tokenów.

Model Koszt trzech zadań Najdłuższa odpowiedź Najgorszy czas
GLM 5.3 0,00902 USD 965 tokenów 29,7 s
GLM 5.2 0,00795 USD 1 791 tokenów 26,8 s
GLM 5.3 Flash 0,00245 USD 3 783 tokenów 46,3 s
DeepSeek V4 Flash 0,00015 USD 347 tokenów 4,3 s

Najmocniejsza liczba jest w wierszu ze streszczeniem. GLM 5.3 Flash potrzebował na trzy zdania o leasingu 3 783 tokenów wyjścia i 46,3 sekundy, z czego 3 526 tokenów poszło na rozumowanie. DeepSeek V4 Flash oddał to samo zadanie w 203 tokenach i 3,8 sekundy. Dwanaście razy szybciej, przy koszcie trzydzieści dziewięć razy niższym.

W sumie za trzy zadania DeepSeek V4 Flash policzył szesnaście razy mniej niż GLM 5.3 Flash i sześćdziesiąt jeden razy mniej niż GLM 5.3.

A polszczyzna?

Tu niespodzianki nie ma i to jest właśnie problem GLM-a. Wszystkie cztery modele poradziły sobie z dopełniaczem liczby mnogiej od „skrzypce” i z narzędnikiem od „tysiąc”. Wszystkie policzyły rachunek na 0,646 dolara poprawnie. Wszystkie zmieściły streszczenie w dokładnie trzech zdaniach, o które prosiłem.

Zdanie z GLM 5.3: „W piwnicy nie znaleźli starych skrzypiec należących do dziadka”. Zdanie z DeepSeek V4 Flash: „Zabrakło mi strun do moich starych skrzypiec”. Oba poprawne, jedno kosztowało sześćdziesiąt jeden razy więcej.

Przy zadaniach, w których droższy model nie robi nic lepiej, cała różnica sprowadza się do rachunku. I to jest odpowiedź na pytanie, czy warto przechodzić z GLM 5.2 na 5.3: w moich zadaniach nie było za co dopłacać.

Ten sam model, cztery razy inny czas

Warto wiedzieć jeszcze o jednym. GLM 5.3 odpowiadał mi raz w 1,7 sekundy, a raz w 29,7 sekundy. To nie była różnica trudności zadania, tylko różnica dostawcy: krótsza odpowiedź przyszła z Modal, dłuższa z DigitalOcean. Jeśli budujesz coś, gdzie czas odpowiedzi ma znaczenie, przy modelach z długą listą dostawców musisz wskazać konkretnego. Inaczej ten sam kod raz działa w sekundę, a raz w pół minuty i nie wiadomo dlaczego.

Dla kogo to ma sens

GLM 5.3 Flash weź, jeśli potrzebujesz taniego modelu, który przyjmuje obraz i wideo przy dużym kontekście. To realnie rzadkie połączenie i tu Flash wygrywa, bo DeepSeek V4 Flash obrazu nie przyjmuje.

GLM 5.3 w wersji pełnej pomiń, dopóki nie masz zadania, które wersja Flash oblewa. Kosztuje prawie dziewiętnaście razy więcej na wejściu, nie przyjmuje obrazu, ma mniejszy kontekst i w moich zadaniach nie odpowiadał lepiej.

Do zwykłego tekstu weź coś innego. Przy zadaniach tekstowych DeepSeek V4 Flash był szybszy i wielokrotnie tańszy przy tej samej jakości polszczyzny.

Zawsze wskazuj dostawcę. To jedna linijka w zapytaniu, a bez niej cena i czas odpowiedzi są loterią, w której karta modelu pokazuje najlepszy możliwy wynik.

Jak to mierzyłem

Wszystkie liczby pochodzą z 9 września 2026. Ceny i listy dostawców wziąłem prosto z API OpenRouter, koszty pojedynczych zapytań z pola rozliczeniowego zwracanego przez to samo API, a nie z własnych szacunków. Każde zadanie poszło do każdego modelu raz, z tym samym poleceniem i limitem 4 000 tokenów. Cały test kosztował 0,0196 dolara.

Jeden pomiar to jeden pomiar i przy modelach z rozumowaniem rozrzut potrafi być spory. Nie twierdzę więc, że GLM 5.3 Flash zawsze potrzebuje 3 783 tokenów na trzy zdania. Twierdzę, że przy pierwszym podejściu potrzebował, że nie da się tego wyłączyć i że rachunek trzeba liczyć z tym założeniem.

Więcej takich pomiarów zbieram na bieżąco w benchmarkach, a dane o poszczególnych modelach trzymam w atlasie modeli. Jak podobne pułapki wyglądają przy modelach droższych, rozpisałem w tekście o GPT-6 Astra.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Dopisek z tego samego dnia: szerszy test wypadł dla GLM lepiej

Kilka godzin po opublikowaniu tego tekstu przepuściłem dziesięć modeli przez sześć zadań z polskiej gramatyki, ocenianych automatycznie. GLM 5.3 Flash zdobył komplet punktów, tyle samo co GPT-6 Astra, Claude promptowy.com/claude-fable-5-1/">Fable 5.1 i Kimi K3, przy rachunku od dwudziestu sześciu do trzydziestu dwóch razy niższym od nich.

To doprecyzowuje wniosek z akapitu wyżej. Na trzech zadaniach z tego tekstu DeepSeek V4 Flash wypadał równie dobrze i był tańszy. Na szerszym zestawie DeepSeek stracił punkt, a GLM 5.3 Flash nie stracił żadnego. Jeśli zależy Ci na poprawnej polszczyźnie, GLM 5.3 Flash jest teraz moim domyślnym wyborem, a wszystko, co napisałem wyżej o kosztach rozumowania i o dostawcach, obowiązuje nadal.

Pełne wyniki, z podziałem na zadania i z kosztem każdego modelu, są w tekście o tym, który model AI pisze najlepiej po polsku.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Ile naprawdę kosztuje GLM 5.3 Flash na OpenRouter?

Cena z karty modelu wynosi 0,25 USD za milion tokenów wyjścia, ale realny rozrzut u dostawców sięga od 0,25 do 1,36 USD, czyli 5,4 razy więcej. Przy teście opisanym w artykule zapytania trafiły do Together, który liczy 0,50 USD, czyli dwukrotność ceny z karty.

Czy można wyłączyć rozumowanie w GLM 5.3 Flash?

Nie, rozumowanie jest obowiązkowe i próba jego wyłączenia zwraca błąd 400 z komunikatem, że reasoning jest wymagany dla tego endpointu. W jednym z zadań testowych 3526 z 3783 tokenów wyjścia stanowiły właśnie tokeny rozumowania, rozliczane jak zwykłe tokeny wyjścia.

Czy GLM 5.3 Flash przyjmuje obrazy i wideo?

Tak, GLM 5.3 Flash obsługuje tekst, obraz i wideo, podczas gdy pełny GLM 5.3 przyjmuje wyłącznie tekst. To według artykułu rzadkie połączenie, bo np. DeepSeek V4 Flash obrazu nie przyjmuje.

Dlaczego czas odpowiedzi GLM 5.3 różni się tak bardzo między zapytaniami?

Przyczyną jest losowy wybór dostawcy przez OpenRouter - w teście GLM 5.3 odpowiadał raz w 1,7 sekundy z Modalu, a raz w 29,7 sekundy z DigitalOcean. Rozwiązaniem jest wymuszenie konkretnego dostawcy w zapytaniu, bo bez tego czas i cena są nieprzewidywalne.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro 440 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie