Cena na OpenRouter to nie cena, którą płacisz. Sprawdziłem 15 modeli i różnica sięga czternastu razy
👁 117 przeczytań
- Przy DeepSeek V3.2 najdroższy dostawca na OpenRouter liczy 4,50 USD za milion tokenów, a najtańszy 0,31 USD - to różnica 14,5 razy za ten sam model.
- Mediana rozrzutu cen wśród 15 zbadanych modeli wynosi 1,9 razy, co oznacza, że połowa modeli ma dostawcę liczącego co najmniej dwukrotnie więcej niż najtańszy.
- Bez pola 'provider' w zapytaniu OpenRouter kieruje ruch do przypadkowego dostawcy, a rzeczywisty koszt i nazwę obsługującej firmy ujawnia dopiero pole 'usage' zwracane przez API.
Korzystam z OpenRouter na co dzień i zakładałem, że cena na karcie modelu mówi mi, ile zapłacę. Przy okazji testu jednego z chińskich modeli zobaczyłem rachunek pięć razy wyższy od tego, którego się spodziewałem. Sprawdziłem więc piętnaście popularnych modeli, dostawcę po dostawcy, i policzyłem, jak duża jest ta różnica. Wyszła liczba, której nie umiałem przewidzieć: przy jednym z modeli najdroższy dostawca liczy czternaście i pół razy więcej niż najtańszy, który hostuje dokładnie ten sam model.
Skąd bierze się różnica
OpenRouter nie jest dostawcą modeli. Jest pośrednikiem, który to samo zapytanie może wysłać do jednej z kilkunastu albo kilkudziesięciu firm hostujących ten sam model. Każda z nich ma własny cennik, a karta modelu pokazuje jedną liczbę.
Ta jedna liczba nie mówi, czym jest. Przy GLM 5.2 karta podaje 0,88 dolara i tyle właśnie liczy najtańszy dostawca. Przy GLM 5.3 karta podaje 4,40, a najtańszy dostawca liczy 3,50, czyli mniej. Raz jest to dolny kraniec listy, raz gdzieś w środku. Pewne jest tylko to, że pod spodem kryje się kilkanaście albo kilkadziesiąt różnych stawek.
Kiedy wysyłasz zapytanie bez dodatkowych ustawień, trafia ono do dostawcy, który akurat jest dostępny. Może to być ten najtańszy. Nie musi.
Piętnaście modeli, rozrzut cen wyjścia
Wziąłem listę dostawców dla każdego modelu prosto z API i porównałem najniższą stawkę z najwyższą.
| Model | Najtańszy dostawca | Najdroższy dostawca | Różnica | Dostawców |
|---|---|---|---|---|
| DeepSeek V3.2 | 0,31 USD | 4,50 USD | 14,5 razy | 15 |
| GLM 5.2 | 0,88 USD | 7,26 USD | 8,2 razy | 33 |
| GLM 5.3 Flash | 0,25 USD | 1,36 USD | 5,4 razy | 26 |
| DeepSeek V4 Flash | 0,14 USD | 0,56 USD | 4,1 razy | 15 |
| DeepSeek V4 Pro | 1,20 USD | 3,83 USD | 3,2 razy | 16 |
| GLM 5.3 | 3,50 USD | 6,60 USD | 1,9 razy | 27 |
| Kimi K3 | 12,00 USD | 22,50 USD | 1,9 razy | 19 |
| Llama 4 Maverick | 0,70 USD | 1,15 USD | 1,7 razy | 5 |
| Qwen3.8 27B | 2,00 USD | 3,20 USD | 1,6 razy | 13 |
Ceny za milion tokenów wyjścia, stan na 9 września 2026. Modele z jednym dostawcą pominąłem, bo tam rozrzutu z definicji nie ma.
Mediana wypadła na 1,9 razy. To znaczy, że przy połowie sprawdzonych modeli ktoś na liście liczy co najmniej dwa razy więcej niż firma obok, za dokładnie ten sam model.
Liczba, która robi największe wrażenie
W dwunastu modelach z piętnastu najniższą stawkę oferuje dokładnie jeden dostawca. Jeden na piętnastu, jeden na dwudziestu sześciu, jeden na trzydziestu trzech. Cała reszta liczy więcej.
To odwraca sposób myślenia o tym cenniku. Najniższa cena nie jest ceną typową ani średnią. Jest wynikiem, który dostaniesz wtedy i tylko wtedy, gdy trafisz na jedną konkretną firmę z długiej listy. Przy losowym trafieniu szanse masz jak jeden do trzydziestu trzech.
Sprawdziłem to na własnym rachunku
Teoria z danych API to jedno, więc wysłałem to samo pytanie dwa razy do tego samego modelu, GLM 5.2, wskazując raz najtańszego dostawcę, a raz jednego z droższych.
| Dostawca | Długość odpowiedzi | Rachunek | Realna stawka |
|---|---|---|---|
| StreamLake | 501 tokenów | 0,000444 USD | 0,87 USD / mln |
| Together | 332 tokeny | 0,001496 USD | 4,48 USD / mln |
Drugi dostawca dał odpowiedź krótszą o jedną trzecią i policzył za nią 3,4 razy więcej. To ten sam model, to samo pytanie i ta sama karta z ceną 0,88 dolara.
Wcześniej, w teście trzech zadań po polsku, zapytanie do GLM 5.2 poszło domyślnie do dostawcy liczącego 4,40 zamiast 0,88. Nie zauważyłbym tego, gdybym nie odczytywał kosztu z pola rozliczeniowego, które API zwraca przy każdej odpowiedzi.
Kontekst ma ten sam problem
Okno kontekstu też pochodzi od najlepszego dostawcy. W pięciu modelach z piętnastu największy kontekst oferuje jeden dostawca, a reszta daje mniej.
Najostrzejszy przypadek to GLM 5.3 Flash. Karta obiecuje 1 310 720 tokenów. Tyle daje wyłącznie Cloudflare. Dwudziestu czterech pozostałych dostawców daje 1 048 576, jeden daje 262 144. Jeśli zbudujesz coś pod obiecane 1,3 miliona, przy zwykłym zapytaniu odbijesz się od limitu i nie będzie w tym żadnego błędu po stronie usługi.
Co z tym zrobić
Sprawdziłem trzy sposoby i wszystkie działają. Wszystkie polegają na dopisaniu jednego pola provider do zapytania.
Wskaż dostawcę i zablokuj podmianę. Najbardziej stanowcze rozwiązanie: dostajesz dokładnie tę cenę i ten kontekst, o które prosisz, albo zapytanie się nie wykonuje.
"provider": { "order": ["StreamLake"], "allow_fallbacks": false }
Sortuj po cenie. Wygodniejsze, gdy nie chcesz przywiązywać kodu do jednej firmy.
"provider": { "sort": "price" }
Ustaw górny limit stawki. Odcina drogich dostawców, ale zostawia wybór wśród reszty.
"provider": { "max_price": { "completion": 1.0 } }
Do tego jedna rzecz, która nic nie kosztuje, a zmienia wszystko: proś API o rozliczenie i zapisuj je. Wystarczy dopisać "usage": {"include": true}, a odpowiedź przyniesie koszt zapytania i nazwę dostawcy, który je obsłużył. Bez tego pracujesz na cenniku z karty, a płacisz według innego.
Kiedy to naprawdę boli
Przy pojedynczym zapytaniu mówimy o ułamkach centa i nikt tego nie zauważy. Problem zaczyna się przy dwóch rzeczach.
Przy automatach, które chodzą całą dobę. Jeśli coś generuje treść albo przetwarza dokumenty w pętli, różnica pięciokrotna w cenie wyjścia zamienia rachunek za miesiąc z akceptowalnego w taki, o który pytasz księgową.
Przy modelach z rozumowaniem. Tam tokeny wyjścia to głównie myślenie modelu, którego w części modeli nie da się wyłączyć. Wyjście jest droższą stroną cennika, więc mnożnik dostawcy trafia dokładnie w to, czego jest najwięcej. Rozpisałem to na liczbach w tekście o GLM 5.3, gdzie rozumowanie stanowiło do 96 procent wszystkich tokenów wyjścia.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Czy to zarzut wobec OpenRouter
Nie. Wszystkie te dane są jawne, dostępne w API i widoczne na stronie modelu po rozwinięciu listy dostawców. Nikt niczego nie ukrywa i nie ma tu ukrytych opłat.
Jest natomiast różnica między „dostępne” a „widoczne”. Na karcie modelu jest jedna cena i jedna liczba kontekstu, a pod nią lista trzydziestu trzech firm z własnymi stawkami, do której nikt nie zagląda. Ja też nie zaglądałem, dopóki nie zobaczyłem rachunku.
Jeśli porównujesz modele po cenie z karty, porównujesz pojedyncze liczby, które nie mówią, u kogo zapytanie trafi.nie zostanie wykonane. Prawdziwe porównanie zaczyna się dopiero wtedy, gdy sam to wskażesz.
Dane o poszczególnych modelach zbieram na bieżąco w atlasie modeli, a własne pomiary jakości i kosztów w benchmarkach.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Dlaczego płacę więcej na OpenRouter niż pokazuje cena na karcie modelu?
Cena na karcie to stawka jednego z wielu dostawców hostujących ten model, a bez dodatkowych ustawień zapytanie trafia do dostawcy wybranego automatycznie - niekoniecznie najtańszego. Przy GLM 5.2 karta pokazuje 0,88 USD, ale jedno z testowych zapytań trafiło do dostawcy liczącego 4,40 USD.
Jak wybrać najtańszego dostawcę dla modelu na OpenRouter?
Wystarczy dopisać do zapytania pole 'provider' z parametrem 'sort': 'price', co zmusza OpenRouter do wyboru najtańszej dostępnej opcji. Alternatywnie można wskazać konkretną firmę przez 'order' i ustawić 'allow_fallbacks': false, by zapobiec podmianie.
Czy różnica cen między dostawcami tego samego modelu na OpenRouter jest duża?
Tak - przy DeepSeek V3.2 różnica wynosi 14,5 razy między najtańszym dostawcą (0,31 USD) a najdroższym (4,50 USD). W 12 modelach na 15 zbadanych najtańszą stawkę oferuje dokładnie jeden dostawca spośród nawet 33 dostępnych.
Czy okno kontekstu podane na karcie modelu w OpenRouter jest gwarantowane?
Nie - podana liczba tokenów pochodzi od najlepszego dostawcy, a reszta może oferować mniejszy kontekst. Dla GLM 5.3 Flash karta obiecuje 1 310 720 tokenów, ale tyle daje tylko Cloudflare, podczas gdy 24 innych dostawców oferuje 1 048 576, a jeden zaledwie 262 144.
