Tokeny AI: co to jest i ile kosztują (kalkulator kosztu API)
Tokeny w API od strony pieniędzy: interaktywny kalkulator kosztu, aktualne ceny 20 modeli ze źródłami, pomiar polskiego tekstu na 7 tokenizatorach, myślenie, cache i sposoby na niższy rachunek.

👁 116 przeczytań
- Token to podstawowa jednostka rozliczeniowa API - ceny wahają się od 0,10 USD (GPT-6 Luna) do 50 USD za milion tokenów wyjścia najdroższych modeli.
- Polski tekst kosztuje od 38% (Gemini 3.8 Flash) do ponad 100% (Llama 3.3 70B) więcej niż ten sam tekst po angielsku, zależnie od użytego modelu.
- Modele rozumujące doliczają tokeny myślenia do wyjścia - w teście Gemini 3.8 Flash na dwuzdaniową odpowiedź zużył 462 tokeny, z czego 390 to samo myślenie.
Token to kawałek tekstu, na który model dzieli Twoje pytanie i swoją odpowiedź. W API płacisz osobno za tokeny wejścia i wyjścia, a stawki podaje się za milion tokenów: od 0,10 USD (GPT-6 Luna) do 50 USD za wyjście najdroższych modeli. Poniżej masz kalkulator kosztu, aktualną tabelę cen z 4 października 2026 i mój pomiar, ile więcej tokenów zużywa tekst po polsku. To część ścieżki API AI od zera; samą definicję tokena rozwijam w tekście Token w AI: co to jest i ile to znaków.
Stan na 4 października 2026
- Najtańsze sensowne modele: GPT-6 Luna 0,10 / 0,50 USD, Gemini 2.5 Flash-Lite 0,10 / 0,40 USD, Mistral Small 4 0,15 / 0,60 USD za milion tokenów wejścia / wyjścia.
- Środek: Claude Sonnet 5.5 i GPT-6.1 Sol po 2 / 10 USD, Gemini 3.8 Flash 0,75 / 3,75 USD (cena promocyjna do końca 2026).
- Najdroższe: GPT-6 Astra i Claude Fable 5.1 po 10 / 50 USD.
- Polski jest droższy: w moim pomiarze ten sam akapit po polsku zajął od 1,38 do 2,11 razy więcej tokenów niż po angielsku.
Co to jest token w praktyce
Model nie widzi liter ani słów, tylko numery kawałków tekstu ze swojego słownika. Częste angielskie słowo to zwykle jeden token, rzadsze albo odmienione słowo rozpada się na kilka. Sprawdziłem to tokenizatorem o200k_base, którego używają nowsze modele OpenAI:
"""Ile tokenów ma tekst po polsku i po angielsku, i ile kosztuje zapytanie."""
import os
import tiktoken
from dotenv import load_dotenv
from openai import OpenAI
PL = "Sztuczna inteligencja zmienia sposób, w jaki piszemy, programujemy i szukamy informacji."
EN = "Artificial intelligence is changing the way we write, code and search for information."
# o200k_base to tokenizator nowszych modeli OpenAI; inne firmy mają własne, więc liczby się różnią
enc = tiktoken.get_encoding("o200k_base")
for nazwa, tekst in (("PL", PL), ("EN", EN)):
tokeny = enc.encode(tekst)
print(f"{nazwa}: {len(tekst)} znaków, {len(tekst.split())} słów, {len(tokeny)} tokenów (o200k_base)")
print(" kawałki:", [enc.decode([t]) for t in tokeny])
# Prawdziwe liczby z API: każdy model liczy po swojemu
load_dotenv()
client = OpenAI(base_url="https://openrouter.ai/api/v1", api_key=os.environ["OPENROUTER_API_KEY"])
print()
for model in ("openai/gpt-6-luna", "google/gemini-3.8-flash", "anthropic/claude-haiku-4.5", "mistralai/mistral-small-2603"):
r = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": "Powtórz dokładnie to zdanie: " + PL}],
max_tokens=300,
)
u = r.usage
print(f"{model:30} wejście {u.prompt_tokens:4} wyjście {u.completion_tokens:4} koszt {u.cost:.6f} USD")PL: 88 znaków, 11 słów, 25 tokenów (o200k_base)
kawałki: ['S', 'zt', 'uc', 'zna', ' intelig', 'enc', 'ja', ' zm', 'ienia', ' sposób', ',', ' w', ' jaki', ' pis', 'z', 'emy', ',', ' program', 'ujemy', ' i', ' sz', 'uk', 'amy', ' informacji', '.']
EN: 86 znaków, 13 słów, 15 tokenów (o200k_base)
kawałki: ['Artificial', ' intelligence', ' is', ' changing', ' the', ' way', ' we', ' write', ',', ' code', ' and', ' search', ' for', ' information', '.']Zdanie po angielsku: 15 tokenów, prawie każde słowo w całości. To samo po polsku: 25 tokenów, bo „Sztuczna” rozpadła się na cztery kawałki, a „piszemy” na trzy. Odmiana i polskie znaki sprawiają, że słownik tokenizatora rzadziej ma gotowy kawałek na całe słowo.
Mój pomiar: o ile drożej po polsku
Jeden tokenizator to za mało, bo każda firma ma własny. Wysłałem więc ten sam akapit (439 znaków po polsku, 420 po angielsku) do siedmiu modeli przez API i odczytałem, ile tokenów policzył każdy z nich. Od wyniku odjąłem stały narzut szablonu rozmowy.
"""Ile więcej tokenów zużywa polski niż angielski? Pomiar na prawdziwych tokenizatorach przez API.
Każdy model dostaje ten sam akapit po polsku i po angielsku; od wyniku odejmuję narzut szablonu rozmowy."""
import os
from dotenv import load_dotenv
from openai import OpenAI
load_dotenv()
client = OpenAI(base_url="https://openrouter.ai/api/v1", api_key=os.environ["OPENROUTER_API_KEY"])
PL = ("Wczoraj wieczorem próbowałem połączyć swój arkusz kalkulacyjny z modelem językowym. "
"Okazało się, że wystarczy kilkanaście linijek kodu, klucz API i odrobina cierpliwości. "
"Najwięcej czasu zajęło mi zrozumienie, dlaczego odpowiedzi przychodzą w formacie JSON "
"i jak policzyć, ile właściwie kosztuje jedno zapytanie. Teraz automat streszcza mi "
"codziennie czterdzieści wiadomości od klientów, a rachunek za miesiąc nie przekracza kilku dolarów.")
EN = ("Last night I tried to connect my spreadsheet to a language model. "
"It turned out that a dozen lines of code, an API key and a bit of patience were enough. "
"What took me the longest was understanding why the answers come back in JSON format "
"and how to calculate how much a single request actually costs. Now the automation summarises "
"forty customer messages for me every day, and the monthly bill stays under a few dollars.")
MODELE = ["openai/gpt-6-luna", "anthropic/claude-sonnet-5.5", "anthropic/claude-haiku-4.5",
"google/gemini-3.8-flash", "mistralai/mistral-small-2603", "deepseek/deepseek-v4-flash",
"meta-llama/llama-3.3-70b-instruct"]
def tokeny_wejscia(model, tekst):
r = client.chat.completions.create(model=model, messages=[{"role": "user", "content": tekst}], max_tokens=16)
return r.usage.prompt_tokens, r.usage.cost or 0
print(f"Znaki: PL {len(PL)}, EN {len(EN)}\n")
print(f"{'model':34} {'PL':>5} {'EN':>5} PL/EN")
koszt = 0
for m in MODELE:
narzut, k0 = tokeny_wejscia(m, ".")
pl, k1 = tokeny_wejscia(m, PL)
en, k2 = tokeny_wejscia(m, EN)
koszt += k0 + k1 + k2
pl, en = pl - narzut + 1, en - narzut + 1 # "." to jeden token
print(f"{m:34} {pl:5} {en:5} {pl / en:.2f}x")
print(f"\nKoszt całego pomiaru: {koszt:.5f} USD")Znaki: PL 439, EN 420
model PL EN PL/EN
openai/gpt-6-luna 126 84 1.50x
anthropic/claude-sonnet-5.5 214 121 1.77x
anthropic/claude-haiku-4.5 159 85 1.87x
google/gemini-3.8-flash 116 84 1.38x
mistralai/mistral-small-2603 138 84 1.64x
deepseek/deepseek-v4-flash 145 84 1.73x
meta-llama/llama-3.3-70b-instruct 177 84 2.11x
Koszt całego pomiaru: 0.00225 USD| Model | Tokeny PL | Tokeny EN | Polski drożej o |
|---|---|---|---|
| Gemini 3.8 Flash | 116 | 84 | 38% |
| GPT-6 Luna | 126 | 84 | 50% |
| Mistral Small 4 | 138 | 84 | 64% |
| DeepSeek V4 Flash | 145 | 84 | 73% |
| Claude Sonnet 5.5 | 214 | 121 | 77% |
| Claude Haiku 4.5 | 159 | 85 | 87% |
| Llama 3.3 70B | 177 | 84 | 111% |
Wnioski, których nie widać w cennikach:
- Polski tekst kosztuje od 38% do ponad 100% więcej niż ten sam tekst po angielsku, zależnie od modelu.
- Claude Sonnet 5.5 liczy najwięcej tokenów w liczbach bezwzględnych: 214 na ten akapit, o 70% więcej niż GPT-6 Luna. Anthropic sam pisze, że nowy tokenizator (od Claude 4.7) daje około 30% więcej tokenów na ten sam tekst. Przy równej cenie za milion tokenów (Sonnet 5.5 i GPT-6.1 Sol po 2 / 10 USD) rachunek za polski tekst w Claude będzie więc wyraźnie wyższy.
- Gemini dzieli polski najoszczędniej z badanych modeli.
- Na przeliczenie słów na tokeny przyjmuję w praktyce: 1 polskie słowo to około 2 tokenów w GPT i Gemini, 2,7 w Claude Haiku 4.5 i aż 3,7 w Claude Sonnet 5.5 (w moim akapicie 58 słów dało odpowiednio 116-126, 159 i 214 tokenów). Strona A4 polskiego tekstu (1800 znaków) to około 500-900 tokenów.
Cały pomiar (21 zapytań) kosztował 0,00225 USD.
Wejście, wyjście, myślenie i cache
Rachunek za zapytanie składa się z kilku pozycji:
- Tokeny wejścia - wszystko, co wysyłasz: system prompt, historia rozmowy, dokumenty, opisy narzędzi. W czacie z historią to rośnie z każdą wiadomością, bo całą rozmowę wysyłasz od nowa.
- Tokeny wyjścia - to, co model wygeneruje. Zwykle 4-5 razy droższe od wejścia (u Kimi K3 nawet 5 razy, przy cenie 3 / 15 USD).
- Tokeny myślenia - modele rozumujące najpierw „myślą”, a te tokeny są liczone jak wyjście. W moim teście Gemini 3.8 Flash na dwuzdaniową odpowiedź zużył 462 tokeny wyjścia, z czego 390 to myślenie. Więcej przykładów w tekście 14 tysięcy tokenów myślenia nad opisem czajnika.
- Odczyt z pamięci podręcznej (cache) - gdy wysyłasz ten sam długi początek zapytania wiele razy, dostawca liczy go dużo taniej: w Claude 10% ceny wejścia (w Opus 5.5 nawet 5%), w GPT-6.1 Sol 0,10 USD zamiast 2 USD.
- Tryb wsadowy (batch) - jeśli wynik może poczekać do 24 godzin, OpenAI, Anthropic i Google liczą połowę ceny.
Jak sprawdzić, ile naprawdę zapłaciłeś? Każda odpowiedź API ma pole usage. Ten sam pomiar dla czterech modeli, z kosztem zwróconym przez OpenRouter:
openai/gpt-6-luna wejście 41 wyjście 29 koszt 0.000019 USD
google/gemini-3.8-flash wejście 30 wyjście 173 koszt 0.000671 USD
anthropic/claude-haiku-4.5 wejście 50 wyjście 34 koszt 0.000220 USD
mistralai/mistral-small-2603 wejście 52 wyjście 28 koszt 0.000025 USDKalkulator kosztu API
Wpisz, ile zapytań dziennie wysyłasz i ile mają tokenów. Przyciski z przykładami ustawiają typowe scenariusze. Pamiętaj, że przy tekście po polsku liczba tokenów zależy od modelu (patrz tabela wyżej), a modele rozumujące doliczają myślenie do wyjścia.
Kalkulator kosztu API
Ceny za 1 mln tokenów w USD, bez VAT, sprawdzone 4 października 2026. Liczy w przeglądarce, nic nie wysyła.
cursor:pointer;font-size:.95em">Porównaj wszystkie modele dla tych samych liczb
Przykładowe miesięczne koszty, które policzyłem tym kalkulatorem (30 dni):
| Model | 100 maili dziennie do streszczenia (800 / 150 tokenów) | Chatbot: 500 rozmów dziennie (3000 / 300) | Agent: 200 zadań dziennie (15 000 / 2000) |
|---|---|---|---|
| GPT-6 Luna | 0,47 USD | 6,75 USD | 15 USD |
| Mistral Small 4 | 0,63 USD | 9,45 USD | 20,70 USD |
| DeepSeek V4.1 Flash (szczyt) | 1,26 USD | 18,90 USD | 41,40 USD |
| Gemini 3.8 Flash | 3,49 USD | 50,63 USD | 112,50 USD |
| Claude Haiku 4.5 | 4,65 USD | 67,50 USD | 150 USD |
| Claude Sonnet 5.5 / GPT-6.1 Sol | 9,30 USD | 135 USD | 300 USD |
| Claude Opus 5.5 | 18,60 USD | 270 USD | 600 USD |
Różnica między najtańszym a najdroższym modelem z tabeli to 40 razy. Dlatego zanim wybierzesz model „na wszelki wypadek najlepszy”, sprawdź na 20 prawdziwych przykładach, czy tańszy nie wystarczy.
Tabela cen API (4 października 2026)
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
| Firma | Model | Wejście (USD / 1 mln) | Wyjście (USD / 1 mln) | Kontekst | Źródło ceny |
|---|---|---|---|---|---|
| OpenAI | GPT-6 Luna | 0,10 | 0,50 | 1,05 mln | cennik OpenAI |
| OpenAI | GPT-6.1 Sol | 2,00 | 10,00 | 1,05 mln | cennik OpenAI |
| OpenAI | GPT-6 Astra | 10,00 | 50,00 | 1,05 mln | cennik OpenAI |
| Anthropic | Claude Haiku 4.5 | 1,00 | 5,00 | 200 tys. | cennik Anthropic |
| Anthropic | Claude Sonnet 5.5 | 2,00 | 10,00 | 1 mln | cennik Anthropic |
| Anthropic | Claude Opus 5.5 | 4,00 | 20,00 | 1 mln | cennik Anthropic |
| Anthropic | Claude Fable 5.1 | 10,00 | 50,00 | 1 mln | cennik Anthropic |
| Gemini 2.5 Flash-Lite | 0,10 | 0,40 | 1 mln | cennik Gemini API | |
| Gemini 3.5 Flash-Lite | 0,30 | 2,50 | 1 mln | cennik Gemini API | |
| Gemini 3.8 Flash | 0,75 (od 2027: 1,50) | 3,75 (od 2027: 7,50) | 1 mln | cennik Gemini API | |
| Gemini 3.1 Pro (preview) | 2,00 | 12,00 | 1 mln | karta modelu OpenRouter | |
| xAI | Grok 4.7 | 2,00 | 6,00 | 500 tys. | dokumentacja xAI |
| DeepSeek | V4.1 Flash | 0,30 (poza szczytem 0,15) | 1,20 (poza szczytem 0,60) | 1 mln | cennik DeepSeek |
| DeepSeek | V4 Pro | 1,32 (poza szczytem 0,66) | 3,96 (poza szczytem 1,98) | 1 mln | cennik DeepSeek |
| Mistral | Mistral Small 4 | 0,15 | 0,60 | 256 tys. | cennik Mistral |
| Mistral | Mistral Medium 3.5 | 1,50 | 7,50 | 256 tys. | cennik Mistral |
| Moonshot | Kimi K3 | 3,00 | 15,00 | 1 mln | cennik platform.kimi.ai |
| Z.ai | GLM-5.3 | 1,40 | 4,40 | 1 mln | karta modelu OpenRouter |
| Alibaba | Qwen3.8 Max | 2,00 | 6,00 | 1 mln | karta modelu OpenRouter |
| otwarty | gpt-oss-120b | 0,037 | 0,17 | 131 tys. | najtańszy dostawca OpenRouter |
Ceny bez VAT, za standardowy tryb. Kilka zastrzeżeń:
- Progi długiego kontekstu: GPT-6 powyżej 272 tys. tokenów w zapytaniu liczy 2 razy więcej za wejście i 1,5 raza za wyjście, Grok 4.7 powyżej 200 tys. podwaja stawki (opisane w tekście Próg 200 tysięcy tokenów). Claude od wersji 4.6 nie ma dopłaty za długi kontekst.
- DeepSeek ma ceny zależne od pory: szczyt to 1:00-4:00 i 6:00-10:00 UTC w dni robocze (w Polsce w październiku 3:00-6:00 i 8:00-12:00), w pozostałych godzinach i w weekendy płacisz połowę. Szczegóły w przewodniku DeepSeek.
- OpenRouter przy modelach otwartych pokazuje cenę jednego dostawcy, a zapytanie może trafić do droższego. Jak to kontrolować, opisałem w tekście Cena na OpenRouter to nie cena, którą płacisz.
- Szczegółowe cenniki: GPT-6 Sol i Luna, Mistral, Kimi, Gemini.
Jak płacić mniej za tokeny
- Dobierz model do zadania. Klasyfikacja, wyciąganie danych i krótkie streszczenia działają na modelach za 0,10-0,30 USD. Drogie modele zostaw do trudnych zadań.
- Ustaw max_tokens. Odcina zbyt długie odpowiedzi i chroni przed niespodzianką na rachunku (więcej w tekście o parametrach API).
- Kontroluj myślenie. Parametr
reasoning_effort(alboeffortw Claude) ustawiony na niski poziom potrafi zmniejszyć liczbę tokenów wyjścia kilka razy przy prostych zadaniach. - Nie wysyłaj całej historii. W czacie po kilkudziesięciu wiadomościach streszczaj starsze albo je obcinaj.
- Stały początek zapytania na górze. Długi system prompt i dokumenty na początku, zmienna część na końcu - wtedy działa cache.
- Batch dla zadań nocnych. Połowa ceny, jeśli wynik może poczekać.
- Policz lokalnie. Przy dużej skali porównaj z modelem na własnej karcie: Lokalny model czy API.
Najczęstsze pytania
Ile kosztuje token AI?
Pojedynczy token kosztuje ułamki centa: przy cenie 2 USD za milion to 0,000002 USD. Dlatego ceny podaje się za milion tokenów. W październiku 2026 rozrzut sięga od kilku centów (najtańsze modele otwarte) do 50 USD za milion tokenów wyjścia.
Ile tokenów ma jedno słowo po polsku?
W moim pomiarze około 2 tokenów w modelach GPT i Gemini, 2,7 w Claude Haiku 4.5 i 3,7 w Claude Sonnet 5.5. Angielskie słowo to zwykle 1,1-1,3 tokena. Dokładną liczbę dla swojego tekstu sprawdzisz w polu usage odpowiedzi API.
Ile to jest milion tokenów?
Po polsku mniej więcej 1100-2100 stron A4, zależnie od modelu, czyli kilka grubych książek. Po angielsku około 750 tys. słów.
Dlaczego tokeny wyjścia są droższe?
Wejście model przetwarza naraz, równolegle. Wyjście generuje token po tokenie i każdy wymaga osobnego przebiegu przez cały model, co zajmuje więcej czasu i mocy obliczeniowej.
Czy tokeny w ChatGPT Plus też się liczą?
W abonamentach czatów płacisz stałą kwotę, a tokeny wpływają tylko na limity (długość rozmowy, liczba wiadomości). Za tokeny płacisz bezpośrednio wyłącznie w API.
Czy kalkulator uwzględnia polski tekst?
Kalkulator liczy koszt dla podanej liczby tokenów. Jeśli szacujesz z liczby słów, pomnóż je przez 2 dla GPT i Gemini albo przez 2,7-3,7 dla Claude.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Źródła i data sprawdzenia
Ceny sprawdziłem 4 października 2026 na stronach dostawców i w API modeli OpenRouter. Pomiar tokenów wykonałem tego samego dnia na Windows 11, Python 3.13.15, przez OpenRouter.
- OpenAI - cennik API
- Anthropic - cennik API i tokenizator
- Google - cennik Gemini API
- xAI - modele i ceny
- DeepSeek - cennik
- Mistral - cennik
- OpenRouter - lista modeli z cenami (API)
- tiktoken - tokenizator OpenAI
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
