✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Tokeny AI: co to jest i ile kosztują (kalkulator kosztu API)

Tokeny w API od strony pieniędzy: interaktywny kalkulator kosztu, aktualne ceny 20 modeli ze źródłami, pomiar polskiego tekstu na 7 tokenizatorach, myślenie, cache i sposoby na niższy rachunek.

14 min czytania
Klamry { } i napis Tokeny AI - ceny i kalkulator kosztu API

👁 116 przeczytań

// w skrócie
  • Token to podstawowa jednostka rozliczeniowa API - ceny wahają się od 0,10 USD (GPT-6 Luna) do 50 USD za milion tokenów wyjścia najdroższych modeli.
  • Polski tekst kosztuje od 38% (Gemini 3.8 Flash) do ponad 100% (Llama 3.3 70B) więcej niż ten sam tekst po angielsku, zależnie od użytego modelu.
  • Modele rozumujące doliczają tokeny myślenia do wyjścia - w teście Gemini 3.8 Flash na dwuzdaniową odpowiedź zużył 462 tokeny, z czego 390 to samo myślenie.

Token to kawałek tekstu, na który model dzieli Twoje pytanie i swoją odpowiedź. W API płacisz osobno za tokeny wejścia i wyjścia, a stawki podaje się za milion tokenów: od 0,10 USD (GPT-6 Luna) do 50 USD za wyjście najdroższych modeli. Poniżej masz kalkulator kosztu, aktualną tabelę cen z 4 października 2026 i mój pomiar, ile więcej tokenów zużywa tekst po polsku. To część ścieżki API AI od zera; samą definicję tokena rozwijam w tekście Token w AI: co to jest i ile to znaków.

Stan na 4 października 2026

  • Najtańsze sensowne modele: GPT-6 Luna 0,10 / 0,50 USD, Gemini 2.5 Flash-Lite 0,10 / 0,40 USD, Mistral Small 4 0,15 / 0,60 USD za milion tokenów wejścia / wyjścia.
  • Środek: Claude Sonnet 5.5 i GPT-6.1 Sol po 2 / 10 USD, Gemini 3.8 Flash 0,75 / 3,75 USD (cena promocyjna do końca 2026).
  • Najdroższe: GPT-6 Astra i Claude Fable 5.1 po 10 / 50 USD.
  • Polski jest droższy: w moim pomiarze ten sam akapit po polsku zajął od 1,38 do 2,11 razy więcej tokenów niż po angielsku.

Co to jest token w praktyce

Model nie widzi liter ani słów, tylko numery kawałków tekstu ze swojego słownika. Częste angielskie słowo to zwykle jeden token, rzadsze albo odmienione słowo rozpada się na kilka. Sprawdziłem to tokenizatorem o200k_base, którego używają nowsze modele OpenAI:

"""Ile tokenów ma tekst po polsku i po angielsku, i ile kosztuje zapytanie."""
import os
import tiktoken
from dotenv import load_dotenv
from openai import OpenAI

PL = "Sztuczna inteligencja zmienia sposób, w jaki piszemy, programujemy i szukamy informacji."
EN = "Artificial intelligence is changing the way we write, code and search for information."

# o200k_base to tokenizator nowszych modeli OpenAI; inne firmy mają własne, więc liczby się różnią
enc = tiktoken.get_encoding("o200k_base")
for nazwa, tekst in (("PL", PL), ("EN", EN)):
    tokeny = enc.encode(tekst)
    print(f"{nazwa}: {len(tekst)} znaków, {len(tekst.split())} słów, {len(tokeny)} tokenów (o200k_base)")
    print("   kawałki:", [enc.decode([t]) for t in tokeny])

# Prawdziwe liczby z API: każdy model liczy po swojemu
load_dotenv()
client = OpenAI(base_url="https://openrouter.ai/api/v1", api_key=os.environ["OPENROUTER_API_KEY"])
print()
for model in ("openai/gpt-6-luna", "google/gemini-3.8-flash", "anthropic/claude-haiku-4.5", "mistralai/mistral-small-2603"):
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": "Powtórz dokładnie to zdanie: " + PL}],
        max_tokens=300,
    )
    u = r.usage
    print(f"{model:30} wejście {u.prompt_tokens:4}  wyjście {u.completion_tokens:4}  koszt {u.cost:.6f} USD")
PL: 88 znaków, 11 słów, 25 tokenów (o200k_base)
   kawałki: ['S', 'zt', 'uc', 'zna', ' intelig', 'enc', 'ja', ' zm', 'ienia', ' sposób', ',', ' w', ' jaki', ' pis', 'z', 'emy', ',', ' program', 'ujemy', ' i', ' sz', 'uk', 'amy', ' informacji', '.']
EN: 86 znaków, 13 słów, 15 tokenów (o200k_base)
   kawałki: ['Artificial', ' intelligence', ' is', ' changing', ' the', ' way', ' we', ' write', ',', ' code', ' and', ' search', ' for', ' information', '.']

Zdanie po angielsku: 15 tokenów, prawie każde słowo w całości. To samo po polsku: 25 tokenów, bo „Sztuczna” rozpadła się na cztery kawałki, a „piszemy” na trzy. Odmiana i polskie znaki sprawiają, że słownik tokenizatora rzadziej ma gotowy kawałek na całe słowo.

Mój pomiar: o ile drożej po polsku

Jeden tokenizator to za mało, bo każda firma ma własny. Wysłałem więc ten sam akapit (439 znaków po polsku, 420 po angielsku) do siedmiu modeli przez API i odczytałem, ile tokenów policzył każdy z nich. Od wyniku odjąłem stały narzut szablonu rozmowy.

"""Ile więcej tokenów zużywa polski niż angielski? Pomiar na prawdziwych tokenizatorach przez API.
Każdy model dostaje ten sam akapit po polsku i po angielsku; od wyniku odejmuję narzut szablonu rozmowy."""
import os
from dotenv import load_dotenv
from openai import OpenAI

load_dotenv()
client = OpenAI(base_url="https://openrouter.ai/api/v1", api_key=os.environ["OPENROUTER_API_KEY"])

PL = ("Wczoraj wieczorem próbowałem połączyć swój arkusz kalkulacyjny z modelem językowym. "
      "Okazało się, że wystarczy kilkanaście linijek kodu, klucz API i odrobina cierpliwości. "
      "Najwięcej czasu zajęło mi zrozumienie, dlaczego odpowiedzi przychodzą w formacie JSON "
      "i jak policzyć, ile właściwie kosztuje jedno zapytanie. Teraz automat streszcza mi "
      "codziennie czterdzieści wiadomości od klientów, a rachunek za miesiąc nie przekracza kilku dolarów.")
EN = ("Last night I tried to connect my spreadsheet to a language model. "
      "It turned out that a dozen lines of code, an API key and a bit of patience were enough. "
      "What took me the longest was understanding why the answers come back in JSON format "
      "and how to calculate how much a single request actually costs. Now the automation summarises "
      "forty customer messages for me every day, and the monthly bill stays under a few dollars.")

MODELE = ["openai/gpt-6-luna", "anthropic/claude-sonnet-5.5", "anthropic/claude-haiku-4.5",
          "google/gemini-3.8-flash", "mistralai/mistral-small-2603", "deepseek/deepseek-v4-flash",
          "meta-llama/llama-3.3-70b-instruct"]


def tokeny_wejscia(model, tekst):
    r = client.chat.completions.create(model=model, messages=[{"role": "user", "content": tekst}], max_tokens=16)
    return r.usage.prompt_tokens, r.usage.cost or 0


print(f"Znaki: PL {len(PL)}, EN {len(EN)}\n")
print(f"{'model':34} {'PL':>5} {'EN':>5}  PL/EN")
koszt = 0
for m in MODELE:
    narzut, k0 = tokeny_wejscia(m, ".")
    pl, k1 = tokeny_wejscia(m, PL)
    en, k2 = tokeny_wejscia(m, EN)
    koszt += k0 + k1 + k2
    pl, en = pl - narzut + 1, en - narzut + 1   # "." to jeden token
    print(f"{m:34} {pl:5} {en:5}  {pl / en:.2f}x")
print(f"\nKoszt całego pomiaru: {koszt:.5f} USD")
Znaki: PL 439, EN 420

model                                 PL    EN  PL/EN
openai/gpt-6-luna                    126    84  1.50x
anthropic/claude-sonnet-5.5          214   121  1.77x
anthropic/claude-haiku-4.5           159    85  1.87x
google/gemini-3.8-flash              116    84  1.38x
mistralai/mistral-small-2603         138    84  1.64x
deepseek/deepseek-v4-flash           145    84  1.73x
meta-llama/llama-3.3-70b-instruct    177    84  2.11x

Koszt całego pomiaru: 0.00225 USD
ModelTokeny PLTokeny ENPolski drożej o
Gemini 3.8 Flash1168438%
GPT-6 Luna1268450%
Mistral Small 41388464%
DeepSeek V4 Flash1458473%
Claude Sonnet 5.521412177%
Claude Haiku 4.51598587%
Llama 3.3 70B17784111%

Wnioski, których nie widać w cennikach:

  • Polski tekst kosztuje od 38% do ponad 100% więcej niż ten sam tekst po angielsku, zależnie od modelu.
  • Claude Sonnet 5.5 liczy najwięcej tokenów w liczbach bezwzględnych: 214 na ten akapit, o 70% więcej niż GPT-6 Luna. Anthropic sam pisze, że nowy tokenizator (od Claude 4.7) daje około 30% więcej tokenów na ten sam tekst. Przy równej cenie za milion tokenów (Sonnet 5.5 i GPT-6.1 Sol po 2 / 10 USD) rachunek za polski tekst w Claude będzie więc wyraźnie wyższy.
  • Gemini dzieli polski najoszczędniej z badanych modeli.
  • Na przeliczenie słów na tokeny przyjmuję w praktyce: 1 polskie słowo to około 2 tokenów w GPT i Gemini, 2,7 w Claude Haiku 4.5 i aż 3,7 w Claude Sonnet 5.5 (w moim akapicie 58 słów dało odpowiednio 116-126, 159 i 214 tokenów). Strona A4 polskiego tekstu (1800 znaków) to około 500-900 tokenów.

Cały pomiar (21 zapytań) kosztował 0,00225 USD.

Wejście, wyjście, myślenie i cache

Rachunek za zapytanie składa się z kilku pozycji:

  1. Tokeny wejścia - wszystko, co wysyłasz: system prompt, historia rozmowy, dokumenty, opisy narzędzi. W czacie z historią to rośnie z każdą wiadomością, bo całą rozmowę wysyłasz od nowa.
  2. Tokeny wyjścia - to, co model wygeneruje. Zwykle 4-5 razy droższe od wejścia (u Kimi K3 nawet 5 razy, przy cenie 3 / 15 USD).
  3. Tokeny myślenia - modele rozumujące najpierw „myślą”, a te tokeny są liczone jak wyjście. W moim teście Gemini 3.8 Flash na dwuzdaniową odpowiedź zużył 462 tokeny wyjścia, z czego 390 to myślenie. Więcej przykładów w tekście 14 tysięcy tokenów myślenia nad opisem czajnika.
  4. Odczyt z pamięci podręcznej (cache) - gdy wysyłasz ten sam długi początek zapytania wiele razy, dostawca liczy go dużo taniej: w Claude 10% ceny wejścia (w Opus 5.5 nawet 5%), w GPT-6.1 Sol 0,10 USD zamiast 2 USD.
  5. Tryb wsadowy (batch) - jeśli wynik może poczekać do 24 godzin, OpenAI, Anthropic i Google liczą połowę ceny.

Jak sprawdzić, ile naprawdę zapłaciłeś? Każda odpowiedź API ma pole usage. Ten sam pomiar dla czterech modeli, z kosztem zwróconym przez OpenRouter:

openai/gpt-6-luna              wejście   41  wyjście   29  koszt 0.000019 USD
google/gemini-3.8-flash        wejście   30  wyjście  173  koszt 0.000671 USD
anthropic/claude-haiku-4.5     wejście   50  wyjście   34  koszt 0.000220 USD
mistralai/mistral-small-2603   wejście   52  wyjście   28  koszt 0.000025 USD

Kalkulator kosztu API

Wpisz, ile zapytań dziennie wysyłasz i ile mają tokenów. Przyciski z przykładami ustawiają typowe scenariusze. Pamiętaj, że przy tekście po polsku liczba tokenów zależy od modelu (patrz tabela wyżej), a modele rozumujące doliczają myślenie do wyjścia.

Kalkulator kosztu API

Ceny za 1 mln tokenów w USD, bez VAT, sprawdzone 4 października 2026. Liczy w przeglądarce, nic nie wysyła.

cursor:pointer;font-size:.95em">Porównaj wszystkie modele dla tych samych liczb

Przykładowe miesięczne koszty, które policzyłem tym kalkulatorem (30 dni):

Model100 maili dziennie do streszczenia (800 / 150 tokenów)Chatbot: 500 rozmów dziennie (3000 / 300)Agent: 200 zadań dziennie (15 000 / 2000)
GPT-6 Luna0,47 USD6,75 USD15 USD
Mistral Small 40,63 USD9,45 USD20,70 USD
DeepSeek V4.1 Flash (szczyt)1,26 USD18,90 USD41,40 USD
Gemini 3.8 Flash3,49 USD50,63 USD112,50 USD
Claude Haiku 4.54,65 USD67,50 USD150 USD
Claude Sonnet 5.5 / GPT-6.1 Sol9,30 USD135 USD300 USD
Claude Opus 5.518,60 USD270 USD600 USD

Różnica między najtańszym a najdroższym modelem z tabeli to 40 razy. Dlatego zanim wybierzesz model „na wszelki wypadek najlepszy”, sprawdź na 20 prawdziwych przykładach, czy tańszy nie wystarczy.

Tabela cen API (4 października 2026)

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

FirmaModelWejście (USD / 1 mln)Wyjście (USD / 1 mln)KontekstŹródło ceny
OpenAIGPT-6 Luna0,100,501,05 mlncennik OpenAI
OpenAIGPT-6.1 Sol2,0010,001,05 mlncennik OpenAI
OpenAIGPT-6 Astra10,0050,001,05 mlncennik OpenAI
AnthropicClaude Haiku 4.51,005,00200 tys.cennik Anthropic
AnthropicClaude Sonnet 5.52,0010,001 mlncennik Anthropic
AnthropicClaude Opus 5.54,0020,001 mlncennik Anthropic
AnthropicClaude Fable 5.110,0050,001 mlncennik Anthropic
GoogleGemini 2.5 Flash-Lite0,100,401 mlncennik Gemini API
GoogleGemini 3.5 Flash-Lite0,302,501 mlncennik Gemini API
GoogleGemini 3.8 Flash0,75 (od 2027: 1,50)3,75 (od 2027: 7,50)1 mlncennik Gemini API
GoogleGemini 3.1 Pro (preview)2,0012,001 mlnkarta modelu OpenRouter
xAIGrok 4.72,006,00500 tys.dokumentacja xAI
DeepSeekV4.1 Flash0,30 (poza szczytem 0,15)1,20 (poza szczytem 0,60)1 mlncennik DeepSeek
DeepSeekV4 Pro1,32 (poza szczytem 0,66)3,96 (poza szczytem 1,98)1 mlncennik DeepSeek
MistralMistral Small 40,150,60256 tys.cennik Mistral
MistralMistral Medium 3.51,507,50256 tys.cennik Mistral
MoonshotKimi K33,0015,001 mlncennik platform.kimi.ai
Z.aiGLM-5.31,404,401 mlnkarta modelu OpenRouter
AlibabaQwen3.8 Max2,006,001 mlnkarta modelu OpenRouter
otwartygpt-oss-120b0,0370,17131 tys.najtańszy dostawca OpenRouter

Ceny bez VAT, za standardowy tryb. Kilka zastrzeżeń:

  • Progi długiego kontekstu: GPT-6 powyżej 272 tys. tokenów w zapytaniu liczy 2 razy więcej za wejście i 1,5 raza za wyjście, Grok 4.7 powyżej 200 tys. podwaja stawki (opisane w tekście Próg 200 tysięcy tokenów). Claude od wersji 4.6 nie ma dopłaty za długi kontekst.
  • DeepSeek ma ceny zależne od pory: szczyt to 1:00-4:00 i 6:00-10:00 UTC w dni robocze (w Polsce w październiku 3:00-6:00 i 8:00-12:00), w pozostałych godzinach i w weekendy płacisz połowę. Szczegóły w przewodniku DeepSeek.
  • OpenRouter przy modelach otwartych pokazuje cenę jednego dostawcy, a zapytanie może trafić do droższego. Jak to kontrolować, opisałem w tekście Cena na OpenRouter to nie cena, którą płacisz.
  • Szczegółowe cenniki: GPT-6 Sol i Luna, Mistral, Kimi, Gemini.

Jak płacić mniej za tokeny

  1. Dobierz model do zadania. Klasyfikacja, wyciąganie danych i krótkie streszczenia działają na modelach za 0,10-0,30 USD. Drogie modele zostaw do trudnych zadań.
  2. Ustaw max_tokens. Odcina zbyt długie odpowiedzi i chroni przed niespodzianką na rachunku (więcej w tekście o parametrach API).
  3. Kontroluj myślenie. Parametr reasoning_effort (albo effort w Claude) ustawiony na niski poziom potrafi zmniejszyć liczbę tokenów wyjścia kilka razy przy prostych zadaniach.
  4. Nie wysyłaj całej historii. W czacie po kilkudziesięciu wiadomościach streszczaj starsze albo je obcinaj.
  5. Stały początek zapytania na górze. Długi system prompt i dokumenty na początku, zmienna część na końcu - wtedy działa cache.
  6. Batch dla zadań nocnych. Połowa ceny, jeśli wynik może poczekać.
  7. Policz lokalnie. Przy dużej skali porównaj z modelem na własnej karcie: Lokalny model czy API.

Najczęstsze pytania

Ile kosztuje token AI?

Pojedynczy token kosztuje ułamki centa: przy cenie 2 USD za milion to 0,000002 USD. Dlatego ceny podaje się za milion tokenów. W październiku 2026 rozrzut sięga od kilku centów (najtańsze modele otwarte) do 50 USD za milion tokenów wyjścia.

Ile tokenów ma jedno słowo po polsku?

W moim pomiarze około 2 tokenów w modelach GPT i Gemini, 2,7 w Claude Haiku 4.5 i 3,7 w Claude Sonnet 5.5. Angielskie słowo to zwykle 1,1-1,3 tokena. Dokładną liczbę dla swojego tekstu sprawdzisz w polu usage odpowiedzi API.

Ile to jest milion tokenów?

Po polsku mniej więcej 1100-2100 stron A4, zależnie od modelu, czyli kilka grubych książek. Po angielsku około 750 tys. słów.

Dlaczego tokeny wyjścia są droższe?

Wejście model przetwarza naraz, równolegle. Wyjście generuje token po tokenie i każdy wymaga osobnego przebiegu przez cały model, co zajmuje więcej czasu i mocy obliczeniowej.

Czy tokeny w ChatGPT Plus też się liczą?

W abonamentach czatów płacisz stałą kwotę, a tokeny wpływają tylko na limity (długość rozmowy, liczba wiadomości). Za tokeny płacisz bezpośrednio wyłącznie w API.

Czy kalkulator uwzględnia polski tekst?

Kalkulator liczy koszt dla podanej liczby tokenów. Jeśli szacujesz z liczby słów, pomnóż je przez 2 dla GPT i Gemini albo przez 2,7-3,7 dla Claude.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

Ceny sprawdziłem 4 października 2026 na stronach dostawców i w API modeli OpenRouter. Pomiar tokenów wykonałem tego samego dnia na Windows 11, Python 3.13.15, przez OpenRouter.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›