Token w AI: co to jest, ile to znaków i dlaczego polski kosztuje więcej

👁 115 przeczytań
Token to najmniejszy kawałek tekstu, na jaki model dzieli to, co dostaje i co pisze. Nie jest to litera ani słowo, tylko coś pomiędzy: częsty wyraz bywa jednym tokenem, rzadki rozpada się na kilka kawałków. To jednostka, w której liczy się limity, pamięć i rachunki za API, więc warto wiedzieć, jak działa.
Ile to jest w praktyce
Dla angielskiego przyjmuje się z grubsza, że token to około czterech znaków, czyli trzy czwarte słowa. Polski wypada gorzej, bo odmiana i ogonki rozbijają wyrazy na więcej kawałków; ten sam tekst po polsku potrafi zająć wyraźnie więcej tokenów niż po angielsku. Praktyczny wniosek: przy rozliczeniu za tokeny polski jest droższy od angielskiego przy tej samej treści. Rząd wielkości sprawdzisz, dzieląc liczbę znaków przez trzy; dokładną liczbę znaków policzysz w liczniku znaków.
Gdzie tokeny mają znaczenie
- Okno kontekstowe. Limit „128 tysięcy tokenów” to limit na całą rozmowę razem z dokumentami, nie na jedno pytanie.
- Cena w API. Płacisz osobno za tokeny wejściowe i wyjściowe, a te drugie są zwykle kilka razy droższe.
- Szybkość. Model generuje token po tokenie, więc dłuższa odpowiedź to dłuższe czekanie.
- Obcinanie. Po przekroczeniu okna najstarsza część rozmowy wypada i model przestaje o niej pamiętać, często bez ostrzeżenia.
Jak oszczędzać tokeny
Nie wklejaj całych dokumentów, jeśli potrzebujesz jednego rozdziału. Zacznij nową rozmowę zamiast ciągnąć wątek na sto wiadomości, bo cała historia jest doliczana za każdym razem. W zadaniach masowych używaj mniejszego modelu do prostych kroków, a dużego tylko tam, gdzie trzeba. Ceny poszczególnych planów i modeli zbieram w hubie cenowym.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Najczęstsze pytania
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Czy token to to samo co słowo?
Nie. Słowo może być jednym tokenem albo kilkoma, zależnie od tego, jak często występuje w danych, na których uczono tokenizator.
Dlaczego polski zużywa więcej tokenów?
Bo odmiana daje wiele rzadkich form, a rzadkie ciągi znaków rozbijane są na mniejsze kawałki. To cecha tokenizatora, nie złośliwość dostawcy.
Czy liczba tokenów wpływa na jakość odpowiedzi?
Pośrednio: im bliżej granicy okna, tym większa szansa, że model zgubi wcześniejsze ustalenia. Więcej o samych modelach w tekście LLM.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
