Blog pod ręką. Teraz w nowej odsłonie.
Wygodny czytnik, zapisane artykuły i wygląd, który znasz z Promptowego.
Polski tekst kosztuje więcej. Tu widać ile
Modele nie liczą liter ani słów, tylko tokeny. Polszczyzna dzieli się na tokeny gorzej niż angielski, bo ogonki i końcówki fleksyjne rozbijają wyrazy na kawałki. Wklej tekst, a zobaczysz dokładną liczbę tokenów, koszt w złotówkach i to, w którym miejscu model tnie Twoje słowa.
Wynik
Podatek od polszczyzny
Sprawdź na własnej parze
Dlaczego tak jest
Słownik tokenów powstaje ze statystyki tekstu treningowego, a w nim angielszczyzna dominuje. Częste angielskie słowa mają własny token. Polskie słowo z ogonkiem i końcówką fleksyjną najczęściej takiego tokenu nie ma, więc rozpada się na dwa, trzy albo cztery kawałki. Efekt: za tę samą treść płacisz więcej i szybciej wypełniasz okno kontekstu.
Jak model widzi Twój tekst
Najdroższe słowa w Twoim tekście
Słowa, które rozpadają się na najwięcej kawałków. Liczba to tokeny na jedno słowo.
Akapit po akapicie
Ile tokenów zjada każdy fragment. Przydaje się, gdy tniesz prompt systemowy.
Koszt i okno kontekstu
| Model | Wejście / mln | Wyjście / mln | Koszt | Zajmuje kontekstu |
|---|
Kolumna „zajmuje kontekstu” mówi, jaki procent okna modelu wypełnia sam ten tekst. Powyżej mniej więcej połowy okna jakość odpowiedzi zaczyna spadać, niezależnie od tego, co obiecuje specyfikacja.