Blog pod ręką. Teraz w nowej odsłonie.
Wygodny czytnik, zapisane artykuły i wygląd, który znasz z Promptowego.
Tokenizacja
Cięcie tekstu na tokeny - pierwszy krok każdej pracy modelu z językiem.
Tokenizacja to proces cięcia tekstu na tokeny według słownika ustalonego podczas treningu modelu. Częste słowa dostają własny token, rzadsze są składane z mniejszych kawałków - dlatego nietypowe nazwy czy słowa z literówkami rozpadają się na wiele tokenów.
Sposób tokenizacji tłumaczy część dziwactw modeli: kłopoty z liczeniem liter w słowie, wrażliwość na drobne zmiany zapisu czy różnice kosztów między językami. Dla użytkownika ważny wniosek praktyczny: zwięzły, czysty tekst to mniej tokenów, czyli niższy koszt i więcej miejsca w kontekście.