Back to archive

Token

Wklejasz do czatu jedno zdanie, a licznik pokazuje kilkanaście jednostek. Dlaczego nie tyle, ile jest słów? Komputer potrzebuje ustalonego sposobu dzielenia tekstu, który poradzi sobie również z rzadkimi nazwami, interpunkcją i fragmentami kodu.

Taką jednostką jest Token: kawałek tekstu ze słownika używanego przez dany model. Może obejmować całe słowo, jego część, znak albo spację razem z następującymi literami. Program zwany tokenizerem dzieli tekst i zamienia kawałki na numery; dopiero te numery trafiają do modelu.

Na przykład „Lubię czytać książki.” można ilustracyjnie podzielić na Lubię, czy, tać, książ, ki, .. To sześć tokenów, choć zdanie ma trzy słowa. Rzeczywisty podział zależy od tokenizera — ten przykład nie jest wynikiem konkretnego modelu. Model tworzący odpowiedź przewiduje kolejne takie kawałki, które program ponownie składa w tekst.

Tokeny pomagają zrozumieć limity długości rozmowy i sposób naliczania opłat w wielu usługach. Liczba słów sama nie wystarczy do ich oszacowania. Token jest jednostką zapisu, a nie jednostką znaczenia: kawałek słowa nie musi mieć osobnego sensu. Powstawanie takiego podziału opisuje Byte Pair Encoding. Dokumentacja Hugging Face wyjaśnia tokenizację i jej warianty.

Powiązania

42a5b1a⁝ Typy Tokenów LLM