Token Embedding
Token Embedding to wektor przypisany identyfikatorowi tokena w tabeli parametrów modelu. Identyfikator wskazuje wiersz tabeli; nie jest liczbą, której wielkość opisuje znaczenie tokena. Warstwa Embedding zamienia ciąg identyfikatorów na ciąg wektorów o ustalonym wymiarze. Tak działa warstwa Embedding w Keras.
Od identyfikatora do wektora
Wyobraźmy sobie fragment tabeli o trzech współrzędnych:
| Identyfikator | Wektor |
|---|---|
| 6 | [0,2; −0,1; 0,5] |
| 9 | [−0,4; 0,3; 0,8] |
Dla wejścia [6, 9, 6] pobieramy kolejno pierwszy, drugi i ponownie pierwszy z pokazanych wierszy. To wymyślone wartości, a średniki oddzielają współrzędne. Powtórzony identyfikator daje ten sam wektor z tej samej tabeli, nawet jeśli występuje w innym miejscu zdania.
Token Embedding nie zawiera jeszcze wyniku analizy sąsiednich tokenów. Self-attention może później nadać dwóm wystąpieniom różne reprezentacje zależne od kontekstu. Positional Encoding dostarcza osobno informacji o miejscu w sekwencji.
W oryginalnym Transformer uczono embeddings razem z modelem; nie wymagano wcześniejszego treningu Word2Vec. Opisuje to Attention Is All You Need, §3.4.
Szerzej o późniejszym przekształcaniu wektorów mówi artykuł o attention. Jego określenie „updated embeddings” odnosi się do reprezentacji po obliczeniach, które należy odróżnić od samego odczytu tabeli.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.