Autoregressive Sprachmodellierung
Du beginnst den Satz „Heute trinke ich …“. Nach dem Ergänzen von „Tee“ unterscheiden sich die Möglichkeiten der Fortsetzung von denen nach „Wasser“. Das Modell muss den bereits gewählten Text bei jedem weiteren Schritt berücksichtigen, statt alle Stellen unabhängig voneinander zu erraten.
Autoregressive Language Modeling beschreibt Text durch die Wahrscheinlichkeiten aufeinanderfolgender Tokens, also Textstücke, die von früheren Tokens abhängen. Das Modell bestimmt die Chancen möglicher Fortsetzungen; eine separate Regel wählt aus, was hinzugefügt wird.
Nach der Auswahl von „Tee“ gelangt dieses Fragment in den Kontext des nächsten Schritts. Die Wahrscheinlichkeit der gesamten Folge entsteht durch die Verbindung der Wahrscheinlichkeiten aufeinanderfolgender Entscheidungen. Beim Lernen ist der Text bekannt, sodass die Vorhersagen gegenüber den tatsächlichen weiteren Fragmenten bewertet werden können.
„Autoregressive“ bezeichnet eine Art der Modellierung, nicht den Namen einer einzelnen Architektur. Es bedeutet auch nicht, dass die wahrscheinlichste Fortsetzung wahr ist. Causal Masking ermöglicht das Training vieler Positionen zugleich, ohne auf ihre künftigen Antworten zuzugreifen.
Mechanismus und Details
Für eine Sequenz mit festgelegter Länge lautet die Darstellung:
bezeichnet das Token an Position , das vorherige Präfix und die Modellparameter. Der erste Faktor hat keine vorherigen Texttokens; eine Implementierung kann eine Anfangsmarkierung verwenden. Ein Modell mit begrenztem Kontextfenster nutzt nur das verfügbare Ende des Präfixes. Diese Verteilung und ein neuronales Modell zur Vorhersage des nächsten Wortes beschreiben Bengio et al., A Neural Probabilistic Language Model, §1.2 und §2.
Training und Generierung
Eigenes Beispiel: Nach dem Text „Heute trinke ich“ weist das Modell möglichen Fortsetzungen Wahrscheinlichkeiten zu. Wählt das Generierungsverfahren das Token für „Tee“, wird es Teil des Präfixes im nächsten Schritt. Die Verteilung selbst legt nicht fest, ob man die höchste Wahrscheinlichkeit auswählt oder zieht.
Beim Lernen ist die richtige Sequenz bekannt. Der Optimierer erhöht die logarithmische Wahrscheinlichkeit ihrer aufeinanderfolgenden Tokens. Das ursprüngliche GPT, §3.1, verwendet dieses Ziel für Texttokens und nutzt einen Transformer-Decoder.
Kausale Maskierung zusammen mit verschobenen Zielen erlaubt es, Vorhersagen für viele Positionen parallel zu berechnen, ohne die Antworten offenzulegen. Vaswani et al., §3.1, beschreiben dies für den Decoder. Die Abhängigkeit erzeugter Tokens von vorherigen Entscheidungen bleibt sequenziell.
Dies ist ein Verfahren zur Modellierung einer Verteilung, kein Architekturname: Es gab es bereits vor dem Transformer. In einem typischen texterzeugenden Modell liefert der LM Head Logits, aus denen Softmax die Verteilung des nächsten Tokens bestimmt.