Zurück zum Archiv
#ai#llm#glossary#aigen

Pre-Training

Du möchtest, dass ein Modell Zusammenhänge in der Sprache erkennt, bevor du es an eine konkrete Arbeit anpasst, etwa das Klassifizieren von Kundennachrichten. Antworten für den gesamten Text von Hand vorzubereiten wäre nicht machbar. Aus dem Text selbst lassen sich jedoch Lernaufgaben bilden.

Pre-training ist die Phase, in der Parameter entwickelt werden, die den Ausgangspunkt für die weitere Nutzung oder Anpassung des Modells bilden. Parameter sind Zahlen, die seine Berechnungen steuern. Bei Sprachmodellen entsteht das Signal häufig aus einer großen Textsammlung.

Aus dem Satz „Ala hat eine Katze“ lässt sich die Aufgabe bilden, das nächste Fragment nach „Ala hat eine“ vorherzusagen oder das verdeckte Wort in „Ala [MASK] eine Katze“ wiederherzustellen. Beide Übungen nutzen vorhandenen Text, lernen aber mit unterschiedlichem Zugang zum Kontext.

Der Name der Phase schreibt weder eine einzelne Aufgabe noch eine Architektur vor. Nach dem Pre-training muss das Modell Nutzeranweisungen noch nicht gut ausführen. Fine-tuning kann es später an ausgewählte Beispiele und Verhaltensweisen anpassen.

Mechanismus und Details

Die Bezeichnung beschreibt die Rolle der Phase im Lernprozess. Sie schreibt weder eine bestimmte Architektur noch eine bestimmte Zielfunktion vor.

Gleiche Phase, unterschiedliche Aufgaben

Im ursprünglichen GPT lernt das Modell, das nächste Token anhand der vorherigen vorherzusagen. Das ist Autoregressive Language Modeling. Die Autoren beschreiben diese Phase vor der Anpassung an Aufgaben mit Etiketten in Improving Language Understanding by Generative Pre-Training, §3.1–3.2.

Das ursprüngliche BERT verwendet andere Ziele: Es rekonstruiert ausgewählte Tokens nach einer Störung der Eingabe und erkennt, ob zwei Textstücke im Korpus aufeinanderfolgten. Bei der Rekonstruktion eines Tokens kann es den Kontext auf beiden Seiten nutzen. Dies sind konkrete Aufgaben aus dem BERT-Paper, §3.1, keine verpflichtende Kombination für jedes Modell.

Eigenes Beispiel für den Unterschied: Aus der Sequenz A B C kann man eine Aufgabe zur Vorhersage von C nach A B oder zur Rekonstruktion von B aus A [MASK] C erstellen. Beide Signale stammen aus dem verfügbaren Text, erfordern aber einen unterschiedlichen Informationsfluss. Ein fehlendes manuell vergebenes Label bedeutet kein fehlendes Trainingsziel.

Was nach dem Training bleibt

Das gespeicherte Modell enthält die erlernten Parameter. Dazu gehört unter anderem die Tabelle des Token-Embeddings, die bei GPT zusammen mit dem restlichen Netz trainiert wird. Die nächste Phase, das Fine-Tuning, beginnt mit bereits erlernten Parametern und passt das Modell an eine bestimmte Anwendung an.

Das Wort „pre-trained“ allein sagt noch nicht, auf welchen Daten ein Modell trainiert wurde, was es optimiert hat oder wie gut es eine konkrete Aufgabe ausführen wird. Diese Informationen müssen der Beschreibung des jeweiligen Modells entnommen werden.