Greedy Decoding
Das Modell kann mehrere unterschiedliche Fragmente hinzufügen. Die einfachste Wahl besteht darin, immer das mit der höchsten Wahrscheinlichkeit zu nehmen. Das erspart die Betrachtung von Alternativen, aber führt der beste erste Schritt zur besten gesamten Folge?
Greedy Decoding wählt in jedem Schritt das höchstbewertete Token, also ein Textstück, und setzt von dieser Entscheidung aus fort. Es zieht keine Zufallsstichprobe und kehrt nicht zu ausgelassenen Wegen zurück.
Wenn A eine Wahrscheinlichkeit von 0,6 und B von 0,4 hat, wählt es A. Hat aber der beste weitere Schritt nach A eine Wahrscheinlichkeit von 0,51, liegt der gesamte Weg bei 0,306. Der Weg über B mit einer Fortsetzung von 0,99 hat 0,396. Der lokale Spitzenreiter kann also verlieren, wenn zwei Schritte gemeinsam bewertet werden.
Die Methode ist einfach, garantiert aber weder die wahrscheinlichste gesamte Sequenz noch die beste Antwort für einen Menschen. Beam Search behält mehr Wege und verursacht zusätzliche Kosten.
Mechanismus und Details
Die Regel beschreibt die Hugging-Face-Dokumentation, „Greedy search“. Mathematisch wählen wir : Aus den Tokens nehmen wir das Maximum bei der bisherigen Folge . Ein Gleichstand erfordert eine festgelegte Entscheidungsregel. Der Verzicht auf Zufallsziehung verspricht kein identisches Ergebnis, wenn sich Modell, Berechnungen oder Konfiguration ändern.
Der lokale Gewinner kann bei der gesamten Sequenz verlieren
Das eigene Beispiel hat genau zwei Schritte. Anfangs hat A die Wahrscheinlichkeit 0,6 und B 0,4. Nach A hat die beste Fortsetzung eine Chance von 0,51, nach B von 0,99. Greedy wählt A und anschließend dessen beste Fortsetzung: . Der übergangene Pfad über B hat jedoch . Alle angegebenen Verteilungen sind erfunden und summieren sich zu 1; nach zwei Tokens ist Schluss.
Beam Search behält mehrere Teilsequenzen, um eine solche Entscheidung aufzuschieben. Top-k-Sampling begrenzt dagegen die Kandidaten für das Ziehen des nächsten Tokens. Bei einem eindeutigen Maximum und entspricht die Tokenauswahl Greedy.
Der wahrscheinlichste Text muss weder wahr noch nützlich sein. Holtzman et al., §2.2–3 trennen die Maximierung der Wahrscheinlichkeit von der Qualität offener Fortsetzungen. Das ist ein anderes Problem als der oben gezeigte Suchfehler.
Ich verwende KI-generierte Inhalte als Teil meines täglichen Lernprozesses.