Zurück zum Archiv
#ai#llm#glossary#aigen

Top-p-Sampling

Manchmal hat das Modell einen klaren Spitzenreiter, manchmal viele ähnlich bewertete Fortsetzungen. Stets fünf Kandidaten zuzulassen berücksichtigt diesen Unterschied nicht. Du möchtest die Gruppengröße danach wählen, wo sich die Wahrscheinlichkeit konzentriert.

Top-p Sampling, auch Nucleus Sampling, wählt die kleinste Anfangsgruppe der nach absteigender Wahrscheinlichkeit sortierten Kandidaten, deren Summe den Schwellenwert p erreicht. Anschließend zieht es aus dieser Gruppe, nachdem die Wahrscheinlichkeiten auf die Summe eins umgerechnet wurden.

Bei Wahrscheinlichkeiten von 0,7; 0,15; 0,1; 0,05 und einem Schwellenwert von 0,75 bleiben die ersten beiden: Zusammen haben sie 0,85. Bei 0,4; 0,3; 0,2; 0,1 werden bereits drei benötigt. Jeder Generierungsschritt kann also eine andere Zahl zugelassener Tokens — Textstücke — haben.

Der Schwellenwert bedeutet weder eine Mindestwahrscheinlichkeit jedes Kandidaten noch eine garantierte Antwortqualität. Top-k Sampling legt die Zahl fest, während top-p auf die Verteilung reagiert; keiner dieser Filter bewertet allein die Wahrheit des Textes.

Mechanismus und Details

Methode und Normalisierung beschreiben Holtzman et al., The Curious Case of Neural Text Degeneration, §3.1. In jedem Schritt der autoregressiven Sprachmodellierung wird die Kandidatenmenge neu bestimmt.

Gleiche Schwelle, unterschiedliche Tokenanzahl

Eigenes Beispiel für p=0,75p=0{,}75; die Zeilen enthalten bereits sortierte Wahrscheinlichkeiten:

Verteilung für A, B, C, DErhaltene TokensIhre Summe vor der Normalisierung
0,70; 0,15; 0,10; 0,05A, B0,85
0,40; 0,30; 0,20; 0,10A, B, C0,90

In der zweiten Zeile ergeben A und B nur 0,70, deshalb muss C hinzukommen. Nach der Normalisierung betragen ihre Chancen 4/94/9, 3/93/9 und 2/92/9. D wird ausgeschlossen. Die Schwelle bedeutet nicht, dass nur Tokens erhalten bleiben, deren Wahrscheinlichkeit jeweils einzeln mindestens 0,75 beträgt.

Top-k-Sampling würde in beiden Fällen versuchen, dieselbe Anzahl von Kandidaten zu erhalten. Top-p reagiert auf die Verteilung ihrer Chancen. Wenden wir vorher eine Temperatur an, verändert sich die Summe aufeinanderfolgender Wahrscheinlichkeiten, und die Abschneidegrenze kann an einer anderen Stelle liegen.

Die Arbeit untersuchte unter anderem die offene Textfortsetzung durch GPT-2 (§4.1). Ihre Ergebnisse legen keinen einheitlichen optimalen Schwellenwert für jedes Modell und jede Aufgabe fest. Der Parameter pp ist auch nicht die Wahrscheinlichkeit, dass die erzeugte Antwort korrekt sein wird.