Zurück zum Archiv
#ai#llm#glossary#aigen

Perplexität

Du vergleichst zwei Modelle anhand desselben Textes. Du möchtest wissen, welches seine aufeinanderfolgenden Fragmente besser vorhersagt, und nicht nur, welches mehr einzelne Gewinner erraten hat. Du brauchst eine Zahl, die die dem tatsächlichen Verlauf zugewiesenen Wahrscheinlichkeiten zusammenfasst.

Perplexity (PPL) fasst zusammen, wie gut das Modell aufeinanderfolgende Tokens, also Stücke des bewerteten Textes, vorhersagt. Je geringer die Wahrscheinlichkeiten der tatsächlich vorkommenden Fragmente, desto höher der Wert. Ein niedrigerer Wert bedeutet eine bessere Vorhersage dieses Textes. Die genaue Berechnung zeigt die Formel unten nach dem Beispiel.

Wenn jedes richtige Token die Wahrscheinlichkeit 1/4 hat, beträgt PPL 4; bei einer Wahrscheinlichkeit von 1/2 beträgt es 2. Das kann als Intuition für die effektive Unsicherheit dienen, ist aber keine wörtliche Zahl betrachteter Wörter in jedem Schritt.

Ein Vergleich erfordert übereinstimmende Daten, Tokenaufteilung und Kontextzugriff. PPL misst weder Wahrheit noch Nützlichkeit von Antworten direkt. Das Experiment „Pinguin im Kühlschrank“ zeigt, wie ein einziges sehr unerwartetes Token das Ergebnis des gesamten Textes beeinflusst.

Mechanismus und Details

PPL=exp⁡(−1N∑t=1Nln⁡p(xt∣x<t))\mathrm{PPL}=\exp\left(-\frac{1}{N}\sum_{t=1}^{N}\ln p(x_t\mid x_{<t})\right)

NN ist die Anzahl der bewerteten Tokens und x<tx_{<t} ihr vorheriger Kontext. Beim natürlichen Logarithmus ist dies exp⁡(H)\exp(H), wobei HH die mittlere Kreuzentropie für einzelne korrekte Tokens ohne zusätzliche Verlustterme bezeichnet. Gleichwertig kann man das geometrische Mittel der Kehrwerte dieser Wahrscheinlichkeiten berechnen. Diese Definition nennen Bengio et al., §2.

Wie man das Ergebnis liest

Eigenes Beispiel: Das Modell weist jedem bewerteten Token die Wahrscheinlichkeit 0,25 zu. Die PPL beträgt dann 4. Steigt jede dieser Wahrscheinlichkeiten auf 0,5, sinkt die PPL auf 2. Das bedeutet nicht, dass das Modell immer zwischen genau vier oder zwei Tokens wählt; das Ergebnis fasst den gesamten bewerteten Text zusammen.

Ein Pinguin im Kühlschrank

Du öffnest den Kühlschrank. Darin sitzt ein Pinguin. Für dich ist das ein logistisches Problem, für ein Sprachmodell das letzte Token im Satz. Reichen neun sehr gute Vorhersagen aus, um die Kosten einer solchen Überraschung auszugleichen?

Dies ist ein eigenes Gedankenexperiment: zwei erfundene Modelle, manuell zugewiesene Wahrscheinlichkeiten und zehn angenommene Tokens. Jedes Modell bewertet denselben Text Token für Token und kennt dabei die vorherigen Tokens dieses Textes. Wir zeigen ausschließlich die Wahrscheinlichkeit des tatsächlich aufgetretenen Tokens; die übrige Masse entfällt auf andere Möglichkeiten. Dies sind keine Messwerte eines konkreten LLMs.

Das interaktive Experiment benötigt JavaScript. Ein Beispiel mit Ergebnisberechnung findest du weiter unten.

In der Ausgangseinstellung weist Modell A den ersten neun Tokens jeweils 90% und dem letzten 0,01% zu. Modell B weist jedem Token 50% zu. Der gewöhnliche Mittelwert der Wahrscheinlichkeiten beträgt ungefähr 81% für A und 50% für B, aber bei der PPL gewinnt B: 2 gegenüber ungefähr 2,762 für A.

Woher kommt der Wechsel? Schreibt man die Kosten als −log⁡2p-\log_2 p, kosten die ersten neun Tokens Modell A zusammen ungefähr 1,368 Bit. Allein „pingwina.“ kostet ungefähr 13,288 Bit. Teilen wir die Summe durch zehn, erhalten wir 1,466 Bit pro Token, also PPL≈2,762\mathrm{PPL}\approx 2{,}762. Modell B bezahlt ein Bit pro Token. Eine große Überraschung erhöht den mittleren logarithmischen Verlust stark, selbst wenn die übrigen Tokens hohe Wahrscheinlichkeiten hatten. Erhöhe die Chance für „pingwina“ auf 1%: A gewinnt wieder.

Was sich vergleichen lässt

Ein Vergleich erfordert dieselben Daten und übereinstimmende Berechnungsregeln, einschließlich der Tokenisierung, etwa Byte Pair Encoding. Auch der verfügbare Kontext zählt. Die Aufteilung eines Textes in getrennte Abschnitte nimmt dem Modell am Anfang jedes Abschnitts die vorherigen Tokens und kann das Ergebnis verschlechtern. Die Hugging-Face-Dokumentation beschreibt die Bewertung mit einem gleitenden Fenster und erklärt, warum die gewöhnliche PPL nicht direkt auf BERT angewendet wird.

Eine niedrigere PPL bedeutet bessere Vorhersagen für den bewerteten Text im jeweiligen Verfahren, garantiert aber keine bessere Antwort auf eine konkrete Aufgabe. In Attention Is All You Need, §5.4 verschlechterte Label Smoothing die PPL und verbesserte zugleich Accuracy und BLEU.