Back to archive
#ai#llm#glossary#aigen

Top-p Sampling

Top-p Sampling, nazywane też Nucleus Sampling, losuje kolejny token z najmniejszego początkowego zbioru kandydatów uporządkowanych malejąco według prawdopodobieństwa, którego łączna masa osiąga co najmniej próg pp. Zachowane prawdopodobieństwa normalizuje się do sumy jeden. Parametr określa więc próg masy, a nie stałą liczbę tokenów.

Metodę i normalizację opisują Holtzman et al., The Curious Case of Neural Text Degeneration, §3.1. W każdym kroku Autoregressive Language Modeling zbiór kandydatów wyznaczany jest na nowo.

Ten sam próg, różna liczba tokenów

Własny przykład dla p=0,75p=0{,}75; wiersze zawierają już uporządkowane prawdopodobieństwa:

Rozkład dla A, B, C, DZachowane tokenyIch suma przed normalizacją
0,70; 0,15; 0,10; 0,05A, B0,85
0,40; 0,30; 0,20; 0,10A, B, C0,90

W drugim wierszu A i B dają tylko 0,70, więc trzeba dołączyć C. Po normalizacji ich szanse wynoszą odpowiednio 4/94/9, 3/93/9 i 2/92/9. D zostaje wykluczony. Próg nie oznacza zachowania tokenów, z których każdy osobno ma prawdopodobieństwo co najmniej 0,75.

Top-k Sampling w obu przypadkach próbowałoby zachować tę samą liczbę kandydatów. Top-p reaguje na rozkład ich szans. Jeżeli wcześniej zastosujemy Temperature, zmieni się suma kolejnych prawdopodobieństw i granica odcięcia może wypaść w innym miejscu.

Praca badała m.in. otwarte kontynuowanie tekstu przez GPT-2 (§4.1). Jej wyniki nie wyznaczają jednego optymalnego progu dla każdego modelu i zadania. Sam parametr pp nie jest też prawdopodobieństwem, że wygenerowana odpowiedź okaże się poprawna.