Volver al archivo
#ai#llm#glossary#aigen

Muestreo top-p

A veces el modelo tiene un líder claro y otras veces muchas continuaciones con puntuaciones parecidas. Admitir siempre cinco candidatos no tiene en cuenta esa diferencia. Quieres ajustar el tamaño del grupo según dónde se concentre la probabilidad.

Top-p Sampling, también llamado Nucleus Sampling, elige el menor grupo inicial de candidatos ordenados por probabilidad descendente cuya suma alcanza el umbral p. Después sortea dentro de ese grupo tras recalcular las probabilidades para que sumen uno.

Para las probabilidades 0,7; 0,15; 0,1; 0,05 y un umbral de 0,75, quedan los dos primeros: juntos tienen 0,85. Para 0,4; 0,3; 0,2; 0,1, hacen falta tres. Por tanto, cada paso de generación puede admitir un número distinto de tokens —fragmentos de texto—.

El umbral no significa una probabilidad mínima de cada candidato ni una calidad garantizada de la respuesta. Top-k Sampling fija el número y top-p responde a la distribución; ninguno de esos filtros evalúa por sí solo la veracidad del texto.

Mecanismo y detalles

Holtzman et al., The Curious Case of Neural Text Degeneration, §3.1 describen el método y la normalización. En cada paso del modelado autorregresivo del lenguaje, el conjunto de candidatos se calcula de nuevo.

El mismo umbral, distinto número de tokens

Ejemplo propio para p=0,75p=0{,}75; las filas ya contienen las probabilidades ordenadas:

Distribución para A, B, C, DTokens conservadosSu suma antes de normalizar
0,70; 0,15; 0,10; 0,05A, B0,85
0,40; 0,30; 0,20; 0,10A, B, C0,90

En la segunda fila, A y B suman solo 0,70, así que hay que incluir C. Tras normalizar, sus probabilidades son, respectivamente, 4/94/9, 3/93/9 y 2/92/9. D queda excluido. El umbral no significa conservar tokens de los que cada uno por separado tenga una probabilidad de al menos 0,75.

El muestreo top-k intentaría conservar el mismo número de candidatos en ambos casos. Top-p responde a la distribución de sus probabilidades. Si antes aplicamos la temperatura, cambiará la suma de las probabilidades sucesivas y el límite de corte puede quedar en otro lugar.

El trabajo estudió, entre otras cosas, la continuación abierta de texto con GPT-2 (§4.1). Sus resultados no establecen un único umbral óptimo para todos los modelos y tareas. El parámetro pp tampoco es la probabilidad de que la respuesta generada resulte correcta.