Volver al archivo
#ai#llm#training#papers#aigen

GRPO

El modelo crea varias soluciones de la misma tarea. Algunas reciben una evaluación mejor y otras peor. Quieres aumentar la probabilidad de los mejores comportamientos comparando las respuestas dentro del grupo, sin construir otro modelo que estime su valor.

GRPO, o Group Relative Policy Optimization, es un método de aprendizaje basado en recompensas y en el resultado relativo de las respuestas de un grupo. Aquí, política significa la forma en que el modelo elige acciones o los siguientes fragmentos de la respuesta. La recompensa es una evaluación numérica del resultado.

Si las respuestas tienen recompensas de 1, 1, 0, 0, la media es 0,5. Los mejores resultados están por encima de la media y los peores por debajo; el método utiliza esa señal relativa durante la actualización del modelo. El algoritmo real incluye normalización, límites a los cambios y otros elementos. DeepSeekMath, §4.1, presenta GRPO.

En TTPO se usó una rama particular que penaliza determinadas respuestas. Eso no es la definición completa de GRPO. Que el aprendizaje sea correcto depende del sentido de la recompensa: si evaluamos mal, la comparación relativa del grupo no corrige por sí sola el criterio.

Relaciones

La votación miente. El desacuerdo normalmente no

Véase también: Reinforcement Learning —el aprendizaje general de estrategias mediante recompensas, del que GRPO es una variante—.