GRPO
Das Modell erstellt mehrere Lösungen derselben Aufgabe. Einige erhalten eine bessere Bewertung, andere eine schlechtere. Du möchtest die Wahrscheinlichkeit besserer Verhaltensweisen erhöhen, indem du Antworten innerhalb dieser Gruppe vergleichst, ohne ein zusätzliches Modell zur Schätzung ihres Werts aufzubauen.
GRPO, Group Relative Policy Optimization, ist eine Lernmethode auf Grundlage von Belohnungen und des relativen Ergebnisses einer Antwort innerhalb der Gruppe. Policy bezeichnet hier die Art, wie das Modell Aktionen oder weitere Antwortstücke auswählt. Eine Belohnung ist eine numerische Bewertung des Ergebnisses.
Wenn die Antworten die Belohnungen 1, 1, 0, 0 haben, beträgt der Mittelwert 0,5. Bessere Ergebnisse liegen darüber, schlechtere darunter; die Methode nutzt dieses relative Signal bei der Modellaktualisierung. Der tatsächliche Algorithmus umfasst Normalisierung, das Begrenzen von Änderungen und weitere Elemente. DeepSeekMath, §4.1, stellt GRPO vor.
In TTPO wurde ein spezieller Zweig verwendet, der bestimmte Antworten bestraft. Das ist nicht die gesamte Definition von GRPO. Die Korrektheit des Lernens hängt vom Sinn der Belohnung ab: Wenn wir falsch bewerten, korrigiert der relative Gruppenvergleich allein das Kriterium nicht.
Verbindungen
Abstimmungen lügen. Abweichungen meist nicht
Siehe auch: Reinforcement Learning — das allgemeine Lernen einer Strategie aus Belohnungen, von dem GRPO eine Variante ist.