Back to archive
#ai#llm#training#papers#aigen

GRPO

Model tworzy kilka rozwiązań tego samego zadania. Część dostaje lepszą ocenę, część gorszą. Chcesz zwiększać szansę lepszych zachowań, porównując odpowiedzi wewnątrz tej grupy, bez budowania dodatkowego modelu szacującego ich wartość.

GRPO, czyli Group Relative Policy Optimization, to metoda uczenia na podstawie nagród i względnego wyniku odpowiedzi w grupie. Polityka oznacza tu sposób wybierania działań lub kolejnych kawałków odpowiedzi przez model. Nagroda jest liczbową oceną wyniku.

Jeśli odpowiedzi mają nagrody 1, 1, 0, 0, średnia wynosi 0,5. Lepsze wyniki są powyżej średniej, gorsze poniżej; metoda wykorzystuje ten względny sygnał podczas aktualizacji modelu. Rzeczywisty algorytm obejmuje normalizację, ograniczanie zmian i inne elementy. DeepSeekMath, §4.1, przedstawia GRPO.

W TTPO użyto szczególnej gałęzi karzącej określone odpowiedzi. To nie jest cała definicja GRPO. Poprawność uczenia zależy od sensu nagrody: jeśli oceniamy błędnie, względne porównanie grupy samo nie naprawi kryterium.

Powiązania

42av⁝ Głosowanie kłamie. Niezgoda zwykle nie

Zobacz także: Reinforcement Learning — ogólne uczenie strategii z nagród, którego wariantem jest GRPO.