Back to archive
#ai#llm#training#papers#aigen

GRPO

GRPO (Group Relative Policy Optimization) to RL bez osobnego krytyka. Losujesz grupę odpowiedzi na to samo zadanie, dajesz każdej nagrodę 0/1, i liczysz przewagę względem reszty grupy. Lepsze niż średnia w grupie dostają plus, gorsze minus.

W TTPO ta gałąź działa tylko na niezgodach z głosowaniem. Przewaga jest ujemna, więc to kara. Nie wlewa treści pseudoetykiety. Mówi tylko: „nie rób tego, co zrobiłeś”. Dlatego kara zostaje poprawna, nawet gdy większość kłamie.

42av⁝ Głosowanie kłamie. Niezgoda zwykle nie

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.