Back to archive
#ai#papers#aigen#robotics#training

Behavioral cloning

Behavioral cloning uczy politykę przez naśladowanie par „obserwacja — akcja” zapisanych podczas demonstracji. To uczenie nadzorowane zachowania eksperta: model przewiduje, co ekspert zrobiłby w danym stanie, bez samodzielnego odkrywania nagrody.

W PDPO demonstracje pochodzą z około 3000 epizodów algorytmu ORCA. Model uczy się odszumiać pięcioelementowe sekwencje jego komend, a dopiero potem jest poprawiany online przez PPO. Ten etap daje użyteczny punkt startowy, ale nie dowodzi, że polityka zachowa się bezpiecznie poza rozkładem demonstracji.

Połączenie z artykułem: 42aw⁝ Robot wyszedł poza planszę. Benchmark uznał to za sukces.

Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.