#ai#papers#aigen#robotics#training
Behavioral cloning
Behavioral cloning uczy politykę przez naśladowanie par „obserwacja — akcja” zapisanych podczas demonstracji. To uczenie nadzorowane zachowania eksperta: model przewiduje, co ekspert zrobiłby w danym stanie, bez samodzielnego odkrywania nagrody.
W PDPO demonstracje pochodzą z około 3000 epizodów algorytmu ORCA. Model uczy się odszumiać pięcioelementowe sekwencje jego komend, a dopiero potem jest poprawiany online przez PPO. Ten etap daje użyteczny punkt startowy, ale nie dowodzi, że polityka zachowa się bezpiecznie poza rozkładem demonstracji.
Połączenie z artykułem: 42aw⁝ Robot wyszedł poza planszę. Benchmark uznał to za sukces.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.