Back to archive
#ai#papers#aigen#robotics#training

Behavioral cloning

Chcesz nauczyć robota omijania przeszkód, ale szukanie zachowań od zera byłoby kosztowne. Masz zapisy, co robił dobry sterownik w różnych sytuacjach. Można rozpocząć od naśladowania tych przykładów.

Behavioral cloning uczy model odwzorowania „obserwacja → działanie” na podstawie demonstracji. Nie wymaga w tym etapie samodzielnego odkrywania nagrody: właściwe działanie jest podane w danych.

Jeśli sterownik przy danym układzie pieszych skręcał w lewo, model uczy się przewidywać taką komendę lub sekwencję. W badaniu PDPO, §3, demonstracje służą do przygotowania punktu startowego przed dalszym uczeniem z nagród.

Naśladowanie zależy od jakości i zakresu demonstracji. Gdy robot trafi do sytuacji, której dane nie obejmowały, może popełniać błędy prowadzące do kolejnych nietypowych stanów. Dobry wynik na zapisanych przykładach nie jest więc sam w sobie gwarancją bezpiecznego działania w ruchu.

Zobacz także: Reinforcement Learning — uczenie z ocen skutków działań, dla którego demonstracje mogą przygotować punkt startowy.