Behavioral cloning
Chcesz nauczyć robota omijania przeszkód, ale szukanie zachowań od zera byłoby kosztowne. Masz zapisy, co robił dobry sterownik w różnych sytuacjach. Można rozpocząć od naśladowania tych przykładów.
Behavioral cloning uczy model odwzorowania „obserwacja → działanie” na podstawie demonstracji. Nie wymaga w tym etapie samodzielnego odkrywania nagrody: właściwe działanie jest podane w danych.
Jeśli sterownik przy danym układzie pieszych skręcał w lewo, model uczy się przewidywać taką komendę lub sekwencję. W badaniu PDPO, §3, demonstracje służą do przygotowania punktu startowego przed dalszym uczeniem z nagród.
Naśladowanie zależy od jakości i zakresu demonstracji. Gdy robot trafi do sytuacji, której dane nie obejmowały, może popełniać błędy prowadzące do kolejnych nietypowych stanów. Dobry wynik na zapisanych przykładach nie jest więc sam w sobie gwarancją bezpiecznego działania w ruchu.
Zobacz także: Reinforcement Learning — uczenie z ocen skutków działań, dla którego demonstracje mogą przygotować punkt startowy.