Zurück zum Archiv
#ai#papers#aigen#robotics#training

Behavioral Cloning

Du möchtest einem Roboter beibringen, Hindernisse zu umgehen, aber Verhaltensweisen von Grund auf zu suchen wäre teuer. Du hast Aufzeichnungen davon, was eine gute Steuerung in verschiedenen Situationen getan hat. Du kannst mit dem Nachahmen dieser Beispiele beginnen.

Behavioral Cloning trainiert ein Modell, anhand von Demonstrationen „Beobachtung → Aktion“ abzubilden. In dieser Phase muss es eine Belohnung nicht selbst entdecken: Die richtige Aktion ist in den Daten vorgegeben.

Wenn die Steuerung bei einer bestimmten Anordnung von Fußgängern nach links abbog, lernt das Modell, diesen Befehl oder diese Sequenz vorherzusagen. In der PDPO-Studie, §3, dienen Demonstrationen dazu, den Ausgangspunkt vor dem weiteren Lernen aus Belohnungen vorzubereiten.

Das Nachahmen hängt von der Qualität und dem Umfang der Demonstrationen ab. Gerät der Roboter in eine Situation, die die Daten nicht abdeckten, kann er Fehler machen, die zu weiteren ungewöhnlichen Zuständen führen. Ein gutes Ergebnis bei gespeicherten Beispielen allein garantiert deshalb keinen sicheren Betrieb im Verkehr.

Siehe auch: Reinforcement Learning — Lernen aus Bewertungen der Aktionsfolgen, für das Demonstrationen einen Ausgangspunkt vorbereiten können.