Diffusion Policy
Ein Roboter soll einem Menschen ausweichen. Beide Wege, links und rechts, können gut sein, aber ihr Mittelwert würde direkt auf das Hindernis führen. Du brauchst ein Modell, das unterschiedliche konsistente Verhaltensweisen vorschlagen kann, statt nur eine gemittelte Bewegung.
Eine Diffusion Policy bestimmt Aktionen, indem sie eine Rauschprobe unter Berücksichtigung der Beobachtung schrittweise in einen Plan umwandelt. Eine Policy ist eine Methode zur Auswahl von Aktionen. Aufeinanderfolgende Entrauschungsschritte können eine von mehreren möglichen Sequenzen erzeugen.
In der Arbeit über Bewegungsplanung in Menschenmengen, §3, ist das Ergebnis eine kurze Liste zukünftiger Bewegungsbefehle. Der Roboter kann eine konsistente Kurve erhalten statt einer Mischung widersprüchlicher Absichten.
Das beschreibt Modellierungsmöglichkeiten, keine Garantie für eine sichere Entscheidung. Mehrere Entrauschungsschritte kosten zusätzliche Berechnungen, und die Qualität hängt von den Daten und dem Trainingsziel ab. Action Chunk beschreibt die erzeugte Aktionssequenz unabhängig von der verwendeten Erzeugungsmethode.