Diffusion policy
Robot ma ominąć człowieka. Obie drogi, lewa i prawa, mogą być dobre, ale ich średnia prowadziłaby prosto na przeszkodę. Potrzebujesz modelu zdolnego proponować różne spójne zachowania, a nie tylko jeden uśredniony ruch.
Diffusion policy wyznacza działania przez stopniowe przekształcanie próbki szumu w plan, z uwzględnieniem obserwacji. Polityka to sposób wyboru działań. Kolejne kroki odszumiania mogą wytworzyć jedną z kilku możliwych sekwencji.
W pracy o planowaniu ruchu w tłumie, §3, wynikiem jest krótka lista przyszłych komend ruchu. Robot może otrzymać spójny skręt, zamiast mieszanki wzajemnie sprzecznych zamiarów.
To opis możliwości modelowania, nie gwarancja bezpiecznej decyzji. Kilka kroków odszumiania kosztuje więcej obliczeń, a jakość zależy od danych i celu uczenia. Action chunk opisuje wygenerowaną sekwencję działań, niezależnie od użytej metody jej tworzenia.