Volver al archivo
#ai#papers#aigen#robotics#training

Clonación del comportamiento

Quieres enseñar al robot a esquivar obstáculos, pero buscar comportamientos desde cero sería costoso. Tienes registros de lo que hacía un buen controlador en distintas situaciones. Puedes empezar imitando esos ejemplos.

Behavioral cloning enseña al modelo la correspondencia «observación → acción» a partir de demostraciones. En esta etapa no requiere descubrir por sí solo una recompensa: la acción adecuada está dada en los datos.

Si el controlador giraba a la izquierda ante una determinada disposición de peatones, el modelo aprende a predecir esa orden o secuencia. En el estudio PDPO, §3, las demostraciones preparan el punto de partida antes del entrenamiento adicional mediante recompensas.

La imitación depende de la calidad y el alcance de las demostraciones. Cuando el robot llega a una situación que los datos no cubrían, puede cometer errores que conduzcan a otros estados atípicos. Por tanto, un buen resultado en los ejemplos registrados no garantiza por sí solo un funcionamiento seguro en movimiento.

Véase también: Reinforcement Learning —el aprendizaje a partir de evaluaciones de los efectos de las acciones, para el que las demostraciones pueden preparar un punto de partida—.