El Aprendizaje por imitación y refuerzo para la generación de trayectorias de un robot colaborativo

Imitation Learning and Reinforcement Learning for the trajectory generation of a Collaborative Robot

Autores/as

  • Alejandro Menéndez García Universidad de Burgos

DOI:

https://doi.org/10.64117/simposioscea.v2i3.238

Palabras clave:

Aprendizaje por imitación, Aprendizaje por refuerzo, robot colaborativo, planificación de trayectorias, Simulación

Resumen

Este artículo propone una arquitectura de control jerárquica en tres fases para generar movimientos articulares que lleven el
efector final hasta una pose objetivo. La metodología se valida en simulación con el robot colaborativo ABB GoFa CRB 15000
5/0.95 . La estructura del trabajo combina un planificador experto basado en optimización GPU (cuRobo), un módulo de
clonación de comportamiento (BC) sobre un dataset de 10 000 demostraciones, una etapa de DAgger para corregir el
desplazamiento de distribución de la política clonada, y una política residual entrenada mediante PPO (Proximal Policy
Optimization) en el simulador Isaac Lab, penalizando las correcciones excesivas respecto a la acción propuesta por la política
clonada. La política residual aplica una corrección acotada (±0,5 rad) sobre la acción del BC, lo que permite refinar el
comportamiento sin destruir el conocimiento aprendido por imitación. Tras un entrenamiento de 300 iteraciones con 128 entornos paralelos sobre una distribución de metas centrada en los fallos del BC, el sistema alcanza una tasa de éxito del 95,33 % en 300 episodios de evaluación con umbrales de 2 cm de error de posición y 5,73° de error de orientación. El error medio en la pose final es de 1,31 cm y 5,2°, alcanzando en la mejor pose por episodio un error medio de 8,72 mm y 3,1°. Los resultados muestran que la combinación de BC supervisado, DAgger y refuerzo es viable para inicializar políticas de control reactivo en manipuladores colaborativos sin requerir cinemática inversa analítica en línea.

Publicado

2026-10-08