Skip to main content
QUICK REVIEW

[论文解读] Trajectory Optimization for Unknown Constrained Systems using Reinforcement Learning

Kei Ota, Devesh K. Jha|arXiv (Cornell University)|Mar 13, 2019
Reinforcement Learning in Robotics参考文献 23被引用 4
一句话总结

本论文提出了一种强化学习(RL)方法,利用基于采样规划器(RRT)的参考轨迹来加速训练,并为未知机器人系统生成动态平滑且受约束的轨迹。通过采用课程学习和目标条件策略,该方法实现了更快的收敛速度和对目标扰动的泛化能力,在6-DoF机械臂的仿真和真实世界实验中均优于基线PID控制器,表现出更低的加速度曲线和更优的跟踪性能。

ABSTRACT

In this paper, we propose a reinforcement learning-based algorithm for trajectory optimization for constrained dynamical systems. This problem is motivated by the fact that for most robotic systems, the dynamics may not always be known. Generating smooth, dynamically feasible trajectories could be difficult for such systems. Using sampling-based algorithms for motion planning may result in trajectories that are prone to undesirable control jumps. However, they can usually provide a good reference trajectory which a model-free reinforcement learning algorithm can then exploit by limiting the search domain and quickly finding a dynamically smooth trajectory. We use this idea to train a reinforcement learning agent to learn a dynamically smooth trajectory in a curriculum learning setting. Furthermore, for generalization, we parameterize the policies with goal locations, so that the agent can be trained for multiple goals simultaneously. We show result in both simulated environments as well as real experiments, for a $6$-DoF manipulator arm operated in position-controlled mode to validate the proposed idea. We compare the proposed ideas against a PID controller which is used to track a designed trajectory in configuration space. Our experiments show that our RL agent trained with a reference path outperformed a model-free PID controller of the type commonly used on many robotic platforms for trajectory tracking.

研究动机与目标

  • 解决为具有未知动力学特性和状态/控制约束的机器人系统生成动态可行且平滑轨迹的挑战。
  • 通过使用现成的基于采样规划器(RRT)的参考轨迹,降低样本复杂度并加速模型无关强化学习的训练。
  • 通过目标条件策略参数化实现对新目标位置的泛化能力。
  • 在6-DoF机械臂的高保真仿真和真实世界实验中验证该方法。
  • 在轨迹平滑性和收敛速度方面优于传统的基于PID的轨迹跟踪方法。

提出的方法

  • 使用目标条件深度确定性策略梯度(DDPG)算法训练RL智能体,其评论网络用于估计状态-动作对的Q值。
  • 采用课程学习策略,从较简单的任务(如更短路径、更少障碍物)开始训练,并逐步增加难度,以稳定训练过程并提升收敛性。
  • 通过重放过去成功轨迹中的高回报经验,采用自我模仿策略以提高样本效率,减少动态碰撞惩罚带来的奖励噪声。
  • 将RRT生成的参考轨迹作为示范,引导RL智能体,从而限制搜索空间并加速策略学习。
  • 智能体的演员和评论网络均以目标状态为条件,实现对定义区域内新目标位置的零样本泛化。
  • 该方法在仿真环境中训练,并直接迁移到真实6-DoF机械臂上,无需领域随机化或微调。

实验结果

研究问题

  • RQ1当由RRT规划器生成的参考轨迹引导时,模型无关的RL智能体能否高效学习未知受约束系统的动态平滑轨迹?
  • RQ2课程学习和自我模仿是否能提升高维、受约束机器人控制任务中的训练稳定性和收敛速度?
  • RQ3该RL策略能否在不重新训练的情况下泛化到局部区域内新的目标位置?
  • RQ4与标准PID控制器相比,该方法在轨迹平滑性和收敛时间方面表现如何?
  • RQ5该RL策略能否成功从仿真迁移到真实6-DoF机械臂上实现轨迹跟踪?

主要发现

  • 与未使用课程学习或自我模仿的训练相比,所提方法实现了显著更快的收敛速度和更稳定的训练过程。
  • 在所有任务中,RL智能体显著降低了关节加速度,表明控制输入更加平滑。
  • 该方法在任务中达到目标的时间为0.22–0.50秒,而PID基线为0.56–1.28秒,表明收敛速度更快。
  • 该方法对目标扰动具有良好的泛化能力:在仿真中,100×100 mm目标区域内成功率达98%,200×200 mm区域内成功率达90%。
  • 真实世界实验结果证实,策略成功从仿真迁移到真实机器人,保持了低加速度和高跟踪精度。
  • RRT引导、课程学习与目标条件策略的结合,使智能体能够在具有状态和控制约束的复杂环境中学习到可行轨迹。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。