Skip to main content
QUICK REVIEW

[论文解读] Combining Benefits from Trajectory Optimization and Deep Reinforcement Learning

Guillaume Bellegarda, Katie Byl|arXiv (Cornell University)|Oct 21, 2019
Reinforcement Learning in Robotics参考文献 25被引用 5
一句话总结

该论文提出 CoTO-PPO,一种结合深度强化学习(DRL)与轨迹优化(TO)的混合方法,以提升机器人控制中的样本效率和策略鲁棒性。在每个时间步,智能体从 DRL 策略或 TO 中选择能带来最高即时奖励的动作进行执行,确保最差情况下的性能边界,加速收敛,同时保持安全性。

ABSTRACT

Recent breakthroughs both in reinforcement learning and trajectory optimization have made significant advances towards real world robotic system deployment. Reinforcement learning (RL) can be applied to many problems without needing any modeling or intuition about the system, at the cost of high sample complexity and the inability to prove any metrics about the learned policies. Trajectory optimization (TO) on the other hand allows for stability and robustness analyses on generated motions and trajectories, but is only as good as the often over-simplified derived model, and may have prohibitively expensive computation times for real-time control. This paper seeks to combine the benefits from these two areas while mitigating their drawbacks by (1) decreasing RL sample complexity by using existing knowledge of the problem with optimal control, and (2) providing an upper bound estimate on the time-to-arrival of the combined learned-optimized policy, allowing online policy deployment at any point in the training process by using the TO as a worst-case scenario action. This method is evaluated for a car model, with applicability to any mobile robotic system. A video showing policy execution comparisons can be found at https://youtu.be/mv2xw83NyWU .

研究动机与目标

  • 解决纯深度强化学习(DRL)在真实世界机器人控制中样本复杂度过高及鲁棒性不足的问题。
  • 通过将 DRL 与 TO 融合,缓解 TO 的局限性,如对模型误差的敏感性及高计算成本。
  • 通过 TO 提供可证明安全的最差情况动作,实现在任意训练阶段的策略在线部署。
  • 通过在探索阶段使用 TO 作为保守基线,提升策略学习效率,减少在次优区域停留的时间。
  • 通过 TO 提供到达时间的上界估计,确保训练和部署过程中的性能保障。

提出的方法

  • 在每个环境时间步,智能体同时计算来自 DRL 策略网络和轨迹优化器(TO)的动作。
  • 智能体在仿真环境中模拟执行这两种动作,以估计即时奖励。
  • 选择模拟奖励更高的动作用于真实世界执行,确保性能不会低于 TO 表现。
  • 使用从混合动作选择过程中收集的经验,通过 PPO 训练 DRL 策略,包括来自 TO 动作的监督更新。
  • 该方法采用短时域(1步)奖励比较,避免对次优 TO 轨迹的过拟合,同时保持探索效率。
  • TO 框架基于 DIRCON,一种带流形约束的直接配点法,可实现高精度的标称轨迹生成。

实验结果

研究问题

  • RQ1将轨迹优化与深度强化学习结合,是否能在保持安全保证的同时降低机器人控制中的样本复杂度?
  • RQ2在 DRL 训练过程中使用 TO 作为最差情况动作,是否相比纯 DRL 能够提升策略收敛速度和性能?
  • RQ3该混合方法是否能确保在任意训练阶段实现策略的在线可部署性,即使 DRL 网络为随机初始化?
  • RQ4动作比较所用的仿真时域选择如何影响策略性能和探索效率?
  • RQ5与从零开始纯 DRL 训练相比,引入 TO 在多大程度上提升了最终 DRL 策略的质量?

主要发现

  • 在训练 100 万步后,CoTO-PPO 在平均累积奖励方面显著优于纯 PPO,在随机和确定性评估中均表现出明显提升。
  • 在超过 75% 的情况下,策略选择的行动优于 TO 动作,表明学习进展显著,策略性能已超越初始 TO 基线。
  • 即使与次优的纯 PPO 策略结合,CoTO 框架仍能提升平均奖励,表明 TO 作为有价值的保守基线。
  • 该方法通过减少对随机探索的依赖,特别是早期训练阶段中对初始化不佳的 DRL 策略的依赖,实现了更好的样本效率。
  • 采用 1 步时域进行动作选择的性能优于更长时域,因为更长时域会导致 DRL 策略被 TO 主导,因期望回报趋于零而产生回归效应。
  • 该混合方法通过 TO 解提供到达时间的可证明上界,实现在任意训练点的安全部署,而无需等待策略完全收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。