Skip to main content
QUICK REVIEW

[论文解读] Model Predictive Actor-Critic: Accelerating Robot Skill Acquisition with Deep Reinforcement Learning

Andrew S. Morgan, Daljeet Nandha|arXiv (Cornell University)|Mar 25, 2021
Reinforcement Learning in Robotics参考文献 55被引用 32
一句话总结

该论文提出模型预测演员-评论家(MoPAC),一种混合式模型预测强化学习算法,结合模型预测控制(MPC)轨迹滚动与深度演员-评论家学习,以加速机器人技能获取。通过利用MPC实现高效、引导式的探索,以及利用MFRL实现稳健的策略优化,MoPAC减少了环境交互次数,缓解了模型偏差,在模拟和真实机器人操作任务中实现了更快的收敛速度和更优的性能,包括四指机械手的抓持内操作任务。

ABSTRACT

Substantial advancements to model-based reinforcement learning algorithms have been impeded by the model-bias induced by the collected data, which generally hurts performance. Meanwhile, their inherent sample efficiency warrants utility for most robot applications, limiting potential damage to the robot and its environment during training. Inspired by information theoretic model predictive control and advances in deep reinforcement learning, we introduce Model Predictive Actor-Critic (MoPAC), a hybrid model-based/model-free method that combines model predictive rollouts with policy optimization as to mitigate model bias. MoPAC leverages optimal trajectories to guide policy learning, but explores via its model-free method, allowing the algorithm to learn more expressive dynamics models. This combination guarantees optimal skill learning up to an approximation error and reduces necessary physical interaction with the environment, making it suitable for real-robot training. We provide extensive results showcasing how our proposed method generally outperforms current state-of-the-art and conclude by evaluating MoPAC for learning on a physical robotic hand performing valve rotation and finger gaiting--a task that requires grasping, manipulation, and then regrasping of an object.

研究动机与目标

  • 为解决真实机器人应用中模型自由深度强化学习(MFRL)的样本效率低下问题,避免因过多环境交互导致的损坏风险。
  • 克服模型基于强化学习(MBRL)固有的模型偏差问题,该问题因依赖不完善的动力学模型而限制性能。
  • 结合MBRL的样本效率与MFRL的探索能力,实现在复杂机器人任务中更快、更稳健的策略学习。
  • 提出一种理论基础扎实的方法,推导出在模型和价值函数近似误差下的性能边界。
  • 在具有挑战性的真实机器人抓持内操作任务(如阀门旋转和手指运动控制)中验证MoPAC的有效性。

提出的方法

  • MoPAC将模型预测控制(MPC)轨迹滚动与深度演员-评论家框架相结合,利用MPC生成高奖励轨迹以指导策略学习。
  • 该方法采用基于自由能原理的信息论MPC,引入熵约束以平衡利用与探索。
  • 通过MPC轨迹滚动收集合成经验用于策略优化,降低对真实环境交互的依赖。
  • 演员-评论家组件中采用最大熵目标,以促进探索,从而支持学习更具表现力的动力学模型。
  • 算法使用预训练的动力学模型进行轨迹滚动,同时使用独立的策略网络进行动作选择,两者均通过离策略更新进行训练。
  • 推导出理论性能边界,表明即使在模型不完善的情况下,只要模型和价值函数近似误差较低,仍可实现接近最优的性能。

实验结果

研究问题

  • RQ1将MPC轨迹滚动与深度演员-评论家学习相结合,是否能减少机器人技能获取所需的现实环境交互次数?
  • RQ2MoPAC如何在保持样本效率的同时缓解模型基于强化学习中的模型偏差?
  • RQ3MoPAC在复杂、接触丰富的操作任务(如抓持内物体旋转和重新抓握)中,能在多大程度上加速学习?
  • RQ4将MPC规划与MFRL探索相结合,是否能提升真实机器人平台上的泛化能力和鲁棒性?
  • RQ5在模型和价值函数近似误差下,MoPAC的理论性能保证是什么?

主要发现

  • MoPAC在模拟控制任务中优于当前最先进方法(如MBPO),实现更快收敛且环境交互次数更少。
  • 在物理四指机械手上,MoPAC学习阀门旋转和手指运动控制任务的速度显著快于基线方法,训练时间相比MBPO最多减少50%。
  • 对于阀门旋转任务,MoPAC约在2小时内收敛;而手指运动控制任务约需5小时,且所需episode数更少。
  • 该算法对模型不准确性表现出鲁棒性,即使在动力学模型不完善的情况下仍能保持高性能,这得益于对近似误差的理论性能边界保障。
  • MoPAC实现了卓越的样本效率,显著减少了对物理交互的需求,使其适用于环境损坏风险较高的真实机器人部署场景。
  • 实验结果证实,MPC轨迹滚动用于利用,MFRL用于探索,能够有效促进更具表现力的动力学模型和最优策略的学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。