[论文解读] Sample-Efficient Learning of Nonprehensile Manipulation Policies via Physics-Based Informed State Distributions
本文提出LeaPER,一种用于非抓取操作的样本高效强化学习方法,通过重新排列规划生成的物理信息状态分布来在训练期间重置环境。利用规划轨迹作为先验,LeaPER将学习速度提升至最多5倍,并在简化物理模型下,实现显著高于开环控制或简单反馈策略的任务成功率。
This paper proposes a sample-efficient yet simple approach to learning closed-loop policies for nonprehensile manipulation. Although reinforcement learning (RL) can learn closed-loop policies without requiring access to underlying physics models, it suffers from poor sample complexity on challenging tasks. To overcome this problem, we leverage rearrangement planning to provide an informative physics-based prior on the environment's optimal state-visitation distribution. Specifically, we present a new technique, Learning with Planned Episodic Resets (LeaPER), that resets the environment's state to one informed by the prior during the learning phase. We experimentally show that LeaPER significantly outperforms traditional RL approaches by a factor of up to 5X on simulated rearrangement. Further, we relax dynamics from quasi-static to welded contacts to illustrate that LeaPER is robust to the use of simpler physics models. Finally, LeaPER's closed-loop policies significantly improve task success rates relative to both open-loop controls with a planned path or simple feedback controllers that track open-loop trajectories. We demonstrate the performance and behavior of LeaPER on a physical 7-DOF manipulator in https://youtu.be/feS-zFq6J1c.
研究动机与目标
- 解决长时程、多物体重排任务中强化学习的高样本复杂度问题。
- 在不依赖专家演示或密集奖励设计的前提下,提升样本效率。
- 在存在随机动力学和不完美物理模型的条件下,实现稳健的策略学习。
- 实现仿真中训练的策略向真实世界机器人系统的迁移。
- 证明即使使用简化的物理模型,仍可为样本高效强化学习提供有效先验。
提出的方法
- LeaPER使用带有准静态或简化物理模型的重排规划器(PC-RRT)生成开环轨迹。
- 将这些轨迹上访问的状态用作强化学习训练中 episodic 重置的先验。
- 在训练过程中,环境被重置到从规划轨迹中采样的状态,从而提升探索效率。
- 该方法兼容任意 episodic 强化学习算法,实验中以 HER 作为基础算法。
- 使用简化的接触模型(例如焊接接触)以加速规划,同时仍提供有用的先验。
- 通过状态估计(OptiTrack)和动力学领域随机化,实现仿真到现实的迁移。
实验结果
研究问题
- RQ1来自规划的物理信息状态分布是否能显著降低非prehensile操作中的样本复杂度?
- RQ2在规划中使用简化的物理模型是否仍能为强化学习提供有效先验?
- RQ3LeaPER能否学习到鲁棒的闭环策略,使其在随机动力学下优于开环控制?
- RQ4LeaPER在将策略从仿真迁移到真实世界机器人系统时表现如何?
- RQ5当规划器的物理模型与真实世界动力学存在偏差时,该方法是否依然有效?
主要发现
- 与标准强化学习基线相比,LeaPER在仿真重排任务中将样本复杂度降低了最多5倍。
- 该方法在任务成功率上显著优于开环控制或跟踪规划路径的反馈控制器。
- 即使使用焊接接触模型(一种高度简化的物理近似),LeaPER仍优于无先验和标准强化学习方法。
- 通过LeaPER学习到的闭环策略对随机动力学具有鲁棒性,能够纠正与标称轨迹的偏差。
- 通过OptiTrack状态估计和领域随机化,策略成功迁移至具备7-DOF机械臂的真实系统。
- 当规划器使用近似物理模型时,LeaPER依然有效,证明了规划轨迹作为先验的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。