Skip to main content
QUICK REVIEW

[论文解读] Planning with a Receding Horizon for Manipulation in Clutter using a Learned Value Function

Wissam Bejjani, Rafael Papallas|White Rose Research Online (University of Leeds, The University of Sheffield, University of York)|Mar 21, 2018
Reinforcement Learning in Robotics参考文献 17被引用 4
一句话总结

本文提出一种基于学习价值函数的有限时域规划器(RHP),用于在复杂环境中实现实时、闭环的操控。通过结合基于采样的规划器生成初始规划,并利用强化学习对价值函数进行微调,该方法实现了快速、响应式的规划,在现实世界不确定性下显著优于开环方法,即使在物理参数不匹配的情况下也能实现高成功率。

ABSTRACT

Manipulation in clutter requires solving complex sequential decision making problems in an environment rich with physical interactions. The transfer of motion planning solutions from simulation to the real world, in open-loop, suffers from the inherent uncertainty in modelling real world physics. We propose interleaving planning and execution in real-time, in a closed-loop setting, using a Receding Horizon Planner (RHP) for pushing manipulation in clutter. In this context, we address the problem of finding a suitable value function based heuristic for efficient planning, and for estimating the cost-to-go from the horizon to the goal. We estimate such a value function first by using plans generated by an existing sampling-based planner. Then, we further optimize the value function through reinforcement learning. We evaluate our approach and compare it to state-of-the-art planning techniques for manipulation in clutter. We conduct experiments in simulation with artificially injected uncertainty on the physics parameters, as well as in real world tasks of manipulation in clutter. We show that this approach enables the robot to react to the uncertain dynamics of the real world effectively.

研究动机与目标

  • 解决在物理模型与仿真模型存在偏差的复杂环境中执行运动规划的挑战。
  • 克服开环规划在物理建模不准确和接触丰富交互场景下的局限性。
  • 开发一种快速、闭环的规划系统,实现实时环境不确定性响应。
  • 学习一个鲁棒的、数据驱动的价值函数,以估计代价至目标,实现无需人工启发式设计的高效有限时域规划。
  • 通过端到端强化学习对价值函数进行微调,提升规划性能,该步骤在初始预训练之后进行。

提出的方法

  • 使用基于采样的动力学-运动规划RRT算法在仿真中生成专家示范,创建用于预训练的状态-动作-价值对。
  • 训练一个深度神经网络(DNN)以预测状态-动作对的价值,估计从该状态出发的期望代价至目标。
  • 实现一个有限时域规划器(RHP),在短时间范围内进行规划,利用DNN预测的价值函数作为启发式方法指导动作选择。
  • 使用强化学习(PPO)对DNN价值函数进行微调,使其预测结果与实际RHP执行结果对齐,从而提升鲁棒性。
  • 通过在每一步使用环境的最新观测重新规划,实现实时反馈,支持闭环适应。
  • 在Box2D物理仿真中,对物体参数(形状、摩擦系数、密度)注入高斯噪声,以在评估期间模拟现实世界不确定性。

实验结果

研究问题

  • RQ1学习到的价值函数是否能提升在复杂操控任务中有限时域规划的效率与鲁棒性?
  • RQ2通过强化学习对预训练价值函数进行微调,在物理建模不确定性下对性能有何影响?
  • RQ3在现实世界执行场景中,基于学习价值函数的闭环RHP在多大程度上优于开环规划?
  • RQ4数据驱动的价值函数是否能消除复杂操控任务中对手动设计启发式方法或奖励塑造的依赖?
  • RQ5规划时域长度和轨迹展开次数的选择如何影响不确定环境中成功率与计算时间之间的权衡?

主要发现

  • 在物理参数不确定性高达30%的情况下,采用学习价值函数的RHP(RHP-66)成功率达到96%,显著优于开环动力学-运动规划器,后者在相同条件下成功率下降至44%。
  • RHP采用6步时域和66次轨迹展开(RHP-66)在所有不确定性水平下均达到最高成功率(96%),证明了更长时域和充分轨迹展开的有效性。
  • 每次成功执行的计算时间保持在合理范围内(平均低于2秒),即使使用强化学习,也能实现实时运行。
  • 在UR5机器人上的真实世界实验验证了该方法的鲁棒性:RHP在全部三项测试任务中均成功,而开环规划器在三项中有两项失败。
  • 结合基于采样规划的预训练与PPO微调,所得到的价值函数在泛化到现实世界动力学方面优于仅使用初始DNN的情况。
  • 系统通过基于实时观测的持续重规划,对意外物理行为(如物体形状不匹配)表现出强大的适应能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。