Skip to main content
QUICK REVIEW

[论文解读] Motion Policy Networks

Adam Fishman, Adithyavairan Murali|arXiv (Cornell University)|Oct 21, 2022
Human Pose and Action Recognition被引用 6
一句话总结

运动策略网络(Mπ 网络)是一种端到端的深度学习模型,可直接从原始深度点云观测中生成无碰撞、平滑的机器人操作臂运动。在 50 万个模拟环境中训练了 300 万个运动规划问题后,Mπ 网络在成功率上比以往的神经网络规划器高出 46%,同时比全局规划器快得多,并且对真实世界传感器噪声具有鲁棒性。

ABSTRACT

Collision-free motion generation in unknown environments is a core building block for robot manipulation. Generating such motions is challenging due to multiple objectives; not only should the solutions be optimal, the motion generator itself must be fast enough for real-time performance and reliable enough for practical deployment. A wide variety of methods have been proposed ranging from local controllers to global planners, often being combined to offset their shortcomings. We present an end-to-end neural model called Motion Policy Networks (M$π$Nets) to generate collision-free, smooth motion from just a single depth camera observation. M$π$Nets are trained on over 3 million motion planning problems in over 500,000 environments. Our experiments show that M$π$Nets are significantly faster than global planners while exhibiting the reactivity needed to deal with dynamic scenes. They are 46% better than prior neural planners and more robust than local control policies. Despite being only trained in simulation, M$π$Nets transfer well to the real robot with noisy partial point clouds. Code and data are publicly available at https://mpinets.github.io.

研究动机与目标

  • 解决仅使用原始深度传感器输入在未知环境中生成快速、平滑且无碰撞的机器人运动的挑战。
  • 克服传统规划器和局部控制器的局限性,这些方法要么速度太慢,要么缺乏反应性,或在复杂几何结构中失效。
  • 实现从原始观测的端到端学习,无需显式场景表示或预训练的碰撞模型。
  • 通过大规模模拟训练提高在动态和噪声环境中的泛化能力和鲁棒性。
  • 在模拟和真实世界部署中均实现高性能,且领域偏移极小。

提出的方法

  • Mπ 网络在包含 50 万个多样化环境的 300 万个运动规划问题的大型合成数据集上进行端到端训练。
  • 该模型以单个深度点云作为输入,输出任务空间中一系列平滑、无碰撞的末端执行器轨迹。
  • 网络架构设计为具有反应性和可微性,支持实时推理和通过模仿学习进行训练。
  • 训练使用混合规划器和全局规划器的示范来监督运动策略学习,即使在测试时无法访问完整场景几何信息也能实现。
  • 通过轨迹损失、碰撞惩罚和光滑性正则化相结合的方式优化模型,以确保运动的安全性和自然性。
  • 通过领域随机化以及在部分、噪声点云上进行训练,实现模拟到现实的迁移,以模拟真实传感器条件。

实验结果

研究问题

  • RQ1端到端的神经策略能否在不进行显式场景重建的情况下,直接从原始深度点云中学习生成无碰撞、平滑的运动?
  • RQ2Mπ 网络在成功率、速度和鲁棒性方面与传统全局规划器和局部控制策略相比表现如何?
  • RQ3仅在模拟环境中训练的模型在面对具有噪声和部分观测的真实世界机器人操作时,其泛化能力能达到何种程度?
  • RQ4在多样化模拟环境中进行大规模模仿学习,是否能提升模型在复杂、未见环境中的泛化能力和成功率?
  • RQ5该模型能否超越以往的神经规划器,后者在推理时仍依赖外部规划器或碰撞检测器?

主要发现

  • Mπ 网络在无需测试时访问完整场景几何信息的前提下,比以往的神经规划器(如 MPNets)在复杂运动规划基准测试中成功率高出 46%。
  • 该模型比 RRT* 等全局规划器快超过 100 倍,且推理速度达到实时部署要求。
  • 在桌面任务中,Mπ 网络在距离目标 1 cm 以内的成功率高达 95.67%,优于 STORM(88.67%)和 G. Fabrics(85.83%)在相同设置下的表现。
  • 在失败模式分析中,Mπ 网络在最困难的问题上仅出现 0.5% 的自碰撞和 0.0% 的关节越界,表明其具有高度的安全性和可靠性。
  • 该模型在真实世界设置中表现出良好的泛化能力,仅使用来自深度传感器的部分和噪声点云,即可成功实现从模拟到真实机器人的迁移。
  • 在可由全局规划器解决的衣橱问题上,Mπ 网络的成功率达到 96.83%,优于 STORM(53.83%)和 G. Fabrics(62.33%)在相同基准测试中的表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。