Skip to main content
QUICK REVIEW

[论文解读] Sampling-based Model Predictive Control Leveraging Parallelizable Physics Simulations

Corrado Pezzato, Chadi Salmi|arXiv (Cornell University)|Jul 18, 2023
Robotic Path Planning Algorithms被引用 6
一句话总结

本文提出了一种无需训练、基于采样的模型预测路径积分(MPPI)控制框架,采用可GPU并行化的IsaacGym物理仿真器作为动力学模型,无需显式建模动力学和接触关系。通过在仿真中实现实时、并行的轨迹滚动,该方法在非抓取式操作和全身运动规划等高接触复杂度任务中实现了鲁棒且可泛化的控制,并在7自由度机械臂与全向移动基座上成功实现了25Hz的实时真实世界部署,且无需针对任务进行调优。

ABSTRACT

We present a method for sampling-based model predictive control that makes use of a generic physics simulator as the dynamical model. In particular, we propose a Model Predictive Path Integral controller (MPPI), that uses the GPU-parallelizable IsaacGym simulator to compute the forward dynamics of a problem. By doing so, we eliminate the need for explicit encoding of robot dynamics and contacts with objects for MPPI. Since no explicit dynamic modeling is required, our method is easily extendable to different objects and robots and allows one to solve complex navigation and contact-rich tasks. We demonstrate the effectiveness of this method in several simulated and real-world settings, among which mobile navigation with collision avoidance, non-prehensile manipulation, and whole-body control for high-dimensional configuration spaces. This method is a powerful and accessible open-source tool to solve a large variety of contact-rich motion planning tasks.

研究动机与目标

  • 开发一种无需显式建模动力学或接触力学的通用、实时控制框架。
  • 解决传统MPC在处理非光滑、混合动力学(如推动物体和操作任务中常见)时的局限性。
  • 通过直接采样关节速度而非限制于2D末端执行器轨迹,实现对高维空间的直接控制。
  • 通过利用仿真并行化和自适应代价函数调优,提升对现实世界干扰的鲁棒性与可迁移性。

提出的方法

  • 该方法使用IsaacGym作为可微分、可GPU并行化的物理仿真器,在实时中对采样输入序列进行前向轨迹滚动。
  • 在每个控制步长,将仿真器重置至当前机器人状态,并在有限时域T内对K=500组随机输入序列施加,以生成候选轨迹。
  • MPPI通过重要性采样和高斯噪声扰动,在采样轨迹上最小化特定任务的代价函数,计算最优控制输入。
  • 该方法直接采样关节速度,实现无需依赖逆运动学或预定义末端执行器路径的全肢体、高自由度控制。
  • 该框架设计为模块化:仅需定义代价函数,而动力学、接触和约束均由物理引擎隐式处理。
  • 该方法支持25Hz的实时执行,并通过持续重规划实现对干扰的在线自适应。

实验结果

研究问题

  • RQ1能否将物理仿真器作为MPPI中的黑箱动力学模型,从而在机器人控制中消除对显式接触与动力学建模的需求?
  • RQ2GPU并行化仿真在多大程度上提升了采样型MPC在高自由度系统中的可扩展性与实时性能?
  • RQ3该框架在无需重新训练或重新调优动力学模型的前提下,对不同机器人和任务的泛化能力如何?
  • RQ4当仅调整代价函数权重时,该方法在真实世界干扰和仿真到现实的迁移中表现出多大程度的鲁棒性?
  • RQ5在非抓取式操作任务中,MPPI中直接采样关节速度是否优于传统的基于末端执行器轨迹的方法?

主要发现

  • 该方法在7自由度机械臂与全向移动基座上实现了25Hz的实时控制,在仿真与真实世界实验中均表现出相当的任务完成时间与最终位置误差。
  • 真实世界推动物体任务中,系统对人为干扰表现出鲁棒性,机器人能自主补偿并重新定位接触点,而无需预设推杆-物体构型。
  • 在高接触复杂度的操作任务中,该方法优于基线方法,尤其在需要动态接触重构与非抓取式操作的场景中表现更优。
  • 真实世界推动物体任务的完成时间与最终位置误差与仿真结果相差不超过10%,表明其具有极强的仿真到现实迁移能力。
  • 在无接触任务中,该方法性能与最先进规划器相当;而在高接触复杂度场景中,性能显著优于后者。
  • 该框架仅需调整代价函数权重即可完成真实世界部署,无需修改时域、采样数量、控制频率或随机化策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。