Skip to main content
QUICK REVIEW

[论文解读] Follow the Gradient: Crossing the Reality Gap using Differentiable Physics (RealityGrad)

Jack Collins, Ross Brown|arXiv (Cornell University)|Sep 10, 2021
Robotic Path Planning Algorithms参考文献 26被引用 4
一句话总结

本文提出RealityGrad,一种新颖的模拟到现实(sim2real)方法,利用可微分物理引擎通过真实世界滚动(rollouts)迭代优化机器人轨迹并改进仿真参数。通过结合基于梯度的轨迹优化与系统辨识,RealityGrad在单次迭代中仅用桌面CPU运行22分钟内将任务空间误差降低66%,显著缩小了机器人操作臂的现实差距。

ABSTRACT

We propose a novel iterative approach for crossing the reality gap that utilises live robot rollouts and differentiable physics. Our method, RealityGrad, demonstrates for the first time, an efficient sim2real transfer in combination with a real2sim model optimisation for closing the reality gap. Differentiable physics has become an alluring alternative to classical rigid-body simulation due to the current culmination of automatic differentiation libraries, compute and non-linear optimisation libraries. Our method builds on this progress and employs differentiable physics for efficient trajectory optimisation. We demonstrate RealitGrad on a dynamic control task for a serial link robot manipulator and present results that show its efficiency and ability to quickly improve not just the robot's performance in real world tasks but also enhance the simulation model for future tasks. One iteration of RealityGrad takes less than 22 minutes on a desktop computer while reducing the error by 2/3, making it efficient compared to other sim2real methods in both compute and time. Our methodology and application of differentiable physics establishes a promising approach for crossing the reality gap and has great potential for scaling to complex environments.

研究动机与目标

  • 解决机器人领域长期存在的现实差距问题,即在仿真中训练的策略在部署到真实机器人时因动力学与噪声差异而失效。
  • 克服现有sim2real方法(如领域随机化)的局限性,后者常导致保守或低效的策略。
  • 开发一种高效、可扩展且迭代式的联合优化方法,同步提升真实世界策略性能与仿真模型精度。
  • 利用真实机器人数据与可微分物理引擎,实现仿真模型的在线、实时自适应,支持基于梯度的优化。
  • 证明可微分仿真器不仅可用于控制优化,还可用于精确的系统辨识,从而提升长期的sim2real迁移性能。

提出的方法

  • 使用可微分物理引擎计算通过仿真动力学的梯度,从而实现对控制策略与模型参数的基于梯度的优化。
  • 使用具有可微分动力学的模型预测控制(MPC),基于当前模型参数在仿真中生成K条最优轨迹。
  • 在生成的最优轨迹上训练神经网络策略,以生成可微分的策略网络。
  • 在真实机器人上执行训练好的策略,收集真实世界轨迹数据。
  • 通过在仿真中最小化真实机器人轨迹与仿真轨迹之间的差异,对模拟器参数使用梯度下降法执行系统辨识。
  • 迭代执行完整流程——轨迹优化、策略训练、真实世界滚动与系统辨识——以逐步提升策略性能与仿真保真度。

实验结果

研究问题

  • RQ1可微分物理能否在单一统一流程中实现机器人轨迹与仿真参数的高效、基于梯度的优化?
  • RQ2真实世界机器人滚动在多大程度上能提升可微分物理仿真器对真实机器人动力学的建模准确性?
  • RQ3通过结合可微分物理的迭代式sim2real循环,现实差距(以任务空间误差衡量)能降低多少?
  • RQ4与领域随机化训练的策略相比,所提出方法是否能生成更高效、更不保守的策略?
  • RQ5该方法是否具备计算效率,可在标准桌面硬件上运行而无需高端GPU加速?

主要发现

  • RealityGrad将仿真与真实机器人轨迹之间的累积欧氏误差从默认参数下的129.79米降低至一次迭代后的47.81米,误差降低63%。
  • 系统辨识的残差误差从默认参数下的350,155.24降至一次迭代后的28.87,表明仿真与真实世界动力学之间具有极强的对齐性。
  • 经过第二次迭代后,残差误差进一步降低至12.26,仿真与真实轨迹之间的累积误差降至59.98米,显示出持续改进。
  • RealityGrad的单次完整迭代在桌面CPU(AMD 3970,128GB RAM)上耗时不足22分钟,证明了其极高的计算效率。
  • 该方法成功识别出关键物理参数,尤其是关节阻尼值,表明仿真模型可被精确校准以匹配真实机器人行为。
  • 改进后的仿真模型提升了策略的泛化能力与收敛速度,使后续迭代中的策略表现出更高效、更少振荡的行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。