[论文解读] Differentiable Physics Simulations with Contacts: Do They Have Correct Gradients w.r.t. Position, Velocity and Control?
本文评估了在具有接触力学的可微分物理模拟器中梯度的准确性,对比了四种公式——LCP、凸优化、柔顺模型和基于位置的动力学(PBD)——在刚体碰撞中的表现。研究发现,所研究的模拟器均未产生与解析导数匹配的梯度,但部分模拟器仍能实现成功的学习,揭示了尽管在优化任务中具有实际应用价值,梯度正确性方面仍存在关键差距。
In recent years, an increasing amount of work has focused on differentiable physics simulation and has produced a set of open source projects such as Tiny Differentiable Simulator, Nimble Physics, diffTaichi, Brax, Warp, Dojo and DiffCoSim. By making physics simulations end-to-end differentiable, we can perform gradient-based optimization and learning tasks. A majority of differentiable simulators consider collisions and contacts between objects, but they use different contact models for differentiability. In this paper, we overview four kinds of differentiable contact formulations - linear complementarity problems (LCP), convex optimization models, compliant models and position-based dynamics (PBD). We analyze and compare the gradients calculated by these models and show that the gradients are not always correct. We also demonstrate their ability to learn an optimal control strategy by comparing the learned strategies with the optimal strategy in an analytical form. The codebase to reproduce the experiment results is available at https://github.com/DesmondZhong/diff_sim_grads.
研究动机与目标
- 评估可微分物理模拟器在接触丰富的刚体动力学中,对位置、速度和控制变量的梯度计算是否正确。
- 对比四种主流可微分接触公式的性能:LCP、凸优化、柔顺模型和PBD。
- 探究为何某些梯度不正确的模拟器仍能成功学习最优控制策略。
- 提供一个包含解析梯度的基准,用于评估未来可微分物理工具。
提出的方法
- 作者在一个统一的模拟框架内实现了四种可微分接触模型——LCP、凸优化、柔顺模型和PBD。
- 针对涉及无摩擦刚体碰撞的三个基准任务,推导出解析梯度的闭式表达。
- 对每种实现运行模拟,并使用梯度差异度量将计算梯度与解析参考值进行比较。
- 执行基于梯度的优化任务以学习最优控制输入,并将结果与已知的解析最优控制轮廓进行对比。
- 研究柔顺模型中弹簧刚度对学习稳定性与收敛性的影响。
- 发布用于复现所有实验的代码,以支持基准测试与未来验证。
实验结果
研究问题
- RQ1可微分物理模拟器是否在接触事件中正确计算了相对于位置、速度和控制变量的梯度?
- RQ2在受控环境下,LCP、凸优化、柔顺模型和PBD公式的梯度与解析梯度相比如何?
- RQ3为何某些梯度不正确的模拟器仍能成功学习最优控制策略?
- RQ4接触模型的选择如何影响基于梯度的优化的稳定性和收敛性?
- RQ5计算梯度与真实梯度之间的差异是否可量化,并与优化性能建立关联?
主要发现
- 在基准任务中,所有测试的可微分模拟器均未产生与解析梯度匹配的梯度,表明梯度计算存在根本性问题。
- 仅有基于PBD的两种实现产生的梯度接近解析参考值,表明PBD可能提供更准确的梯度估计。
- 尽管梯度不正确,多个模拟器仍成功学习了最优控制策略,收敛到接近解析最优的损失值。
- 柔顺模型中低刚度导致初始损失较高,因接触表示较软;而高刚度则引发学习不稳定并导致无法收敛。
- 缺乏时间到达接触(TOI)处理或梯度计算不佳的模拟器无法学习有意义的控制序列,通常导致控制动作为零。
- 结果凸显了一个关键断层:即使梯度不正确,优化仍可能成功,这引发了对当前可微分模拟器在基于物理的学习任务中可靠性的质疑。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。