Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Differentiable Simulation of Articulated Bodies

Yi-Ling Qiao, Junbang Liang|arXiv (Cornell University)|Sep 16, 2021
Model Reduction and Neural Networks被引用数 6
ひとこと要約

この論文は、手動アドジョイント微分を用いて、PyTorch より 20 倍速く、Ceres より 50 倍速いバックワードパスを実現する、関節部品のための微分可能物理シミュレータを提示している。これにより、強化学習およびパrameter推定における効率的な勾配ベース最適化が可能になった。本手法は、効率的な接触処理と高性能な自動微分を組み合わせることで、歩行およびパrameter推定タスクにおいて最先端のサンプル効率を達成した。

ABSTRACT

We present a method for efficient differentiable simulation of articulated bodies. This enables integration of articulated body dynamics into deep learning frameworks, and gradient-based optimization of neural networks that operate on articulated bodies. We derive the gradients of the forward dynamics using spatial algebra and the adjoint method. Our approach is an order of magnitude faster than autodiff tools. By only saving the initial states throughout the simulation process, our method reduces memory requirements by two orders of magnitude. We demonstrate the utility of efficient differentiable dynamics for articulated bodies in a variety of applications. We show that reinforcement learning with articulated systems can be accelerated using gradients provided by our method. In applications to control and inverse problems, gradient-based optimization enabled by our work accelerates convergence by more than an order of magnitude.

研究の動機と目的

  • 複雑な接触ダイナミクスを伴う関節部品のための効率的かつ高性能な微分可能シミュレーションを可能にすること。
  • 強化学習およびパrameter推定に用いられる物理エンジンにおけるバックプロパゲーションの計算ボトルネックを解決すること。
  • ポリシー学習とパrameter最適化の両方を統合されたフレームワークでサポートする微分可能シミュレータを開発すること。
  • シミュレーションベースの増強とポリシー強化を可能にすることで、強化学習におけるサンプル効率を向上させること。

提案手法

  • 著者らは、関節部品アルゴリズムとプロジェクテッド・ガウス=ザイデル(PGS)接触ソルバーのためのアドジョイント方程式を手動で導出することで、効率的なバックワードパスを実現した。
  • シミュレータは C++ で実装されており、JAX と互換性のあるインターフェースを備え、1ステップあたり 0.6ms のバックワードパスを達成した—これは物理エンジンの 20 倍速く、PyTorch の 50 倍速い。
  • 同じ計算グラフを通じて、運動制御(関節トルク)と接触パラメータ(摩擦係数)の両方のエンドツーエンド微分可能性をサポートしている。
  • MBPO および CMA-ES と統合されており、共通の微分可能シミュレーションを用いたポリシーとパラメータの両方の学習が可能になっている。
  • 一般用途の微分可能プログラミングツール(例:DiffTaichi)の制限を避けるために、複雑な制御フローと混合ループをサポートしている。
  • 勾配ベース最適化を用いて摩擦係数と関節トルクを推定し、損失関数の地形においてグローバル最小値への収束を実証した。

実験結果

リサーチクエスチョン

  • RQ1関節部品ダイナミクスおよび接触ソルバーに対する手動アドジョイント微分が、一般用途の自動微分ツールよりも著しく速いバックワードパスを達成できるか?
  • RQ2提案された微分可能シミュレータは、歩行タスクにおける強化学習のサンプル効率をどのように向上させるか?
  • RQ3勾配ベース最適化を用いて、摩擦係数や関節トルクといった内部パラメータを、関節系で効果的に推定できるか?
  • RQ4微分可能シミュレーションにおけるポリシー強化とサンプル強化戦略は、収束速度および最終的パフォーマンスの観点でどのように比較できるか?
  • RQ5多リンクパンドラムのような大規模な逐次系をモデル化する際、シミュレータにどのような制限があるか?

主な発見

  • 提案手法は 1 ステップあたり 0.6ms のバックワードパス時間を達成した。これは PyTorch(285.9ms)の 50 倍速く、物理エンジンの 20 倍速い。
  • 摩擦係数の効果的なパラメータ推定が可能であり、勾配ベース手法が損失関数の地形においてグローバル最小値に正常に収束した。
  • MBPO を用いた学習では、ベースラインと比較して収束が早く、最終的な報酬値も高い結果を得た。特に N パンダムおよび Laikago の歩行タスクで顕著な優位性を示した。
  • N=5 および N=7 リンクの損失曲線は、安定的かつ迅速な収束を示し、数値的不安定性によるパフォーマンス劣化も観察されなかった。
  • JAX(4.9ms)を除き、Ceres(30.7ms)、CppAD(2.9ms)、PyTorch(285.9ms)に比べてバックワードパス効率が優れていた。
  • 著者らは、100 エポックを過ぎて MBPO でパフォーマンスが低下したのを観察し、長時間スパンのダイナミクスを近似するためのモデル表現力の不足を原因として特定した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。