Skip to main content
QUICK REVIEW

[論文レビュー] A Differentiable Physics Engine for Deep Learning in Robotics

Jonas Degrave, Michiel Hermans|arXiv (Cornell University)|Nov 5, 2016
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

この論文では、Theanoに基づいて構築された微分可能物理エンジンを紹介しており、ロボットシミュレーションを通じた解析的勾配計算を可能にし、勾配ベースの最適化手法を用いた複雑なコントローラーの効率的最適化を実現している。勾配逆伝播を物理シミュレーションに組み込むことで、数百万パラメータを持つ深層ニューラルネットワークコントローラーの学習において、従来の勾配非依存手法に比べて最大100倍の高速化を達成した。

ABSTRACT

An important field in robotics is the optimization of controllers. Currently, robots are often treated as a black box in this optimization process, which is the reason why derivative-free optimization methods such as evolutionary algorithms or reinforcement learning are omnipresent. When gradient-based methods are used, models are kept small or rely on finite difference approximations for the Jacobian. This method quickly grows expensive with increasing numbers of parameters, such as found in deep learning. We propose the implementation of a modern physics engine, which can differentiate control parameters. This engine is implemented for both CPU and GPU. Firstly, this paper shows how such an engine speeds up the optimization process, even for small problems. Furthermore, it explains why this is an alternative approach to deep Q-learning, for using deep learning in robotics. Finally, we argue that this is a big step for deep learning in robotics, as it opens up new possibilities to optimize robots, both in hardware and software.

研究の動機と目的

  • 勾配非依存最適化の限界を克服し、コントローラーの勾配ベースの学習を可能にすること。
  • ロボットダイナミクスを経由する解析的勾配を計算できる微分可能物理エンジンの開発により、従来のシミュレータのブラックボックス性を解消すること。
  • 微分可能物理を用いた勾配ベースの最適化が、数百万パラメータを有する大規模な深層学習コントローラーに対してもスケーラブルかつ効率的であることを実証すること。
  • 微分可能シミュレーションを用いて、ニューラルネットワーク蒸留、ハードウェアパラメータ最適化、敵対的ロボティクス学習といった新たな応用分野を探索すること。
  • 深層学習と物理ベースシミュレーションを統合する計算フレームワークを提供し、より高速でより頑健なロボットポリシー学習を実現すること。

提案手法

  • Theanoにおける計算グラフとして、3次元剛体物理エンジンを完全に自作し、自動微分をサポートする。
  • 接触および制約の解消に、ガウス=セイデル射影を用いたインパルスベースの速度ステッピングを採用し、線形補完問題(LCP)を解く。
  • 自動微分に適合する限定的な基本演算の組み合わせを用いて、すべての物理的演算を微分可能な数学的表現として定式化することで、微分可能性を実現した。
  • 衝突検出における分岐を回避するため、球体のみを用いたアプローチを採用し、TheanoにおけるGPUコンパイルとの互換性を確保した。
  • 計算グラフをCPUおよびGPU実行用にコンパイルし、高性能なシミュレーションと勾配計算を実現した。
  • 物理エンジンを経由して勾配を逆伝播させることで、コントロールパラメータをエンドツーエンド最適化する深層ニューラルネットワークコントローラーの学習を実施した。

実験結果

リサーチクエスチョン

  • RQ1微分可能物理エンジンは、高次元かつ複雑なポリシーに対しても、効率的な勾配ベースの最適化を可能にするか?
  • RQ2強化学習や進化的アルゴリズムなどの勾配非依存手法と比較して、勾配ベースの最適化は学習速度および収束性においてどの程度優れているか?
  • RQ3微分可能物理を用いることで、数百万パラメータを持つ深層ニューラルネットワークコントローラーのエンドツーエンド学習がどの程度可能になるか?
  • RQ4微分可能物理は、摩擦や質量などの物理的モデルパラメータの最適化にも応用可能か?
  • RQ5物理シミュレーションを通じて勾配が得られる場合、敵対的訓練や知識蒸留といった新たな学習パラダイムはどの程度実現可能になるか?

主な発見

  • 110万パラメータを持つコントローラーに対して、勾配降下法を用いることで、GPU上での学習時間を311秒(従来)から3.1秒に短縮し、最適化で最大100倍の高速化を達成した。
  • 1台のロボット(1,296パラメータ)に対して、CPU上での勾配計算に8.17秒、GPU上では69.6秒を要したが、これは勾配評価が実現可能でスケーラブルであることを示している。
  • 128台のロボットをバッチ処理した場合、GPU上で1ステップあたり1.01 msの低遅延を維持した。勾配計算を伴っても、並列最適化が効率的に行えることを示している。
  • 物理エンジンを経由したバックプロパゲーションにより、数百万パラメータを持つ深層ニューラルネットワークコントローラーのエンドツーエンド学習が可能となり、強化学習や進化的戦略の導入を回避した。
  • 今後の応用として、物理モデルをニューラルネットワークに蒸留する、ハードウェアパラメータの最適化、敵対的ロボティクス学習の実現が可能になる。
  • エンジンの微分可能性により、摩擦係数などの状態依存モデルパラメータを、学習可能なニューラルネットワークを介して効率的に最適化できるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。