Skip to main content
QUICK REVIEW

[論文レビュー] Accelerated Policy Learning with Parallel Differentiable Simulation

Jie Xu, Viktor Makoviychuk|arXiv (Cornell University)|Apr 14, 2022
Reinforcement Learning in Robotics被引用数 16
ひとこと要約

本論文は、複雑で接触が豊富な制御タスクにおける強化学習の高速化を図るために、高性能で並列処理可能な微分可能シミュレータを活用する新規な方策学習アルゴリズムSHACを提案する。滑らかなクライミング関数を用いて局所最適解を回避し、勾配の安定化を図るための切り捨てられた学習ウィンドウを採用することで、高次元の筋肉駆動型歩行タスクにおいて、最先端のRL手法と比較して17倍以上の高速な学習を達成するとともに、サンプル効率およびウォールクロック時間効率を顕著に向上させた。

ABSTRACT

Deep reinforcement learning can generate complex control policies, but requires large amounts of training data to work effectively. Recent work has attempted to address this issue by leveraging differentiable simulators. However, inherent problems such as local minima and exploding/vanishing numerical gradients prevent these methods from being generally applied to control tasks with complex contact-rich dynamics, such as humanoid locomotion in classical RL benchmarks. In this work we present a high-performance differentiable simulator and a new policy learning algorithm (SHAC) that can effectively leverage simulation gradients, even in the presence of non-smoothness. Our learning algorithm alleviates problems with local minima through a smooth critic function, avoids vanishing/exploding gradients through a truncated learning window, and allows many physical environments to be run in parallel. We evaluate our method on classical RL control tasks, and show substantial improvements in sample efficiency and wall-clock time over state-of-the-art RL and differentiable simulation-based algorithms. In addition, we demonstrate the scalability of our method by applying it to the challenging high-dimensional problem of muscle-actuated locomotion with a large action space, achieving a greater than 17x reduction in training time over the best-performing established RL algorithm.

研究の動機と目的

  • 微分可能シミュレーションの限界を解消すること。特に、接触が豊富で複雑な制御タスクでは、勾配最適化が局所最適解や勾配消失/爆発の影響を受けて失敗しやすい。
  • 微分可能シミュレータから得られる解析的勾配を、頑健な方策最適化フレームワークと統合することで、深層強化学習におけるサンプル効率およびウォールクロック時間の改善を図ること。
  • 標準的なRLアルゴリズムでは取り扱いが困難な、高次元タスク(例:筋肉駆動型ヒューマノイド歩行)においても、スケーラブルで高効率な方策学習を可能にすること。
  • 長時間スパンで接触が豊富な環境を含む、サンプル効率およびウォールクロック時間の両面で、勾配ベース手法とRLベース手法を公平かつ包括的に比較するベンチマークを提供すること。

提案手法

  • 短い学習ウィンドウ(truncated learning window)を用いることで、バックプロパゲーションの長さを制限し、勾配消失および勾配爆発を軽減する、短時間ホライズンアクタクリティック(SHAC)アルゴリズムを提案する。
  • ノイズの多い報酬ランドスケープを滑らかな補間関数として近似するクライミングネットワークを導入し、方策の失敗や非滑らかダイナミクスに起因する局所最適解の影響を低減する。
  • GPUアクセラレーションを実装したPyTorchベースの微分可能シミュレータを開発し、複数の環境を並列でシミュレート可能にすることで、大規模な勾配計算を効率的に行えるようにした。
  • 微分可能シミュレータから得られる解析的勾配を、方策最適化ループに統合し、価値関数と組み合わせて方策の更新を誘導する。
  • 勾配品質と計算効率のバランスを図るため、短いホライズンのロールアウト戦略(h=32)を採用し、トレーニングの安定性を向上させた。
  • 複数の環境にわたる並列処理を適用することで、データスルーレートを向上させ、ウォールクロック時間のトレーニング短縮を実現した。

実験結果

リサーチクエスチョン

  • RQ1微分可能シミュレーションは、ヒューマノイド歩行のような複雑で接触が豊富な制御タスクにおける方策学習を、実際に効果的に高速化できるか?
  • RQ2長時間スパンで非滑らかである制御タスクにおいて、勾配ベース最適化は局所最適解や不安定な勾配といった課題をどのように克服できるか?
  • RQ3微分可能シミュレータとクライミングベース手法を組み合わせることで、サンプル効率およびウォールクロック時間の両面で、最先端のモデルフリーRLアルゴリズムを上回ることができるか?
  • RQ4高次元制御問題(150以上の制御自由度を有する)において、並列微分可能シミュレーションはスケーラビリティをどの程度向上させるか?

主な発見

  • SHACは、高次元の筋肉・腱駆動型ヒューマノイド(Humanoid MTU)タスクにおいて、最もパフォーマンスの優れた既存のRLアルゴリズムと比較して、トレーニング時間を17倍以上短縮した。
  • CartPole Swing Up や Ant といった古典的ベンチマークにおいても、SHACはMBPOと比較して最大162倍、REDQと比較して最大102倍のウォールクロック時間短縮を達成した。これは、REDQがサンプル効率に優れているにもかかわらず、依然としてSHACの優位性が顕著に現れた。
  • SHACの勾配は著しく安定しており、有限差分近似と一致する良好な挙動を示した。一方、標準的なバックプロパゲーションスルータイム(BPTT)では勾配爆発が観察された。
  • SHACが生成する補間ランドスケープは、元のノイズの多いランドスケープと比較して著しく滑らかであり、方策の失敗や不連続性が存在する状況でも、より信頼性の高い最適化を可能にした。
  • SHACは、PPO、SAC、MBPO、REDQといった最先端のRLアルゴリズムを上回り、全評価タスク(長時間スパン・接触豊富な環境を含む)において、サンプル効率およびウォールクロック時間の両面で優れた性能を示した。
  • SHACは、REDQ や MBPO がデフォルトのハイパーパrameter設定では失敗する高次元タスク(例:Humanoid MTU)においても正常に学習を実行でき、スケーラビリティおよびロバストネスに優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。