Skip to main content
QUICK REVIEW

[論文レビュー] Run, skeleton, run: skeletal model in a physics-based simulation

Mikhail Pavlov, Sergey Kolesnikov|arXiv (Cornell University)|Nov 18, 2017
Reinforcement Learning in Robotics参考文献 19被引用数 6
ひとこと要約

本論文では、OpenSimにおける骨格筋骨格モデルを用いた物理ベースの強化学習アプローチを提示し、障害物コースを素早く走る人間のようなエージェントの学習を実現した。著者らは、層正則化、パラメータノイズ、アクション/状態の反転を組み合わせたDDPGが、最も高いサンプル効率とパフォーマンスを達成した。20スレッドで実行した結果、NIPS 2017 Learning to Runコンペティションで3位となり、最大リターンは38.46を記録した。

ABSTRACT

In this paper, we present our approach to solve a physics-based reinforcement learning challenge "Learning to Run" with objective to train physiologically-based human model to navigate a complex obstacle course as quickly as possible. The environment is computationally expensive, has a high-dimensional continuous action space and is stochastic. We benchmark state of the art policy-gradient methods and test several improvements, such as layer normalization, parameter noise, action and state reflecting, to stabilize training and improve its sample-efficiency. We found that the Deep Deterministic Policy Gradient method is the most efficient method for this environment and the improvements we have introduced help to stabilize training. Learned models are able to generalize to new physical scenarios, e.g. different obstacle courses.

研究の動機と目的

  • 物理ベースのシミュレーションにおける生理学的に妥当な人間モデルを用いて、NIPS 2017 'Learning to Run'チャレンジに挑戦すること。
  • 高次元的で確率的かつ計算コストの高い環境におけるサンプル効率の評価と向上を図ること。
  • アーキテクチャ的およびトレーニングの変更が、複雑な歩行タスクにおける方策勾配法に与える影響を調査すること。
  • 訓練中に見られなかった新しい障害物コースに対しても適応可能な、堅牢で汎用性のあるコントローラーの開発

提案手法

  • 体部の位置、速度、障害物の位置を含む41次元の状態空間を持つOpenSimにおける骨格筋骨格モデルを用いた。
  • サンプル効率を高めるために、オフポリシー性と経験リプレイを有するため、主にDeep Deterministic Policy Gradient (DDPG)をコアアルゴリズムとして採用した。
  • 訓練の安定化と異なるネットワーク層間での一般化の向上のため、層正則化を適用した。
  • 探索の向上と筋肉制御における対称性の向上のため、パラメータノイズとアクション/状態の反転を統合した。
  • リプレイバッファのサイズを5e6に設定し、Adam最適化を用いて、エージェントとクライアントネットワークの学習率を線形に減少させた。
  • 各変更のパフォーマンスと安定性に与える影響を評価するため、8スレッドおよび20スレッドでのアブレーションスタディを実施した。

実験結果

リサーチクエスチョン

  • RQ1高次元的で確率的かつ計算コストの高い物理ベースの環境において、どの方策勾配法が最も優れたパフォーマンスを示すか?
  • RQ2層正則化やパラメータノイズのようなアーキテクチャ的およびトレーニングの変更は、学習の安定性とサンプル効率にどのように影響するか?
  • RQ3アクションおよび状態の反転は、歩行タスクにおける学習の対称性とパフォーマンスをどの程度向上させるか?
  • RQ4訓練中に見られなかった新しい障害物コースに対し、訓練済みコントローラーは一般化できるか?
  • RQ5並列トレーニングスレッドの数は、最終的なパフォーマンスおよびモデルランクにどのように影響するか?

主な発見

  • オフポリシー性と経験リプレイのおかげで、DDPGはPPOやTRPOを上回り、高いサンプル効率を達成した。
  • 層正則化、パラメータノイズ、アクション/状態の反転の組み合わせが、20スレッドで最大リターン38.46を達成し、最高のパフォーマンスを記録した。
  • アクションおよび状態の反転により、有効なトレーニングデータが2倍に増加し、筋肉活性化の対称性が向上し、より自然な走行行動が得られた。
  • 層正則化はパラメータノイズの安定化に不可欠であり、これを導入しないと、ノイズの使用にもかかわらずパフォーマンスが著しく低下した。
  • 8スレッドと20スレッドの両方でモデルランクは安定しており、並列処理の増加に伴いパフォーマンスが顕著に向上した。
  • 最終モデルは新しい障害物コースに対しても良好に一般化でき、学習済み方策の堅牢性と転送可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。