Skip to main content
QUICK REVIEW

[論文レビュー] Path Integral Guided Policy Search

Yevgen Chebotar, Mrinal Kalakrishnan|arXiv (Cornell University)|Oct 3, 2016
Reinforcement Learning in Robotics参考文献 34被引用数 12
ひとこと要約

本稿では、接触ダイナミクスに不連続性を示すタスク(ドア開閉やピックアンドプレースなど)に対して、従来のLQRに基づく局所的ポリシー最適化の代わりに、モデルフリーで確率的最適制御手法であるPI²を用いるPath Integral Guided Policy Search(PI-GPS)を提案する。この手法により、連続的でない接触ダイナミクスを有する複雑なロボット操作ポリシーの有効な学習が可能となる。ポリシーの学習段階でオンポリシー採択を統合し、繰り返しにわたって訓練インスタンスの多様性を高めることで、優れた一般化性能を達成し、視覚ベースの深層ニューラルネットワークポリシーを用いたドア開閉およびピックアンドプレースタスクにおいて、先行手法を上回る性能を発揮する。

ABSTRACT

We present a policy search method for learning complex feedback control policies that map from high-dimensional sensory inputs to motor torques, for manipulation tasks with discontinuous contact dynamics. We build on a prior technique called guided policy search (GPS), which iteratively optimizes a set of local policies for specific instances of a task, and uses these to train a complex, high-dimensional global policy that generalizes across task instances. We extend GPS in the following ways: (1) we propose the use of a model-free local optimizer based on path integral stochastic optimal control (PI2), which enables us to learn local policies for tasks with highly discontinuous contact dynamics; and (2) we enable GPS to train on a new set of task instances in every iteration by using on-policy sampling: this increases the diversity of the instances that the policy is trained on, and is crucial for achieving good generalization. We show that these contributions enable us to learn deep neural network policies that can directly perform torque control from visual input. We validate the method on a challenging door opening task and a pick-and-place task, and we demonstrate that our approach substantially outperforms the prior LQR-based local policy optimizer on these tasks. Furthermore, we show that on-policy sampling significantly increases the generalization ability of these policies.

研究の動機と目的

  • 接触ダイナミクスに不連続性を示すタスク(ドア開閉やピックアンドプレースなど)において、モデルベースのLQRに基づく局所的ポリシー最適化が性能を発揮できない問題に対処すること。
  • スケーラブルな教師あり学習フレームワークを用いて、視覚ベースのロボット操作のための高次元で深いニューラルネットワークポリシーの有効な訓練を可能にすること。
  • オンポリシー採択を用いて各イテレーションで新しいタスクインスタンスを動的に採択することで、訓練の多様性を高め、ポリシーの一般化性能を向上させること。
  • モデルフリーなPI²が、LQRが失敗するような極めて非滑らかで不連続な環境においても、局所的ポリシーを効果的に最適化できることを示すこと。
  • 複雑な接触処理と視覚入力処理を要する実世界のロボットタスクにおいて、本手法の有効性を検証すること。

提案手法

  • ガイドドポリシー探索におけるLQRベースの局所的ポリシー最適化器を、モデルフリーで確率的最適制御手法であるPI²に置き換える。PI²は経路積分近似を用いてポリシー改善を実行する。
  • 安定した局所的ポリシー更新を保証するとともに、探索性と収束性を維持するため、PI²のKL制約付き変種を導入する。
  • グローバルポリシーの訓練段階でオンポリシー採択を採用し、各イテレーションにおいて現在のグローバルポリシーの挙動から新しいタスクインスタンスを採択する。
  • 高次元の視覚観測を直接モータートルクにマッピングする深層ニューラルネットワークポリシーを採用し、局所的ポリシーが生成する軌道に基づく教師あり学習により訓練する。
  • カリキュラム学習を適用し、ポリシー訓練中に徐々に訓練領域を拡大することで、最小成功率を維持し、壊滅的忘却を回避する。
  • デモンストレーションは初期ポリシー構造の構築にのみ使用し、繰り返しのオンポリシー採択により多様なインスタンスを経て、グローバルポリシーが広範なタスクインスタンス分布に一般化する。

実験結果

リサーチクエスチョン

  • RQ1LQRベースの手法が失敗するような、極めて不連続な接触ダイナミクスを有するロボット操作タスクにおいて、PI²による局所的ポリシー最適化が有効に機能するか?
  • RQ2ガイドドポリシー探索におけるオンポリシー採択が、多様なタスクインスタンスにわたるグローバルポリシーの一般化性能を顕著に向上させるか?
  • RQ3PI²で最適化された局所的ポリシーの軌道に基づく教師あり学習により訓練された深層ニューラルネットワークポリシーが、実世界の視覚ベースの操作タスクで高い性能を達成できるか?
  • RQ4PI²とオンポリシー採択の組み合わせは、LQRを用いた先行GPS手法と比較して、複雑なタスクにおける成功確率とロバスト性の面で優れているか?
  • RQ5繰り返しで多様なインスタンスを採択する訓練により、グローバルポリシーは初期デモンストレーション領域を越えてどの程度一般化できるか?

主な発見

  • PI²に基づく局所的ポリシー最適化は、ドア開閉およびピックアンドプレースタスクの両方で、従来のLQRベース手法を顕著に上回り、不連続なダイナミクスを有する環境でも成功した学習を可能にした。
  • オンポリシー採択の導入により、イテレーションごとの訓練インスタンスの多様性が向上し、ピックアンドプレースタスクの成功確率が46.7%向上(初期段階の40%から全訓練終了後の86.7%に)した。
  • 最終的なポリシーは初期デモンストレーション領域を越えて効果的に一般化し、30のランダムな初期姿勢からボトルを目的位置に配置するタスクで86.7%の成功確率を達成した。
  • ポリシーはグリッパーの柔軟性を活用し、デモンストレーションと比較して、把持時の姿勢のばらつきを低減し、より慎重な配置動作を実現した。
  • ドアの姿勢にばらつきがある状況下でもドア開閉タスクで高い性能を発揮し、接触の不連続性に対してロバストであることを示した。
  • 特に訓練領域が拡大する後期の訓練段階において、以前に学習したインスタンスの忘却を防ぐために、グローバルポリシーの採択段階でSGDの学習率を10⁻⁴に低下させる必要があった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。