Skip to main content
QUICK REVIEW

[論文レビュー] Supervised Policy Update.

Quan Vuong, Yiming Zhang|arXiv (Cornell University)|May 29, 2018
Reinforcement Learning in Robotics参考文献 12被引用数 3
ひとこと要約

本論文は、最初に近接空間内で非パrameterizedポリシーを最適化し、その後で教師付き回帰を用いてそれをパラメータ化されたポリシーに蒸留することで、サンプル効率の高い深層強化学習手法であるSupervised Policy Update (SPU)を提案する。SPUは、TRPOとPPOを統一する1つの最適化フレームワークの下で統合することで、ロボット歩行タスクにおいてPPOよりも優れたサンプル効率を達成する。

ABSTRACT

We propose a new sample-efficient methodology, called Supervised Policy Update (SPU), for deep reinforcement learning. Starting with data generated by the current policy, SPU optimizes over the proximal policy space to find a non-parameterized policy. It then solves a supervised regression problem to convert the non-parameterized policy to a parameterized policy, from which it draws new samples. There is significant flexibility in setting the labels in the supervised regression problem, with different settings corresponding to different underlying optimization problems. We develop a methodology for finding an optimal policy in the non-parameterized policy space, and show how Trust Region Policy Optimization (TRPO) and Proximal Policy Optimization (PPO) can be addressed by this methodology. In terms of sample efficiency, our experiments show SPU can outperform PPO for simulated robotic locomotion tasks.

研究の動機と目的

  • 高次元連続制御タスクにおける深層強化学習のサンプル非効率性の課題に対処すること。
  • TRPO や PPO などの既存の近接ポリシー最適化手法を、1つの柔軟なフレームワークに統一・一般化すること。
  • 教師付き回帰ステップを介して、パラメータ化と最適化を分離することで、ポリシー学習の効率を向上させること。
  • デプロイメントのためのパラメータ化されたポリシーへの蒸留の前に、安定した最適化が可能な非パラメータ化されたポリシーの使用を可能にすること。

提案手法

  • SPUは、現在のポリシーを用いてオフポリシーのロールアウトを生成し、状態-行動ペアのデータセットを構築する。
  • 安定性と改善を保証するために、現在のポリシーの近接領域内で非パラメータ化されたポリシーを最適化する。
  • ラベルが最適化された非パラメータ化されたポリシーから導出されるように、状態から行動へのマッピングを教師付き回帰問題として定式化する。
  • 回帰モデルを訓練して、非パラメータ化されたポリシーの行動を模倣するパラメータ化されたポリシーを生成する。
  • 柔軟なラベル設計を可能にし、TRPO や PPO を特別なケースとして回復または一般化できる。
  • 更新されたパラメータ化されたポリシーから新たなロールアウトを収集し、反復的改善のループを閉じる。

実験結果

リサーチクエスチョン

  • RQ1非パラメータ化されたポリシー最適化と教師付き蒸留を組み合わせた二段階的手法が、深層強化学習におけるサンプル効率を向上させることができるか?
  • RQ2近接ポリシー更新と教師付き回帰を用いて、TRPO と PPO を1つの最適化フレームワークに統一できるか?
  • RQ3教師付き回帰ステップにおけるどのラベル設定が最良のポリシー性能と安定性をもたらすか?
  • RQ4提案手法は、連続制御ベンチマークにおいて標準的なPPOよりもサンプル効率が優れているか?

主な発見

  • SPUは、シミュレーテッドロボット走行タスクにおいてPPOよりも優れたサンプル効率を達成し、環境との相互作用回数を減らしても速く学習を進める。
  • 教師付き回帰ステップにおけるラベル設計の調整により、TRPO や PPO の両方を効果的に一般化できる。
  • 非パラメータ化されたポリシー空間上で最適化することで、最適化中にニューラルネットワークのパラメータ化に依存せずに、安定的かつ効果的なポリシー更新が可能になる。
  • 非パラメータ化されたポリシーからパラメータ化されたポリシーへの蒸留ステップは、性能を維持しながら、学習のための効率的なロールアウトを可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。