Skip to main content
QUICK REVIEW

[論文レビュー] On-Policy Robot Imitation Learning from a Converging Supervisor

Ashwin Balakrishna, Brijen Thananjeyan|arXiv (Cornell University)|Jul 8, 2019
Reinforcement Learning in Robotics参考文献 33被引用数 12
ひとこと要約

本稿は、時間とともに進化・収束するスーパvisor(例えば人間や改善するアルゴリズム制御器)から効率的なポリシー学習を可能にする、新しいオンポリシーの模倣学習フレームワークを提案する。収束するスーパvisorにおけるレギュレーションバウンドを形式化し、デュアルポリシー反復(DPI)と関連付けることで、データ効率を維持しながら、最先端のモデルベース強化学習に比べてポリシー評価を最大80倍高速化することに成功した。この有効性は、模擬的および物理的ロボットシステム(da Vinci外科手術ロボットを含む)で検証された。

ABSTRACT

Existing on-policy imitation learning algorithms, such as DAgger, assume access to a fixed supervisor. However, there are many settings where the supervisor may evolve during policy learning, such as a human performing a novel task or an improving algorithmic controller. We formalize imitation learning from a "converging supervisor" and provide sublinear static and dynamic regret guarantees against the best policy in hindsight with labels from the converged supervisor, even when labels during learning are only from intermediate supervisors. We then show that this framework is closely connected to a class of reinforcement learning (RL) algorithms known as dual policy iteration (DPI), which alternate between training a reactive learner with imitation learning and a model-based supervisor with data from the learner. Experiments suggest that when this framework is applied with the state-of-the-art deep model-based RL algorithm PETS as an improving supervisor, it outperforms deep RL baselines on continuous control tasks and provides up to an 80-fold speedup in policy evaluation.

研究の動機と目的

  • 既存のオンポリシー模倣学習手法が固定されたスーパvisorを仮定しているという制限に対処する。これは、現実世界ではスーパvisor(例えば人間や改善するアルゴリズム)が時間とともに進化するという状況を反映していない。
  • 収束するスーパvisorを対象としたオンポリシー模倣学習の理論的枠組みを形式化し、後悔の下界をサブラインアーに保証する。
  • 収束するスーパvisorの設定が、既存のデュアルポリシー反復(DPI)手法における構造的制約を一般化・緩和できることを示し、模倣学習とDPIのギャップを埋める。
  • 深層モデルベース強化学習におけるポリシー評価を加速する。具体的には、PETSのような遅いが改善するスーパvisorを、データ効率を損なわずに高速で反応性の高いポリシーに蒸留することで実現する。
  • 本手法をシミュレーションおよび物理的da Vinci外科手術ロボット上で実証的に検証し、クエリ時間および評価時間において顕著な高速化を示す。

提案手法

  • 収束するスーパvisorの文脈において、静的・動的後悔の新概念を導入する。学習中に中間のスーパvisorがラベルを提供するが、最終的な性能は収束したスーパvisorに対して評価される。
  • 収束するスーパvisor設定における後悔解析を、標準的な固定スーパvisor設定に還元することで、弱い仮定のもとでサブラインアーな後悔保証を可能にする。
  • デュアルポリシー反復(DPI)に類似したループを採用する:オンポリシー模倣学習により反応型ポリシーを訓練し、現在のポリシーからのデータを用いてモデルベーススーパvisorを改善するのを交互に繰り返す。
  • スーパvisorは、PETSのような深層モデルベースRL手法を含め、学習者の分布上で良いポリシーに収束する任意のアルゴリズムとして許容され、構造的制約は不要である。
  • 反応型ポリシーは、時間とともに進化する現在のスーパvisorからのラベルを用いてオンポリシー模倣学習(例:DAggerスタイル)で訓練される。
  • 本フレームワークは、PETSのようなスーパvisorのサンプル効率を維持しつつ、高速で反応性の高いポリシーへの蒸留によってオンライン推論コストを著しく削減することで、データ効率を保つ。

実験結果

リサーチクエスチョン

  • RQ1スーパvisorが固定ではなく時間とともに収束する場合に、オンポリシー模倣学習に対して理論的後悔保証を提供することは可能か?
  • RQ2訓練中にラベルが中間スーパvisorから提供される場合でも、最終的な収束スーパvisorに対して良好な性能を達成することは可能か?
  • RQ3本フレームワークは、既存のデュアルポリシー反復(DPI)アルゴリズムとどのように関係しているか?また、それらの構造的仮定を緩和できるか?
  • RQ4深層モデルベース強化学習におけるポリシー評価を、データ効率を損なわず加速できるか?
  • RQ5PETSのような最先端のスーパvisorを用いた場合、実際のロボットシステムに適用した際の推論速度および学習効率における実用的利点は何か?

主な発見

  • 標準的な仮定のもとで、中間スーパvisorからのラベルしか得られない状況下でも、最良のポリシーを後悔の観点からサブラインアーに達成する。
  • PETSを改善するスーパvisorとして用いた場合、本フレームワークはPETSのデータ効率を維持しながら、シミュレーション環境で最大80倍のポリシークエリ時間の短縮を達成した。
  • 物理的da Vinci外科手術ロボットでは、PETSに比べてポリシークエリ時間を最大20倍短縮し、ポリシー評価時間も53%短縮した。ただし、ハードウェア制限により最大制御周波数が制限されていた。
  • 物理的ロボット上でのシングルアームおよびダブルアームリーチャータスクにおいて、CSF学習者はPETSスーパvisorを効果的に追跡し、優れた一般化性能と制御精度を示した。
  • 本手法は、高品質で改善するスーパvisorの蒸留により、連続制御タスクにおいて深層強化学習ベースラインを著しく上回り、収束が早く、サンプル効率に優れた性能を示した。
  • 本フレームワークにより、オンライン推論コストを著しく削減しながら性能を維持することで、リアルタイムのロボットシステムへのモデルベース強化学習ポリシーの実用的導入が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。