Skip to main content
QUICK REVIEW

[論文レビュー] Composing Entropic Policies using Divergence Correction

Jonathan J. Hunt, André Barreto|arXiv (Cornell University)|Dec 5, 2018
Reinforcement Learning in Robotics被引用数 13
ひとこと要約

本論文は、転移学習におけるポリシー不適合性を是正するため、基本ポリシー間のRényiダイバージェンスを明示的に学習することで、最大エントロピー方策の合成を行うためのDivergence Correction (DC)を提案する。DCは、特に基本ポリシーが衝突する状況下でも、Generalized Policy Improvement (GPI) や Compositional Optimism (CO) より優れた性能を示し、適応的インポートランスサンプリングを用いることで、連続的制御環境においてほぼ最適な性能を回復する。

ABSTRACT

Composing previously mastered skills to solve novel tasks promises dramatic improvements in the data efficiency of reinforcement learning. Here, we analyze two recent works composing behaviors represented in the form of action-value functions and show that they perform poorly in some situations. As part of this analysis, we extend an important generalization of policy improvement to the maximum entropy framework and introduce an algorithm for the practical implementation of successor features in continuous action spaces. Then we propose a novel approach which addresses the failure cases of prior work and, in principle, recovers the optimal policy during transfer. This method works by explicitly learning the (discounted, future) divergence between base policies. We study this approach in the tabular case and on non-trivial continuous control problems with compositional structure and show that it outperforms or matches existing methods across all tasks considered.

研究の動機と目的

  • 既存のポリシー合成手法が、基本ポリシーが不適合な場合に転移学習で失敗する問題に対処すること。
  • 後続特徴量とポリシー改善を最大エントロピー枠組みへ拡張すること。
  • ダイバージェンス補正を用いた、連続的行動空間におけるゼロショット転移のための実用的アルゴリズムの開発。
  • DCが多様な転移タスクにおいて一貫して最適またはほぼ最適なポリシーを回復できることを示すこと。
  • 複雑で非自明な制御環境における、CondQ や Compositional Optimism と同様の既存手法との比較。

提案手法

  • 転移中に行動価値関数を補正するための、基本ポリシー間のRényiダイバージェンスに基づく新規補正項を提案する。
  • 最大エントロピー目的に拡張されたmax-ent GPI を導入し、ポリシー改善の保証を確保する。
  • 連続的行動空間におけるDCおよびmax-ent GPIモデルの学習に適した、適応的インポートランスサンプリングを用いた実用的アルゴリズムAISBPを構築する。
  • 報酬関数の凸結合を用いて新しい転移タスクを定義し、基本タスクと転移タスク間で遷移ダイナミクスが共有されていると仮定する。
  • 最大エントロピー枠組み内での後続特徴量を用い、ポリシー下での将来の状態訪問の期待値をモデル化する。
  • 完全なダイバージェンス推定が高コストな場合の効率的近似のためのヒューリスティックな変種、DC-Cheapを実装する。

実験結果

リサーチクエスチョン

  • RQ1GPI や CO のような既存のポリシー合成手法が、転移学習で何らかの条件下で失敗する条件は何か?
  • RQ2ダイバージェンスに基づく補正項は、基本ポリシーが衝突する転移タスクにおいて最適ポリシーを回復できるか?
  • RQ3構成的構造を持つ連続的制御タスクにおいて、DCの性能はCondQ や CO よりも優れているか?
  • RQ4適応的インポートランスサンプリングは、高次元の行動空間におけるDCの有効な学習をどの程度可能にするか?
  • RQ5DCは、適合性がある場合とない場合の両方で強固な性能を維持できるか?

主な発見

  • DCは、特に8自由度アントや5自由度マニピュレータなどの連続的制御環境で、基本ポリシーが衝突する「難しい」転移タスクにおいて、GPI や CO より一貫して優れた性能を示す。
  • ポイントマス「難しい」タスクでは、DCはGPI や CO よりも質的に優れた転移ポリシーを回復し、軌道が最適な青い正方形に収束する。
  • ヒューリスティック近似であるDC-Cheapは、ほとんどのタスクで完全なDCとほぼ同等の性能を示し、計算コストを低減した実用的利点を示す。
  • GPIに制限された場合、DC-Cheap+GPIはポイントマスタスクでさえも強力な性能を示し、近似誤差に対してロバストであることが示された。
  • 実験的結果から、CondQはDCよりも学習が難しく、訓練中に報酬埋め込みϕの追加観測が必要であることが分かった。
  • 不適合な基本ポリシーを有するタスクの場合(補足図9)、DCはGPIと同等の性能を示し、COよりも顕著に優れている。これは、最適ポリシーの一貫した回復を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。