Skip to main content
QUICK REVIEW

[論文レビュー] Optimistic Linear Support and Successor Features as a Basis for Optimal Policy Transfer

Lucas N. Alegre, Ana L. C. Bazzan|arXiv (Cornell University)|Jun 22, 2022
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本稿では、後続特徴(SFs)と楽観的線形サポート(OLS)を組み合わせた新規アルゴリズム、SFOLSを提案する。SFsを用いて構築された方策の集合が凸被覆集合(CCS)を形成することで、追加の環境インタラクションなしに一般化方策改善(GPI)を用いて任意の線形に表現されたタスクに対して最適な方策転送が可能になる。本手法は、後続特徴による転移学習と多目的強化学習の理論的同等性を活用することで、すべての線形報酬関数に対して最適な性能を保証する。

ABSTRACT

In many real-world applications, reinforcement learning (RL) agents might have to solve multiple tasks, each one typically modeled via a reward function. If reward functions are expressed linearly, and the agent has previously learned a set of policies for different tasks, successor features (SFs) can be exploited to combine such policies and identify reasonable solutions for new problems. However, the identified solutions are not guaranteed to be optimal. We introduce a novel algorithm that addresses this limitation. It allows RL agents to combine existing policies and directly identify optimal policies for arbitrary new problems, without requiring any further interactions with the environment. We first show (under mild assumptions) that the transfer learning problem tackled by SFs is equivalent to the problem of learning to optimize multiple objectives in RL. We then introduce an SF-based extension of the Optimistic Linear Support algorithm to learn a set of policies whose SFs form a convex coverage set. We prove that policies in this set can be combined via generalized policy improvement to construct optimal behaviors for any new linearly-expressible tasks, without requiring any additional training samples. We empirically show that our method outperforms state-of-the-art competing algorithms both in discrete and continuous domains under value function approximation.

研究の動機と目的

  • 既存の後続特徴(SF)ベースの手法には、方策転送は可能だが、新しいタスクに対して最適な方策を保証しないという限界があるため、これを解消すること。
  • 線形選好の下で、SFベースの転移学習と多目的強化学習(MORL)の理論的同等性を確立すること。
  • 最適な一般化を実現する、すべての線形に表現されたタスクに対して最適な性能を発揮する凸被覆集合(CCS)を構築する、OLSのSFベースの拡張を考案すること。
  • CCSから導出される方策を一般化方策改善(GPI)によって組み合わせることで、追加の環境インタラクションなしに任意の新しいタスクに対して最適な行動が得られることを証明すること。
  • 価値関数近似の下で、離散的および連続的領域において最先端の手法と比較して、SFOLSの実験的妥当性を検証すること。

提案手法

  • SFベースの転移学習問題を線形選好の下での多目的MDP(MOMDP)にマッピングし、両フレームワーク間の理論的同等性を確立する。
  • SFOLSを導入する。これはOLSのSFベースの拡張であり、結果として得られるSFが凸被覆集合(CCS)を形成するように、反復的にタスクを選択して解く。
  • アルゴリズムはCCSに属する方策をGPIによって組み合わせ、任意の新しい線形報酬関数に対して最適な行動を保証する。
  • 結果として得られる方策集合が、すべての線形に表現可能なタスクに対して最適であることを証明し、CCSが不完全な場合の性能ギャップの理論的バウンディングも提供する。
  • 本手法は後続特徴を用いて状態訪問パターンを表現し、再トレーニングなしに効率的な方策合成を可能にする。
  • 無教師スキル発見のオープン問題が、後続表現上にCCSを構築することで解決されることを示している。

実験結果

リサーチクエスチョン

  • RQ1後続特徴による最適な方策転送問題を、線形選好の下での多目的強化学習に正式にマッピングできるか?
  • RQ2CCSを構築し、任意の新しい線形報酬関数に対して最適性を保証する、OLSのSFベースの拡張を設計できるか?
  • RQ3このようなCCS上で一般化方策改善(GPI)を適用することで、追加の環境インタラクションなしに最適な方策が得られるか?
  • RQ4価値関数近似の下で、離散的および連続的制御領域においてSFOLSが最先端の手法を上回る性能を示せるか?
  • RQ5Eysenbachら(2022)が定義した無教師設定における最適スキル発見のオープン問題を、SFOLSは解消できるか?

主な発見

  • SFOLSは、後続特徴が凸被覆集合(CCS)を形成する方策の集合を構築し、これにより任意の新しい線形に表現可能なタスクが、追加の環境インタラクションなしにGPIによって最適に解けることを保証する。
  • 本手法は、やや弱い仮定の下で、すべての線形報酬関数に対して最適な方策が得られることを理論的に保証する。
  • 実験的結果から、価値関数近似の下で、離散的および連続的制御領域においてSFOLSが最先端のアルゴリズムを上回ることを示している。
  • CCSが不完全な場合のGPI解と最適方策との性能ギャップが、バウンデッドであることが示され、これにより耐障害性の指標が得られる。
  • SFOLSは、後続表現上にCCSを構築することで、無教師設定における最適スキル発見のオープン問題を解消することが示された。
  • 本手法は、SFとGPIを用いて、すべての線形に表現されたタスクに対して最適な方策転送を正式に保証する最初の手法である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。