Skip to main content
QUICK REVIEW

[論文レビュー] A New Representation of Successor Features for Transfer across Dissimilar Environments

Majid Abdolshah, Hung Lê|arXiv (Cornell University)|Jul 18, 2021
Gaussian Processes and Bayesian Inference被引用数 4
ひとこと要約

本稿では、動的および報酬関数が異なる環境間で強化学習における効率的な転移学習を可能にするガウス過程ベースの後続特徴表現を提案する。源となる後続特徴をターゲット特徴のノイズあり観測としてモデル化することで、ベンチマークタスクにおいてベースラインを上回る高速な収束と優れた性能を達成し、方策誤差および収束に関する理論的境界を提示する。

ABSTRACT

Transfer in reinforcement learning is usually achieved through generalisation across tasks. Whilst many studies have investigated transferring knowledge when the reward function changes, they have assumed that the dynamics of the environments remain consistent. Many real-world RL problems require transfer among environments with different dynamics. To address this problem, we propose an approach based on successor features in which we model successor feature functions with Gaussian Processes permitting the source successor features to be treated as noisy measurements of the target successor feature function. Our theoretical analysis proves the convergence of this approach as well as the bounded error on modelling successor feature functions with Gaussian Processes in environments with both different dynamics and rewards. We demonstrate our method on benchmark datasets and show that it outperforms current baselines.

研究の動機と目的

  • 源タスクとターゲットタスクの両方で環境の動的特性と報酬関数が異なる状況における強化学習における転移学習の課題に対処すること。
  • 異なる環境間で一貫した動的特性を仮定する従来の後続特徴手法の制限を克服すること。
  • 源タスクからの事前知識を活用して、動的特性が異なる新しい環境での学習を加速できる汎用的なフレームワークを構築すること。
  • 動的変化が生じるターゲット環境において、方策推定の収束性と誤差境界に関する理論的保証を提供すること。
  • 動的および報酬の両方の変化を伴う多様な強化学習ベンチマークにおいて、提案手法が従来のベースラインを実証的に上回ることを示すこと。

提案手法

  • ガウス過程(GPs)を用いて後続特徴関数をモデル化し、源の後続特徴をターゲット関数のノイズあり測定として扱う。
  • 源の後続特徴の分布を、ターゲット後続特徴関数の学習における事前分布として活用する。
  • ターゲット後続特徴関数を源からのノイズあり実現とみなすことにより、動的変化に伴う不確実性を考慮した適応を可能にする。
  • 一般化方策改善(GPI)を適用し、学習済みの後続特徴を用いてターゲット環境における行動価値関数を推定する。
  • 各ステップで源およびターゲットの経験データをGPモデルに統合し、段階的学習と適応を可能にする。
  • GPの予測分散を活用して、ターゲット環境における適応段階での探索を誘導し、サンプル効率を向上させる。

実験結果

リサーチクエスチョン

  • RQ1動的特性が著しく異なる環境間で、後続特徴を効果的に転送できるか?
  • RQ2源とは異なる動的特性を示すターゲット環境において、後続特徴の不確実性をどのようにモデル化できるか?
  • RQ3動的特性が異なる源からターゲット環境に方策を転送する際、最適方策の誤差にどのような理論的境界を設定できるか?
  • RQ4後続特徴にGPベースの事前分布を適用することで、新しい環境における収束速度とサンプル効率が向上するか?
  • RQ5動的および報酬の両方の変化を伴う環境において、提案手法が従来の後続特徴転送手法と比較してどのように性能を発揮するか?

主な発見

  • 10個のオブジェクトを有するグリッドワールド環境において、本手法はFSFおよびLPSFベースラインを上回り、収束が速く、平均累積報酬も高いことを示した。
  • ポール長さを0.5mから3.0mに変更したCartPole-v0環境において、本手法はLPSFおよびFSFを上回る性能を発揮し、動的変化に対して高いロバストネスを示した。
  • 5%の遷移ノイズとランダムな終端状態を有するFSFベンチマーク環境において、本手法はLPSFを上回り、初期学習段階でFSFよりも優れた適応性を示した。
  • GPベースのモデルにより、動的特性が著しく異なる状況でも効果的な転送が可能であることが実証され、全環境において収束が速く、最終的な報酬値も高いことが確認された。
  • 理論的分析により、本手法の収束性が保証され、ターゲット後続特徴から導かれる方策の誤差に対して上界が得られた。
  • 源タスクの後続特徴を事前分布として活用することで、ターゲット環境における相互作用回数を削減し、より高いサンプル効率を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。