Skip to main content
QUICK REVIEW

[論文レビュー] Meta Reinforcement Learning with Task Embedding and Shared Policy

Lin Lan, Zhenguo Li|arXiv (Cornell University)|May 16, 2019
Reinforcement Learning in Robotics参考文献 29被引用数 9
ひとこと要約

本稿では、メタ学習されたタスクエンコーダーと共有ポリシーを用いて、タスクの個別性と共通性を明示的にモデル化するメタ強化学習手法TESPを提案する。タスクエンコーダーを学習可能なSGD最適化手法で適応させ、1つのポリシーをタスク埋め込みに条件づけて使用することで、訓練済みタスクおよび分布外の新規タスクの両方で、ベースラインと比較して最大3–4倍の報酬を達成し、優れたデータ効率性と一般化性能を示した。

ABSTRACT

Despite significant progress, deep reinforcement learning (RL) suffers from data-inefficiency and limited generalization. Recent efforts apply meta-learning to learn a meta-learner from a set of RL tasks such that a novel but related task could be solved quickly. Though specific in some ways, different tasks in meta-RL are generally similar at a high level. However, most meta-RL methods do not explicitly and adequately model the specific and shared information among different tasks, which limits their ability to learn training tasks and to generalize to novel tasks. In this paper, we propose to capture the shared information on the one hand and meta-learn how to quickly abstract the specific information about a task on the other hand. Methodologically, we train an SGD meta-learner to quickly optimize a task encoder for each task, which generates a task embedding based on past experience. Meanwhile, we learn a policy which is shared across all tasks and conditioned on task embeddings. Empirical results on four simulated tasks demonstrate that our method has better learning capacity on both training and novel tasks and attains up to 3 to 4 times higher returns compared to baselines.

研究の動機と目的

  • 既存のメタ強化学習手法がタスクの個別性(特異性)と共通性(共有構造)を明示的にモデル化する点での限界を解決すること。
  • タスク固有の適応と共有ポリシー学習を分離することで、メタ強化学習のデータ効率性と一般化性能を向上させること。
  • 過去の経験から得られるタスクエンコーディングを学習することで、新規タスクへの高速適応を可能にすること。
  • 共有パラメータを用いて多様なタスク分布に一般化するポリシーを訓練することで、分布シフトに対するロバスト性を高めること。

提案手法

  • エピソードバッファに保存された過去の経験から、潜在的なタスク埋め込みを生成するタスクエンコーダーネットワークを導入する。
  • 各タスクの経験に基づいて、タスクエンコーダーを迅速に適応させるために、学習可能なSGD最適化手法としてのメタラーナーを訓練する。
  • すべてのタスクに共通する1つの共有ポリシーを用い、観測値とタスク埋め込みの両方に条件づけて行動を出力する。
  • タスクエンコーダーの迅速な適応と高い累積報酬を促進する損失関数を用いて、メタラーナーをメタアップデートにより最適化する。
  • メタラーナーの最適化プロセスにおいて、各パラメータごとの適応的学習率を適用し、収束性と安定性を向上させる。
  • 過学習を防ぎ、一般化性能を向上させるために、タスクエンコーダーの適応プロセスにペナルティ項を正則化として導入する。

実験結果

リサーチクエスチョン

  • RQ1メタ学習されたタスクエンコーダーを用いてタスクの個別性を明示的にモデル化することで、訓練済みタスクおよび新規タスクにおけるメタ強化学習の性能が向上するか?
  • RQ2タスク固有の適応(タスクエンコーダーを介して)と共有ポリシー学習を分離することで、分布外タスクへの一般化性能にどのような影響を与えるか?
  • RQ3タスク埋め込みに条件づけられた共有ポリシーを用いることで、タスク固有のポリシーと比較して、データ効率性と迅速な適応性が向上するか?
  • RQ4全経験を用いるのではなく、上位M個のエピソードに限定した経験を使用することで、タスク埋め込みの質がどの程度向上するか?
  • RQ5メタ最適化プロセスにおける適応的学習率と正則化の導入が、性能と安定性に与える影響はどの程度か?

主な発見

  • TESPは、訓練済みタスクおよび新規タスクの両方で、ベースラインと比較して最大3–4倍の累積報酬を達成し、優れた学習能力を示した。
  • 分布外タスク(D'')においてもTESPは強く性能を維持するが、ベースラインは過学習を起こし著しく性能が低下するため、一般化性能が向上していることが示された。
  • TESPでは、訓練タスクと分布外タスクの間の性能差が、ベースラインと比較して小さいため、より高いロバスト性を示している。
  • アブレーションスタディの結果、共有ポリシーと正則化項が、特に未観測のタスク分布における一般化に不可欠であることが確認された。
  • 適応的学習率を備えたメタ学習されたSGD最適化手法を用いることで、より安定した収束と、ランダムシードによる分散の低減が達成された。
  • エピソードバッファを削除するか、全経験(上位Mエピソードではなく)を用いると性能が低下するため、タスク埋め込み学習における経験の選択的使用の重要性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。