Skip to main content
QUICK REVIEW

[論文レビュー] Towards Effective Context for Meta-Reinforcement Learning: an Approach based on Contrastive Learning

Haotian Fu, Hongyao Tang|arXiv (Cornell University)|Sep 29, 2020
Reinforcement Learning in Robotics参考文献 33被引用数 9
ひとこと要約

本稿では、文脈符号化における対照学習と情報利得に基づく探索戦略を用いることで文脈品質を向上させる、新しいメタ強化学習フレームワークCCMを提案する。タスク固有の軌道を区別するための対照的符号化器を訓練し、有益な遷移を収集するように探索を最適化することで、CCMは連続的制御ベンチマークで最先端の性能を達成し、一般化性能とサンプル効率に優れている。

ABSTRACT

Context, the embedding of previous collected trajectories, is a powerful construct for Meta-Reinforcement Learning (Meta-RL) algorithms. By conditioning on an effective context, Meta-RL policies can easily generalize to new tasks within a few adaptation steps. We argue that improving the quality of context involves answering two questions: 1. How to train a compact and sufficient encoder that can embed the task-specific information contained in prior trajectories? 2. How to collect informative trajectories of which the corresponding context reflects the specification of tasks? To this end, we propose a novel Meta-RL framework called CCM (Contrastive learning augmented Context-based Meta-RL). We first focus on the contrastive nature behind different tasks and leverage it to train a compact and sufficient context encoder. Further, we train a separate exploration policy and theoretically derive a new information-gain-based objective which aims to collect informative trajectories in a few steps. Empirically, we evaluate our approaches on common benchmarks as well as several complex sparse-reward environments. The experimental results show that CCM outperforms state-of-the-art algorithms by addressing previously mentioned problems respectively.

研究の動機と目的

  • ノイズの多い文脈符号化器と最適でない軌道収集という2つの主要な制限要因を解消することで、メタ強化学習における潜在的文脈の品質を向上させること。
  • 不要な依存関係をモデル化せずに、軌道内のタスク固有の情報を直接区別できる対照的学習に基づく手法を開発すること。
  • 最小限の相互作用で文脈の改善を最大化する情報理論的探索目的関数を設計すること。
  • 有益な軌道から高品質でタスクを識別可能な文脈を生成することで、効果的なオフポリシーmeta-RLを可能にすること。
  • 従来の手法がサンプル効率と一般化性能に課題を抱える複雑で報酬がスパarsityな環境において、フレームワークの有効性を検証すること。

提案手法

  • 同じタスクからの遷移をポジティブペア、異なるタスクからの遷移をネガティブペアとして扱うことで、文脈符号化器を訓練する対照的学習フレームワークを提案する。
  • InfoNCE対照損失を用いて、タスク固有の軌道とその埋め込み表現間の相互情報量を最大化し、コン pact かつタスク固有の文脈表現を保証する。
  • 対照フレームワークにおける情報利得の理論的下限に基づく内生的報酬を用いて、別個の探索方策を訓練する。
  • 探索目的関数は、各新しい遷移の後で文脈推論品質の向上を最大化するように設計されており、データ効率を促進する。
  • 学習済みの文脈に条件付けられた方策を用いることで、オフポリシーmeta-RLを実装し、少数の相互作用で新しいタスクに素早く適応可能にする。
  • 2段階パイプラインとして、まず対照損失による符号化器の事前学習を行い、次に内生的報酬を用いて探索エージェントを訓練することで、符号化器と探索方策を共同で学習する。

実験結果

リサーチクエスチョン

  • RQ1潜在的文脈の品質を向上させることで、タスク固有の情報のみを捉え、関係のない依存関係を排除するにはどうすればよいか?
  • RQ2対照的学習を軌道レベルの表現に効果的に適用し、自己教師ありの方法で異なるタスクを区別できるか?
  • RQ3文脈推論に最も有益な軌道を収集する探索戦略をどのように設計できるか、特に報酬がスパarsityな環境において?
  • RQ4情報利得に基づく内生的報酬は、従来の探索手法と比較して、文脈品質の向上とより速い適応をもたらすか?
  • RQ5対照的学習を補完する文脈符号化器と情報理論的探索方策を組み合わせたフレームワークは、既存のSOTAメタ強化学習アルゴリズムを上回るか?

主な発見

  • CCMは、報酬がスパarsityな環境を含む標準的な連続的制御ベンチマークで最先端の性能を達成し、サンプル効率と最終的な性能の両面で従来手法を上回っている。
  • 対照的文脈符号化器は、タスクを識別可能な特徴にのみ注目することで、潜在表現のノイズを顕著に低減しており、ゼロショット一般化性能の向上によって裏付けられている。
  • 情報利得に基づく探索戦略は、文脈推論に有効な軌道を収集し、メタテスト中の迅速かつ安定した適応を実現している。
  • 実験的結果から、CCMは特に従来手法が性能を発揮できない複雑で報酬がスパarsityな環境において、効果的な適応に必要な相互作用回数を削減していることが示された。
  • アブレーションスタディの結果、文脈符号化器の対照的学習と情報利得探索目的関数の両方が、性能向上に顕著な貢献をしていることが確認された。
  • CCMは、ゴールの変化のみを含む多様なタスク分布に対しても頑健であることが示され、標準的な探索手法が区別可能な遷移を収集できない場合でも効果を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。