Skip to main content
QUICK REVIEW

[論文レビュー] Synthesized Policies for Transfer and Adaptation across Tasks and Environments

Hexiang Hu, Liyu Chen|arXiv (Cornell University)|Apr 5, 2019
Reinforcement Learning in Robotics参考文献 21被引用数 11
ひとこと要約

本論文では、メタルールを用いて環境とタスクの分離された埋め込みを学習し、転移可能なポリシーを合成する手法であるSynthesized Policies (SynPo) を提案する。40%の(環境, タスク)ペアでの学習のみで、グリッドワールドでは未学習の組み合わせで平均96.16%の成功率を達成し、thorでは未学習ペアで35.4%を達成し、汎化性と適応性においてベースラインを上回った。

ABSTRACT

The ability to transfer in reinforcement learning is key towards building an agent of general artificial intelligence. In this paper, we consider the problem of learning to simultaneously transfer across both environments (ENV) and tasks (TASK), probably more importantly, by learning from only sparse (ENV, TASK) pairs out of all the possible combinations. We propose a novel compositional neural network architecture which depicts a meta rule for composing policies from the environment and task embeddings. Notably, one of the main challenges is to learn the embeddings jointly with the meta rule. We further propose new training methods to disentangle the embeddings, making them both distinctive signatures of the environments and tasks and effective building blocks for composing the policies. Experiments on GridWorld and Thor, of which the agent takes as input an egocentric view, show that our approach gives rise to high success rates on all the (ENV, TASK) pairs after learning from only 40% of them.

研究の動機と目的

  • 未学習の環境とタスクにわたる強化学習における効率的な転移と適応を可能にすること。
  • 疎な(環境, タスク)ペアデータから効果的なポリシーを学ぶという課題に対処すること。
  • ポリシー合成の有効な構成要素として機能する、環境とタスクの分離された埋め込みを同時に学習すること。
  • タスクと環境の表現を分離することで、転移学習における汎化性の向上と過学習の低減を図ること。
  • ポリシーの基本を固定したまま、新しい埋め込みのみを学習することで、新しい環境やタスクにおける少データ適応を可能にすること。

提案手法

  • 環境とタスクの埋め込みに基づき、学習済みのポリシー基本関数の線形結合を用いてポリシーを合成する構成的ニューラルネットワークアーキテクチャを提案する。
  • 環境とタスクの埋め込みが明確で、ポリシー合成に有効であることを保証するため、分離目的関数を用いてポリシー基本関数と埋め込みを共同で学習する。
  • 疎な(環境, タスク)ペアから学習し、未学習の組み合わせでの推論時にポリシー基本関数を固定する。
  • メタルールが環境とタスクの埋め込み関数を関数として組み合わせることで、新しい組み合わせへのゼロショット転移を可能にする。
  • 最小限のデータで新しい環境やタスクに対してPPOを用いて微調整し、固定されたポリシー基本関数と新たに推論された埋め込みを活用する。
  • 環境とタスクのための明確で低次元な表現を促進する、新しい目的関数を用いて分離を強制する。

実験結果

リサーチクエスチョン

  • RQ1疎な(環境, タスク)ペアデータのみを用いて、1つのポリシー合成メカニズムが未学習の環境とタスクに一般化可能か?
  • RQ2分離された表現学習は、強化学習におけるポリシー転移と適応性を向上させるのにどの程度有効か?
  • RQ3固定されたポリシー基本関数と学習済みの埋め込みを組み合わせることで、最小限の微調整データで未学習の(環境, タスク)ペアに対して高い性能を達成できるか?
  • RQ4複雑な環境において、提案手法は既存のマルチタスクおよび転移学習ベースラインと比較してどの程度優れているか?
  • RQ5タスクのみまたは環境のみの埋め込みを段階的に学習するインクリメンタル学習が、両方を同時に学習する場合に比べ、未学習の転移シナリオで優れているか?

主な発見

  • SynPoは、グリッドワールドで40%の組み合わせでの学習のみで、未学習の(環境, タスク)ペアで平均96.16%の成功率を達成し、MLP、MTL、ModuleNetを著しく上回った。
  • フォトリアリスティックなthorシミュレータでは、SynPoは未学習ペアで35.4%の成功率を達成し、すべてのベースラインを上回った。特にModuleNet(14.4%)、MLP(25.8%)、MTL(33.3%)を上回った。
  • アブレーションスタディにより、環境とタスクの埋め込みの分離が、効果的なポリシー合成と一般化に不可欠であることが確認された。
  • タスクまたは環境のいずれかの埋め込みを段階的に学習する「転送設定2」は、両方を同時に学習する「設定3」を上回り、逐次的適応がより効果的であることが示された。
  • PPOを用いた微調整はすべての手法で転送性能を向上させたが、SynPoは最も高い性能向上を示し、頑健性とスケーラビリティを示した。
  • タスクと環境におけるポリシー性能の可視化から、タスク間転送は環境間転送よりも容易であることがわかった。これは人間の学習様式と整合的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。