Skip to main content
QUICK REVIEW

[論文レビュー] Grounding Language for Transfer in Deep Reinforcement Learning

Karthik Narasimhan, Regina Barzilay|arXiv (Cornell University)|Aug 1, 2017
Reinforcement Learning in Robotics参考文献 56被引用数 5
ひとこと要約

本論文は、環境の自然言語記述を用いて、ドメイン間で効果的なポリシー転送を可能にするモデルベース強化学習フレームワークを提案する。差分可能価値反復ネットワークを用いて、遷移や報酬といった環境ダイナミクスにテキスト記述を埋め込むことで、転移学習およびマルチタスク学習の状況において、先行手法に比べて平均報酬が最大14%高く、初期報酬が11.5%高い結果を達成した。

ABSTRACT

In this paper, we explore the utilization of natural language to drive transfer for reinforcement learning (RL). Despite the wide-spread application of deep RL techniques, learning generalized policy representations that work across domains remains a challenging problem. We demonstrate that textual descriptions of environments provide a compact intermediate channel to facilitate effective policy transfer. Specifically, by learning to ground the meaning of text to the dynamics of the environment such as transitions and rewards, an autonomous agent can effectively bootstrap policy learning on a new domain given its description. We employ a model-based RL approach consisting of a differentiable planning module, a model-free component and a factorized state representation to effectively use entity descriptions. Our model outperforms prior work on both transfer and multi-task scenarios in a variety of different environments. For instance, we achieve up to 14% and 11.5% absolute improvement over previously existing models in terms of average and initial rewards, respectively.

研究の動機と目的

  • 異なる強化学習環境間でのポリシー転送を効率的に行う課題に対処すること。
  • 環境要因の自然言語記述が、ドメイン間ポリシー転送のためのコン pact な中間チャネルとして機能するかどうかを検討すること。
  • 未観測環境での学習をブートストラップするために、テキスト知識を活用することで、学習のサンプル効率を向上させること。
  • モデルフリー強化学習と差分可能計画モジュール、およびテキストを組み合わせた因子化状態表現を統合する一貫したモデルを開発すること。
  • 多様なゲーム環境において、転移学習およびマルチタスク学習の両設定で、この手法を評価すること。

提案手法

  • モデルは、生の観測とエンティティの自然言語記述を組み合わせた二段階の状態表現を用い、ドメインに依存しないポリシー学習を可能にする。
  • 差分可能価値反復ネットワーク(VIN)を用いて、差分可能に価値関数を繰り返し更新することで計画を実行する。
  • テキスト記述が埋め込みられ、価値関数空間に投影され、環境との相互作用が全くない段階でも、エンティティの種別(例:味方または敵)に基づいて価値マップを予測できる。
  • VINモジュールが記述されたエンティティから周囲の状態へ価値情報を伝搬するように学習するため、全システムは環境報酬を用いてエンドツーエンドで訓練される。
  • ドメイン固有の観測と言語ベースの知識の両方を考慮することで、不完全またはノイズの多い記述に対しても頑健である。
  • 本手法は、Boulderchase や Bomberman を含むゲームを用いた GVGAI フレームワーク上で評価され、転移学習およびマルチタスク学習プロトコルが適用された。

実験結果

リサーチクエスチョン

  • RQ1環境要因のテキスト記述は、深層強化学習におけるポリシー転送性能を向上させることができるか?
  • RQ2モデルは、環境との相互作用が全くない状態で、言語を用いて未確認の環境での学習をどの程度効果的にブートストラップできるか?
  • RQ3環境ダイナミクス(遷移と報酬)に言語を埋め込むことで、ドメイン間での収束速度の向上と一般化性能の向上が達成されるか?
  • RQ4差分可能計画モジュールと言語を統合したアプローチは、純粋なモデルフリーまたはビジョンオンリーのアプローチと比較して、転移設定でどのように優れているか?
  • RQ5事前に経験のない未確認のエンティティに対して、テキスト記述のみでどの程度一般化できるか?

主な発見

  • 本モデルは、転移学習の状況において、先行手法に比べて最大14%の絶対的な平均報酬の向上を達成した。
  • 初期報酬が最大11.5%高いことから、言語に基づくブートストラップにより、新しい環境での学習開始が著しく速くなったことが示された。
  • VINモジュールが生成する価値マップは、記述の意味的コンテンツを反映している:『味方』と記述されたエンティティの周囲に高い値が割り当てられ、『敵』エンティティには低い値が割り当てられる。これは、環境との相互作用が全くない段階でも成立する。
  • 本モデルは、事前に経験のないエンティティに対しても、テキスト記述のみで効果的に一般化でき、言語がゼロショット転移設定でのポリシー学習をガイドできることを示した。
  • 転移およびマルチタスク学習の両設定において、複数の評価指標で、標準的な深層強化学習ベースラインおよび Actor Mimic 転移手法を上回った。
  • 定性的な分析から、モデルが新しいドメインでテキストを活用して情報に基づいた価値推定を生成し、広範な環境相互作用への依存を低減していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。