Skip to main content
QUICK REVIEW

[論文レビュー] RTFM: Generalising to Novel Environment Dynamics via Reading

Victor W. Zhong, Tim Rocktäschel|arXiv (Cornell University)|Oct 18, 2019
Topic Modeling参考文献 27被引用数 15
ひとこと要約

本論文は、エージェントが環境ダイナミクスの自然言語記述を読み込み、それらを推論することで未学習のシナリオに一般化できる強化学習環境RTFMを紹介する。提案されたtxt 2 πモデルは、目的、文書、観測の間の共同相互作用を捉え、FiLM や言語条件付きCNNと比較して優れた一般化性能と性能を達成しており、特に複雑でマルチホップな推論タスクにおけるカリキュラム学習を通じて顕著である。

ABSTRACT

Obtaining policies that can generalise to new environments in reinforcement learning is challenging. In this work, we demonstrate that language understanding via a reading policy learner is a promising vehicle for generalisation to new environments. We propose a grounded policy learning problem, Read to Fight Monsters (RTFM), in which the agent must jointly reason over a language goal, relevant dynamics described in a document, and environment observations. We procedurally generate environment dynamics and corresponding language descriptions of the dynamics, such that agents must read to understand new environment dynamics instead of memorising any particular information. In addition, we propose txt2$π$, a model that captures three-way interactions between the goal, document, and observations. On RTFM, txt2$π$ generalises to new environments with dynamics not seen during training via reading. Furthermore, our model outperforms baselines such as FiLM and language-conditioned CNNs on RTFM. Through curriculum learning, txt2$π$ produces policies that excel on complex RTFM tasks requiring several reasoning and coreference steps.

研究の動機と目的

  • 訓練中に観測されていない新しい環境ダイナミクスへの強化学習方策の一般化を解決すること。
  • エージェントが目的を達成するために、ダイナミクスの自然言語記述を読み込み推論する、根拠に基づいた方策学習フレームワークを構築すること。
  • 読解を通じて、新しい目的だけでなく、新規の環境ダイナミクスに対しても一般化を可能にすること。
  • 記憶を防ぐために生成されたプロシージャルな環境を設計し、読解に基づく推論を強制すること。
  • カリキュラム学習を用いて、目的、文書、観測の間の共同推論の有効性を評価すること。

提案手法

  • 記憶を防ぐために、環境ダイナミクスと自然言語記述の組み合わせが組み合わせ的に巨大なRTFMと呼ばれるプロシージャル環境を提案する。
  • 目的、ダイナミクスを記述する文書、環境の観測を共同で符号化する三重相互作用モデルであるtxt 2 πを設計する。
  • FiLM風の適応層を用いて、目的・文書・観測の共同表現に基づいて方策ネットワークを条件づける。
  • シンプルな世界から始まり、移動するモンスターと自然言語記述を伴う10×10の世界へと複雑性を段階的に上げるRTFMの変種を用いて、カリキュラム学習を実装する。
  • txt 2 πにおけるアテンション機構を用いて、目的と観測に基づき、文書内の関連する節を特定し、選択的読解を可能にする。
  • スパarsityの高い密集報酬を用いて強化学習で方策を訓練し、未学習のダイナミクスやより大きな世界における一般化を評価する。

実験結果

リサーチクエスチョン

  • RQ1エージェントは、固定されたダイナミクスを記憶する代わりに、自然言語記述を読み込むことで、新しい環境ダイナミクスに一般化できるか?
  • RQ2目的、文書、観測の間の共同推論は、ダイナミクスと目的の未学習の組み合わせへの一般化をどの程度効果的に可能にするか?
  • RQ3カリキュラム学習は、言語に基づく強化学習における複雑でマルチホップな推論タスクのサンプル効率とパフォーマンスを向上させるか?
  • RQ4方策ネットワーク内のアテンション機構は、タスク成功に不可欠な情報を文書から適切に特定できるか?
  • RQ5FiLM や言語条件付きCNNといった強力なベースラインと比較して、提案モデルのサンプル効率と最終的な勝率はどの程度か?

主な発見

  • txt 2 πは訓練中に観測されていなかった新しい環境ダイナミクスに一般化しており、読解に基づく推論が強化学習における頑健な一般化を可能にすることが示された。
  • txt 2 πはRTFMベンチマークにおいて、FiLM や言語条件付きCNNと比較して、サンプル効率と最終的な勝率の両面で優れた性能を発揮した。
  • カリキュラム学習を通じて、目的・文書・観測間の最大5段階の推論と共参照処理を要する複雑なRTFMタスクにおいても、高いパフォーマンスを達成した。
  • 定性的な分析から、txt 2 πは目的と観測に基づき、特にチームのターゲットやモンスターの性質を指定する文書の節に注目していることが分かった。
  • 良好に動作する方策は、常に正しいアイテムを取得し、誤ったモンスターを避け、正しいアイテムを入手した後のみターゲットに接近するが、性能が低い方策は、しばしば誤ったアイテムを入手したり、敵を避けるために立ち往生したりする。
  • カリキュラム学習にもかかわらず、最良のモデルでさえ人間プレーヤーのパフォーマンスに到達しておらず、言語に基づく方策学習分野には依然として大きな改善の余地があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。