Skip to main content
QUICK REVIEW

[論文レビュー] Playing Text-Adventure Games with Graph-Based Deep Reinforcement Learning

Prithviraj Ammanabrolu, Mark Riedl|arXiv (Cornell University)|Dec 4, 2018
Topic Modeling参考文献 16被引用数 12
ひとこと要約

本論文では、知識グラフを用いてゲーム状態を表現し、テキストベースのアドベンチャーゲームにおける行動空間を削減する、グラフベースのディープレインフォースメントラーニングアーキテクチャ、KG-DQNを提案する。行動選択を質問応答タスクとして定式化し、転移学習を用いた事前学習を行うことで、ベースラインと比較して最適報酬への収束が40%速くなり、より少ないステップで高品質なクエスト解決を達成する。

ABSTRACT

Text-based adventure games provide a platform on which to explore reinforcement learning in the context of a combinatorial action space, such as natural language. We present a deep reinforcement learning architecture that represents the game state as a knowledge graph which is learned during exploration. This graph is used to prune the action space, enabling more efficient exploration. The question of which action to take can be reduced to a question-answering task, a form of transfer learning that pre-trains certain parts of our architecture. In experiments using the TextWorld framework, we show that our proposed technique can learn a control policy faster than baseline alternatives. We have also open-sourced our code at https://github.com/rajammanabrolu/KG-DQN.

研究の動機と目的

  • 自然言語コマンドとしての行動が生じる、テキストベースのアドベンチャーゲームにおける組み合わせ的に大きな行動空間の課題に対処すること。
  • 知識グラフを用いて世界状態の永続的記憶を可能にすることで、部分的に観測可能な環境におけるサンプル効率を向上させること。
  • 質問応答の事前学習を通じた行動空間の削減と転移学習の統合により、学習収束を加速させること。
  • 明示的で構造化された世界表現(知識グラフ)が、複雑で長時間にわたるテキストベースのゲーム環境において、非構造化埋め込みを上回ることを示すこと。

提案手法

  • エージェントは、探索に伴い進化するエンティティおよびその関係を捉える動的知識グラフを維持する。
  • 現在のグラフ状態に存在しないエンティティや関係を含む行動は、知識グラフを用いて行動空間からフィルタリングされ、削減される。
  • グラフアテンションネットワーク(GAT)が知識グラフを処理し、状態行動ペアのQ値推定時に関連する部分グラフに注目する。
  • 自然言語行動はトランスフォーマーに基づくエンコーダーを用いて埋め込まれ、状態記述と行動埋め込みの間の微分可能相互作用メカニズムを通じてQ値が計算される。
  • 外部ゲームデータを用いた質問応答タスクで事前学習を行い、一般化された効果的な行動に関する知識を転送することで、初期方策の品質を向上させる。
  • KG-DQNアーキテクチャの全容は、知識グラフによる状態表現、グラフアテンション、および事前学習済み行動エンコーダーを統合したディープQネットワークフレームワークに統合される。

実験結果

リサーチクエスチョン

  • RQ1知識グラフ表現は、組み合わせ的に大きな行動空間を持つテキストベースのアドベンチャーゲームにおいて、サンプル効率と収束速度を向上させることができるか?
  • RQ2知識グラフに基づく行動の削減は、学習の高速化と無効な行動の探索削減に寄与するか?
  • RQ3質問応答パラダイムによる行動エンコーダーの事前学習は、異なるゲーム間で知識を転送し、方策学習の加速にどの程度寄与するか?
  • RQ4永続的記憶(知識グラフ)と事前学習の組み合わせは、学習速度および解決品質の面で、標準的なディープQネットワークに比べてどのように差をつけるか?

主な発見

  • 小規模なTextWorldマップでは、KG-DQNが最良のベースライン(LSTM-DQN)と比較して最大報酬への収束が40%速い。
  • 大規模マップでは、KG-DQNはLSTM-DQNと同等のパフォーマンスを達成するが、はるかに少ないエピソード数で、収束速度が顕著に速い。
  • 行動の削減や事前学習なしのKG-DQNのアブレーション版は、小規模クエストを完了するのに平均131.7ステップを要するが、完全モデルでは73.7ステップである。
  • 完全なKG-DQNモデルは、小規模クエストを73.7 ± 8.5ステップで完了するが、これはLSTM-DQNと統計的に有意差がない(p = 0.199)ため、同等の解決品質を示している。
  • 質問応答による事前学習は一般化を向上させ、明示的な指示なしに未観測のゲームバージョンに対しても、より速い収束を可能にする。
  • 知識グラフは永続的記憶を提供し、すべてのKG-DQNバージョンにおいて一貫したパフォーマンス向上を示しており、学習の高速化を実現している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。