Skip to main content
QUICK REVIEW

[論文レビュー] Learn How to Cook a New Recipe in a New House: Using Map Familiarization, Curriculum Learning, and Bandit Feedback to Learn Families of Text-Based Adventure Games

Xusen Yin, Jonathan May|arXiv (Cornell University)|Aug 13, 2019
Artificial Intelligence in Games被引用数 5
ひとこと要約

本稿では、マップの習得、カリキュラム学習、文脈的バンディット探索を組み合わせることで、特定のテーマ(例:料理)における未学習のテキストベースのアドベンチャーゲームをエージェントが習得できる強化学習フレームワークを提案する。複雑度が増すゲームインスタンスの順に訓練を行い、不確実性を考慮した探索にLinUCBを用いることで、ベースラインと比較して、未学習の新しいゲームにおいて顕著に高いゼロショット性能を達成する。

ABSTRACT

We consider the task of learning to play families of text-based computer adventure games, i.e., fully textual environments with a common theme (e.g. cooking) and goal (e.g. prepare a meal from a recipe) but with different specifics; new instances of such games are relatively straightforward for humans to master after a brief exposure to the genre but have been curiously difficult for computer agents to learn. We find that the deep Q-learning strategies that have been successfully leveraged for superhuman performance in single-instance action video games can be applied to learn families of text video games when adopting simple strategies that correlate with human-like learning behavior. Specifically, we build agents that learn to tackle simple scenarios before more complex ones using curriculum learning, that familiarize themselves in an unfamiliar environment by navigating before acting, and that explore uncertain environments more thoroughly using contextual multi-armed bandit decision policies. We demonstrate improved task completion rates over reasonable baselines when evaluating on never-before-seen games of that theme.

研究の動機と目的

  • 特定のインスタンスに過学習するのではなく、共通のテーマ(例:料理)内での未学習のテキストベースのアドベンチャーゲームに一般化できるようにエージェントを可能にすること。
  • カリキュラム学習を模倣することで人間のような学習プロセスを再現し、ゼロショット一般化を向上させること。
  • 知識グラフの構築により普遍的知識とインスタンス固有の知識を区別することで、不慣れな環境における探索を強化すること。
  • 評価時に文脈的多腕バンディットフィードバックを統合することで、不確実性下での探索をガイドし、未学習のゲームでのパフォーマンスを向上させること。

提案手法

  • エージェントは、より単純なゲームインスタンス(例:Tier-4)から訓練を開始し、次第に複雑度の高いもの(例:Tier-6)に進むカリキュラム学習を用いることで、全体の一般化性能を向上させる。
  • マップの習得は、環境の説明から知識グラフを構築することで達成され、エージェントが普遍的知識(例:'台所は調理に使われる')とインスタンス固有の事実(例:'台所は寝室の東にある')を区別できるようにする。
  • 推論段階では、エージェントがLinUCB文脈的バンディット方策を適用し、探索と活用のバランスを保ち、不確実性の高い行動を優先することでスコアを向上させる。
  • DQNエージェントは、行動-観測トレースのCNNベースの状態表現を用い、Q値予測により行動選択を行う。
  • 探索戦略を比較:$͑$-ε greedy、温度付きのポリシー採番、およびLinUCB;LinUCBが優れたパフォーマンスを示した。
  • 知識グラフの構築により、環境の構造を符号化し、行動計画を支援することで、サンプル効率と一般化性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1カリキュラム学習は、単一インスタンスの訓練を超えて、テキストベースのアドベンチャーゲームにおけるゼロショット一般化を向上させることができるか?
  • RQ2知識グラフの構築によるマップの習得は、未学習の環境での学習をどのように向上させるか?
  • RQ3評価時に文脈的バンディットフィードバックを統合することで、新しい未学習のゲームでのパフォーマンスが向上するか?
  • RQ4異なる探索戦略($͑$-ε greedy、ポリシー採番、LinUCB)がゼロショット環境におけるタスク完了に与える相対的影響は何か?

主な発見

  • LinUCBバンディット方策が最高のパフォーマンスを達成し、Test 1では平均72%、Test 2では68%の成功率を記録し、$͑$-ε greedyおよび採番手法を上回った。
  • 階層的訓練(例:Tier-4から開始)を用いたカリキュラム学習は、すべての段階を同時に訓練するのと比較して、より良い全体的なパフォーマンスをもたらした。特に全段階でのファインチューニング後に最良の結果が得られた。
  • 知識グラフの構築により、エージェントが普遍的知識とインスタンス固有の知識を区別できるようになり、より良い一般化が可能になった。
  • LinUCBによる探索は、$͑$-ε greedyおよびポリシー採番を著しく上回り、特に複雑度の高い段階において、不確実な行動に対するより包括的かつ情報に基づいた探索が可能になった。
  • カリキュラム学習における最近性効果が観察された:ある段階のパフォーマンスは、それが訓練の最後に使われた場合に最も高かった。これは、後続の訓練段階がより強い影響を持つことを示している。
  • カリキュラム学習後にLinUCB探索を適用した場合、全テストセットで平均68%の成功率を達成し、強力なゼロショット一般化を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。