Skip to main content
QUICK REVIEW

[論文レビュー] Learn How to Cook a New Recipe in a New House: Using Map Familiarization, Curriculum Learning, and Common Sense to Learn Families of Text-Based Adventure Games

Xusen Yin, Jonathan May|arXiv (Cornell University)|Aug 13, 2019
Artificial Intelligence in Games参考文献 21被引用数 12
ひとこと要約

本論文では、共通するテーマ(例:調理)を持つが詳細が異なるテキストベースのアドベンチャーゲームのグループを学習できるように、マップの熟悉と文脈的マルチアームバンディットを組み合わせたカリキュラム学習アプローチを提案する。人間の学習に類似したプロセス——初めは簡単なタスクから始め、環境の探索を先に行い、不確実な行動を優先する——を踏まえることで、同じテーマファミリーに属する未観測のゲームにおいて、ベースラインと比較して著しく高い成功確率を達成する。

ABSTRACT

We consider the task of learning to play families of text-based computer adventure games, i.e., fully textual environments with a common theme (e.g. cooking) and goal (e.g. prepare a meal from a recipe) but with different specifics; new instances of such games are relatively straightforward for humans to master after a brief exposure to the genre but have been curiously difficult for computer agents to learn. We find that the deep Q-learning strategies that have been successfully leveraged for superhuman performance in single-instance action video games can be applied to learn families of text video games when adopting simple strategies that correlate with human-like learning behavior. Specifically, we build agents that learn to tackle simple scenarios before more complex ones using curriculum learning, that familiarize themselves in an unfamiliar environment by navigating before acting, and that explore uncertain environments more thoroughly using contextual multi-armed bandit decision policies. We demonstrate improved task completion rates over reasonable baselines when evaluating on never-before-seen games of that theme.

研究の動機と目的

  • 共通するテーマを持つが詳細が異なるテキストベースのアドベンチャーゲームのグループに一般化する課題に対処すること。
  • 単一インスタンスのパフォーマンスを超えて、強化学習エージェントのサンプル効率性と一般化性能を向上させること。
  • 段階的なスキル習得や行動の前段階での環境探索といった人間の学習行動を模倣すること。
  • 広範な事前学習に依存しないように、常識と文脈的探索戦略を統合すること。

提案手法

  • エージェントは、テーマファミリー内のより単純なゲームインスタンスからより複雑なインスタンスへと段階的に進むカリキュラム学習を用いる。
  • 行動を取る前に、エージェントは空間的・物体的認識を構築するために、環境を探索するマップの熟悉フェーズを実施する。
  • 文脈的マルチアームバンディットポリシーが、不確実性の高い行動を優先することで、探索の効率を向上させる。
  • エージェントは常識と環境の構造を活用して妥当な行動を推論し、行動空間を縮小する。
  • 深層Q学習と階層的探索・計画を統合することで、長距離タスクの遂行を改善する。
  • フレームワークは、同じテーマ(例:調理)からのゲームのカリキュラムで学習され、同じファミリーに属する未観測のゲームで評価される。

実験結果

リサーチクエスチョン

  • RQ1カリキュラム学習は、テーマファミリーにまたがるテキストベースのアドベンチャーゲームにおけるゼロショット一般化を改善できるか?
  • RQ2行動を取る前のマップの熟悉は、サンプル効率性と成功確率にどのような影響を与えるか?
  • RQ3文脈的マルチアームバンディットは、部分的に観測可能なテキストベースの環境における探索をどの程度改善できるか?
  • RQ4常識的推論により、個々のゲームインスタンスに対する広範な訓練の必要性を軽減できるか?
  • RQ5これらの戦略を組み合わせることで、未観測のゲームにおいて標準的な深層Q学習ベースラインと比較して、測定可能なパフォーマンス向上が得られるか?

主な発見

  • 提案手法は、同じテーマファミリーに属する未観測のゲームにおいて、強力なベースラインエージェントと比較して著しく高いタスク完了率を達成する。
  • 行動を取る前のマップの熟悉は、新規環境での収束が速く、より信頼性の高いナビゲーションを実現する。
  • 文脈的マルチアームバンディットは、不確実性や情報量の高い行動に注目することで、探索の効率を向上させる。
  • カリキュラム学習戦略により、複雑さやオブジェクト構成が異なるゲームインスタンス間での一般化が可能になる。
  • エージェントは人間の学習プロセスに類似した進行を示し、簡単なタスクから段階的に複雑なタスクを習得する。
  • フレームワークは、同じテーマに属する新しいゲームに対しても効果的に一般化でき、インスタンス間での強力な転移学習の可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。