[論文レビュー] Keep CALM and Explore: Language Models for Action Generation in Text-based Games
本論文では、人間のプレイトランスクリプトを学習データとして用いた文脈的アクション言語モデル(CALM)を紹介する。このモデルは、テキストベースのゲームにおいて、コン pact かつ意味的に関連性のあるアクション候補を生成することを目的としている。CALM を強化学習エージェント(DRRN)と組み合わせることで、Jericho ベンチマークにおいて、従来の最先端モデルよりも平均スコアで 69% の相対的向上を達成した。これは、一部のゲームでは真値アクション集合にアクセス可能なモデルでさえも上回った。
Text-based games present a unique challenge for autonomous agents to operate in natural language and handle enormous action spaces. In this paper, we propose the Contextual Action Language Model (CALM) to generate a compact set of action candidates at each game state. Our key insight is to train language models on human gameplay, where people demonstrate linguistic priors and a general game sense for promising actions conditioned on game history. We combine CALM with a reinforcement learning agent which re-ranks the generated action candidates to maximize in-game rewards. We evaluate our approach using the Jericho benchmark, on games unseen by CALM during training. Our method obtains a 69% relative improvement in average game score over the previous state-of-the-art model. Surprisingly, on half of these games, CALM is competitive with or better than other models that have access to ground truth admissible actions. Code and data are available at https://github.com/princeton-nlp/calm-textgame.
研究の動機と目的
- テキストベースのゲームにおける作用空間の組み合わせ的爆発問題に対処すること。ここでは、適切なアクションはごくわずかである。
- 手動で作成されたルールや真値アクション集合に依存せずに、言語的バイアスと人間のゲーム感覚をアクション生成に組み込むこと。
- 文脈に適応した言語モデルを用いて作用空間を絞ることで、強化学習エージェントのサンプル効率と性能を向上させること。
- 1 つの CALM モデルが多様で未知のテキストベースのゲームに一般化できることを示すこと。
提案手法
- 590 体の異なるテキストベースのゲームから得た 426 件の人のプレイトランスクリプトを用いて、n-gram または GPT-2 の言語モデルを学習させ、文脈的アクション生成を習得する。
- 訓練済みの CALM を用いて、現在の観察結果とゲーム履歴を条件として、各ゲーム状態で上位 K 個のアクション候補を生成する。
- 生成されたアクションを、予測された Q 値とゲーム内報酬に基づいて再順序付けする Deep Reinforcement Relevance Network (DRRN) と CALM を統合する。
- ゲーム報酬に基づいて DRRN をエンドツーエンドで学習するが、CALM は人間データでの事前学習後は固定する。
- 微調整なしに、1 つの CALM インスタンスを複数のゲームに展開し、評価ゲームに対してゼロショット一般化を実現する。
- 孤立した生成(真値の適切なアクションと比較)と、Jericho ベンチマークにおけるエンドツーエンドの強化学習性能の両方で、アクション品質を評価する。
実験結果
リサーチクエスチョン
- RQ1人間のプレイトランスクリプトを学習データとして用いた言語モデルは、多様なテキストベースのゲームにおいて意味的に関連性があり、適切なアクション候補を生成できるか?
- RQ2真値アクション集合にアクセスできない状況でも、文脈的言語モデルと強化学習エージェントを組み合わせることで、従来手法よりも性能が向上するか?
- RQ31 つの CALM モデルが微調整なしに、未知のテキストベースのゲームにどの程度一般化できるか?
- RQ4特定の状況では、真値の適切なアクションにアクセス可能なモデルよりも、CALM が生成するアクション候補が優れているか?
主な発見
- CALM + DRRN 法は、Jericho ベンチマークにおいて、従来の最先端モデルよりも平均正規化スコアで 69% の相対的向上を達成した。
- 28 体の評価ゲームのうち 8 体において、真値の適切なアクションにアクセス可能なモデルを上回った。特に『inhumane』というゲームでは、25.7 のスコアを記録したのに対し、従来の最先端モデルは 3 であった。
- GPT-2 バージョンの CALM は、n-gram ベースラインと比較して、対象物との相互作用や常識的アクションに関する定性的な例で、より意味的に整合性があり文脈に適ったアクションを生成した。
- 孤立した状態でも、CALM(GPT-2)は真値の適切なアクションと強く一致するアクション候補を生成しており、強力な言語的およびゲーム感覚のバイアスを示している。
- 1 つの CALM モデルを用いて、複数の多様なゲーム環境に効果的に一般化でき、評価の 28 体すべてのゲームに、いかなるゲーム固有の調整も行わずに展開された。
- 人間のプレイデータから、言語的および戦略的バイアスを、コンパクトで再利用可能なアクション生成メカニズムへと効果的に抽出できることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。