Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Stage Episodic Control for Strategic Exploration in Text Games

Jens Tuyls, Shunyu Yao|arXiv (Cornell University)|Jan 4, 2022
Artificial Intelligence in Games被引用数 4
ひとこと要約

本論文では、テキストベースのゲームにおける戦略的ナビゲーションのため、各エピソード内で報酬の最大化と探索を明示的に分離する、eXploit-Then-eXplore (XTX) と呼ばれるマルチステージのエピソード制御アルゴリズムを提案する。まず、自己模倣学習を用いて過去の有望な軌道を報酬最大化し、その後、逆運動学を用いた好奇心駆動型探索に切り替える。XTXは、ドンキシティ設定と確率的設定の両方で、先行手法よりも平均して27%および11%の正規化スコアの向上を達成し、Zork1では103のスコアを記録した—これは先行の最良手法の2倍以上に相当する。

ABSTRACT

Text adventure games present unique challenges to reinforcement learning methods due to their combinatorially large action spaces and sparse rewards. The interplay of these two factors is particularly demanding because large action spaces require extensive exploration, while sparse rewards provide limited feedback. This work proposes to tackle the explore-vs-exploit dilemma using a multi-stage approach that explicitly disentangles these two strategies within each episode. Our algorithm, called eXploit-Then-eXplore (XTX), begins each episode using an exploitation policy that imitates a set of promising trajectories from the past, and then switches over to an exploration policy aimed at discovering novel actions that lead to unseen state spaces. This policy decomposition allows us to combine global decisions about which parts of the game space to return to with curiosity-based local exploration in that space, motivated by how a human may approach these games. Our method significantly outperforms prior approaches by 27% and 11% average normalized score over 12 games from the Jericho benchmark (Hausknecht et al., 2020) in both deterministic and stochastic settings, respectively. On the game of Zork1, in particular, XTX obtains a score of 103, more than a 2x improvement over prior methods, and pushes past several known bottlenecks in the game that have plagued previous state-of-the-art methods.

研究の動機と目的

  • 報酬が疎であり、行動空間が組み合わせ的に巨大であるテキストアドベンチャーゲームにおける、効果的な探索と報酬最大化の課題に対処すること。
  • 動的で高次元な環境において、探索と報酬最大化のバランスを取るのが困難な単一ポリシー手法の限界を克服すること。
  • 有望なフロントイェィス状態に戻り、局所的なターゲット探索を実行することで、継続的なゲームのバッテルネックを克服できるようにすること。
  • 環境に依存する仮定や外部メモリに依存せずに、テキストゲームの決定的および確率的バージョンの両方でスケーラブルに拡張できる手法を開発すること。
  • エピソード内での明示的なポリシー分解が、エンドツーエンドまたは好奇心補正付きのベースラインと比較して、優れたサンプル効率とパフォーマンスをもたらすことを示すこと。

提案手法

  • XTXは二段階のエピソード制御戦略を用いる:まず、過去の経験から得た高得点および長寿命の軌道の混合物を用いて自己模倣学習で訓練されたポリシーによる報酬最大化。
  • 報酬最大化ポリシーは、軌道のソフトマージであり、局所最適解への過剰収束を防ぎ、フロントイェィス状態への回帰を可能にする。
  • 報酬最大化の後、時間差分(TD)損失と補助的な逆運動学損失を組み合わせた探索ポリシーに切り替えることで、未知の行動の発見を促進する。
  • 1つの補間パラメータ λ が報酬最大化と探索の間の遷移を制御し、1つのエピソード内で滑らかなポリシーの融合を可能にする。
  • 探索ポリシーは、内発的好奇心と環境フィードバックの両方の価値関数に基づいて訓練され、既知のフロントイェィス状態の周辺での戦略的局所探索を可能にする。
  • 本手法は、基盤のゲームシミュレータやゲームツリーのアーカイブへのアクセスを必要としないため、環境間でスケーラブルかつ汎用的である。

実験結果

リサーチクエスチョン

  • RQ1報酬が疎で行動空間が巨大なテキストベースのゲームにおいて、エピソード内に明示的に報酬最大化と探索を分離するマルチステージのエピソード制御アプローチが、サンプル効率とパフォーマンスの向上をもたらすか?
  • RQ2報酬最大化段階で混合ポリシーを用いることで、複雑なゲーム環境における局所最適解への過剰収束をどのように防げるか?
  • RQ3逆運動学に基づく好奇心と専用の報酬最大化ポリシーを組み合わせることで、未知のゲーム状態における戦略的探索がどの程度向上するか?
  • RQ4提案された二段階アプローチが、内発的好奇心報酬付きの単一ポリシー手法や別個の探索ポリシーを持つ手法と比較して、決定的および確率的ゲーム設定の両方で優れているか?
  • RQ5Zork1のような挑戦的なテキストアドベンチャーゲームを解くために、報酬最大化と探索フェーズの明示的分離が、連続的な混合と比較してどの程度重要か?

主な発見

  • XTXは、Jerichoベンチマークの12の決定的ゲームにおいて、先行手法よりも平均27%の正規化スコアの向上を達成した。
  • 確率的設定では、同じ12のゲームにおいて、先行ベースラインと比較して平均11%の正規化スコアの向上を達成した。
  • Zork1の決定的設定では、XTXは103のスコアを記録した—これは先行の最良手法の44点を大きく上回る。
  • Zork1の確率的バージョンでは、XTXは67のスコアに達し、先行の最良手法(41点)と比較して顕著な改善を示した。
  • アブレーションスタディの結果、純粋な報酬最大化または純粋な探索ポリシーでは性能が劣り、報酬最大化段階でのポリシー混合が、ゲーム固有のバッテルネックを克服するために不可欠であることがわかった。
  • 本手法は、Zork1における既知のバッテルネック、たとえばダンジョン内のトロールを倒すという課題を成功裏に乗り越えた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。