Skip to main content
QUICK REVIEW

[論文レビュー] Learning Policies from Self-Play with Policy Gradients and MCTS Value Estimates

Dennis J. N. J. Soemers, Éric Piette|arXiv (Cornell University)|May 14, 2019
Artificial Intelligence in Games参考文献 41被引用数 5
ひとこと要約

本論文は、探索を促進しないように設計された新しい方策勾配目的関数TSPGを提案する。TSPGは、MCTSの価値推定値を勾配推定に用いることで、方策を期待されるMCTS性能を最大化するように訓練する。実験的に、TSPGは交差エントロピー学習と比較して、エントロピーが低く、特徴量の重みがより解釈可能になる強力な方策を生成する。これは、ボードゲームにおける戦略抽出に適している。

ABSTRACT

In recent years, state-of-the-art game-playing agents often involve policies that are trained in self-playing processes where Monte Carlo tree search (MCTS) algorithms and trained policies iteratively improve each other. The strongest results have been obtained when policies are trained to mimic the search behaviour of MCTS by minimising a cross-entropy loss. Because MCTS, by design, includes an element of exploration, policies trained in this manner are also likely to exhibit a similar extent of exploration. In this paper, we are interested in learning policies for a project with future goals including the extraction of interpretable strategies, rather than state-of-the-art game-playing performance. For these goals, we argue that such an extent of exploration is undesirable, and we propose a novel objective function for training policies that are not exploratory. We derive a policy gradient expression for maximising this objective function, which can be estimated using MCTS value estimates, rather than MCTS visit counts. We empirically evaluate various properties of resulting policies, in a variety of board games.

研究の動機と目的

  • 自己対戦における標準的な交差エントロピー損失が引き起こす探索的行動を避ける方策学習目的関数の開発。
  • 方策エントロピーの低減により、明確で解釈可能な戦略を抽出可能にする。
  • MCTSの訪問回数を模倣するのではなく、期待されるMCTS結果を最適化することで、自己対戦における方策性能の向上。
  • 価値ベースの方策勾配が、より明確で解釈可能な特徴量重み分布をもたらすかどうかの調査。
  • 複数のボードゲームにおいて、TSPGと交差エントロピー損失で学習された方策の解釈可能性と強さを比較。

提案手法

  • 方策をMCTSの期待報酬を最大化するように訓練する新しい方策勾配目的関数TSPGを提案。
  • MCTS訪問回数や行動分布ではなく、MCTS価値推定値を監視として用いる方策勾配式を導出。
  • 自己対戦を用い、方策更新とMCTSロールアウトを交互に実行。MCTSでは現在の方策を用いて選択をガイドし、価値推定値を学習に使用。
  • 微分可能な方策パラメータ化を用い、導出されたTSPG勾配に基づいて確率的勾配降下法で方策を訓練。
  • 行動の特徴ベース表現を用い、特徴量の重要性の分析と学習済み戦略の解釈可能性を可能に。
  • エントロピー、強さ、特徴量重み分布の観点から、TSPGで学習された方策と交差エントロピーで学習された方策を比較。

実験結果

リサーチクエスチョン

  • RQ1MCTSの期待性能を最大化するように方策を学習させることで、MCTS行動を模倣する交差エントロピー学習に比べて、より強い単体の方策が得られるか?
  • RQ2TSPG目的関数は、方策エントロピーをどの程度低減させ、より決定的かつ解釈可能な行動選択を可能にするか?
  • RQ3TSPGと交差エントロピーで学習された方策における特徴量重み分布はどのように異なるか?また、戦略の解釈可能性に影響を与えるか?
  • RQ4TSPG方策を用いてバイアスをかけたMCTSエージェントは、交差エントロピー方策を用いたエージェントよりも高い性能を示せるか?
  • RQ5交差エントロピーとTSPG目的関数を用いる際、強さと解釈可能性の間にトレードオフが生じるか?

主な発見

  • TSPG目的関数で学習された方策は、複数のボードゲームにおいて、単体でのゲーム性能で交差エントロピー損失で学習された方策を常に上回るか、同等の性能を示す。
  • TSPG方策は、行動分布のエントロピーが顕著に低く、探索が抑えられ、より決定的な行動を示す。
  • TSPG方策の特徴量重み分布は、より広い値の範囲を示し、特徴量間の差が顕著に強調されており、解釈可能性が向上する。
  • MCTS行動を明示的に模倣していないにもかかわらず、TSPG方策は交差エントロピー方策よりもMCTSの行動分布に近いエントロピーを持つ。
  • 交差エントロピー方策はより探索的であるが、高いエントロピーのおかげでMCTS評価がよりバランスが取れている可能性があり、強さと解釈可能性のトレードオフが示唆される。
  • TSPG目的関数は、明確な特徴量重要度順位付けを可能にし、将来的な学習済み方策からの戦略抽出を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。