Skip to main content
QUICK REVIEW

[論文レビュー] Improving Hearthstone AI by Combining MCTS and Supervised Learning Algorithms

Maciej Świechowski, Tomasz Tajmajer|arXiv (Cornell University)|Aug 14, 2018
Artificial Intelligence in Games参考文献 29被引用数 11
ひとこと要約

本稿では、部分的に観測可能な確率的トランプゲームであるHearthstoneにおける意思決定の質を向上させるために、モンテカルロ木探索(MCTS)と教師あり学習を組み合わせたハイブリッドAIを提案する。ニューラルネットワークを用いてゲーム状態を評価し、MCTSの探索をガイドすることで、最大9パーセンテージポイントの勝率向上を達成した。特に時間制約下でも顕著な効果を示し、学習されたヒューリスティクスがベースラインMCTSに比べて強さと効率性を著しく向上させることを示した。

ABSTRACT

We investigate the impact of supervised prediction models on the strength and efficiency of artificial agents that use the Monte-Carlo Tree Search (MCTS) algorithm to play a popular video game Hearthstone: Heroes of Warcraft. We overview our custom implementation of the MCTS that is well-suited for games with partially hidden information and random effects. We also describe experiments which we designed to quantify the performance of our Hearthstone agent's decision making. We show that even simple neural networks can be trained and successfully used for the evaluation of game states. Moreover, we demonstrate that by providing a guidance to the game state search heuristic, it is possible to substantially improve the win rate, and at the same time reduce the required computations.

研究の動機と目的

  • 隠れた情報と確率的ゲームメカニクスを伴うHearthstoneAIにおけるMCTSベースの性能と効率性の向上を目的とする。
  • 教師あり学習モデルが部分的に観測可能で非決定的(非決定的)なゲームにおけるMCTS探索のヒューリスティクスをどのようにガイドできるかを調査すること。
  • MCTSと学習された評価関数を組み合わせたハイブリッドAIシステムの設計および評価を通じて、ゲームプレイの強度を向上させること。
  • 得られたエージェントを人間プレイヤーやランダムな相手と比較し、実世界での競争力を実証すること。
  • 自己対戦とモデルの最適化を繰り返すことで、より強力なHearthstoneボットを段階的に進化させるスケーラブルな反復的学習ループを確立すること。

提案手法

  • Hearthstoneにおけるランダムネスと不完全情報に対応するため、PIMCおよびISMCTS技術を用いて信念状態を管理するように変更されたMCTSアルゴリズムを実装した。
  • 高スループットのMCTSロールアウト(最大1秒間に10,000ゲーム)を可能にするために、カスタムのゲームシミュレータを開発した。
  • 歴史的ゲームデータを用いて教師あり学習により訓練されたニューラルネットワークを、ゲーム状態価値を予測するためのヒューリスティクス評価関数として使用した。
  • MCTS探索は、ゲーム状態の期待される結果を推定する価値ネットワークによってガイドされ、ランダムなロールアウトへの依存度が低下した。
  • シミュレーション中に最適な攻撃シーケンスを計算するためのボードソルバーを統合し、戦闘フェーズにおける戦術的意思決定の質を向上させた。
  • 過去のバージョンとの対戦を通じて反復的にエージェントを最適化する反復的学習ループを用い、段階的なスキル向上を実現した。

実験結果

リサーチクエスチョン

  • RQ1教師あり学習モデルは、Hearthstoneの部分的観測可能で確率的な環境下でMCTSの意思決定品質を効果的に改善できるか?
  • RQ2価値ネットワークやボードソルバーなどの異なる種類の学習されたヒューリスティクスが、MCTSの性能と計算効率にどのように影響を与えるか?
  • RQ3学習されたヒューリスティクスは、優れたゲームプレイを達成するために必要なMCTSのシミュレーション回数をどの程度削減できるか?
  • RQ4異なるプレイヤーの役割(先手 vs 後手)やデッキタイプに応じて、ヒューリスティクスによるパフォーマンス向上の度合いはどのように変化するか?
  • RQ5MCTSと教師あり学習を組み合わせたハイブリッドシステムは、熟練した人間プレイヤーと競合可能なパフォーマンスを達成できるか?

主な発見

  • 価値ネットワークとボードソルバーの統合により、1手あたり0.5秒の制限時間でも、ボットの勝率が最大9パーセンテージポイント向上した。
  • 先攻でない(26.5%の低いベースライン勝率を示す)後手プレイヤーにおいて、ヒューリスティクスの使用により勝率がほぼ2倍にまで上昇し、最適な条件下で最大50%に達した。
  • 時間制限が厳しい状況では、MCTSの反復回数が少ないため、ヒューリスティクスの恩恵が最も顕著に現れた。これは、学習されたモデルからのガイドが、限定的な探索深さを補完していることを示している。
  • 1秒/手の制限下では、価値ネットワークのみを使用する場合と、ボードソルバーを追加した場合の差がほとんどなく、時間割りが大きいと限界効果が顕著になった。
  • ランダムプレイヤーに対しては100%の勝率を記録し、レジェンドランクの人間プレイヤーに対しても勝利を挙げた。これは、実世界での高いパフォーマンスを示している。
  • 人間プレイヤーは、ボットが非常に戦略的かつ一貫性のあるプレイをすることを報告しており、単なるパターンマッチングを超えた高品質な意思決定がなされていると感じられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。