[論文レビュー] Rolling Horizon Coevolutionary Planning for Two-Player Video Games
本稿では、2人対戦型リアルタイムビデオゲーム向けに、ローリングホライズン進化的計画を拡張して両プレイヤーの行動シーケンスを共進化させる、新しい意思決定手法であるローリングホライズン共進化的アルゴリズム(RHCA)を提案する。RHCAは、MCTS やヒューリスティックベースのコントローラーを含む、多数の汎用ゲームAIアルゴリズムを上回る性能を示しており、事前の学習を必要としないにもかかわらず、独自に開発した2人対戦型宇宙バトルゲームの複数バージョンにおいても優れた性能を発揮した。
This paper describes a new algorithm for decision making in two-player real-time video games. As with Monte Carlo Tree Search, the algorithm can be used without heuristics and has been developed for use in general video game AI. The approach is to extend recent work on rolling horizon evolutionary planning, which has been shown to work well for single-player games, to two (or in principle many) player games. To select an action the algorithm co-evolves two (or in the general case N) populations, one for each player, where each individual is a sequence of actions for the respective player. The fitness of each individual is evaluated by playing it against a selection of action-sequences from the opposing population. When choosing an action to take in the game, the first action is chosen from the fittest member of the population for that player. The new algorithm is compared with a number of general video game AI algorithms on three variations of a two-player space battle game, with promising results.
研究の動機と目的
- 事前の学習を必要としない、2人対戦型リアルタイムビデオゲーム向けの汎用的意思決定アルゴリズムの開発。
- 単一プレイヤーゲームで成功を収めたローリングホライズン進化的アルゴリズム(RHEA)を、マルチプレイヤー環境に拡張すること。
- 制御可能でカスタマイズ可能な2人対戦バトル環境において、提案されたアルゴリズムの性能を、多様な汎用ゲームAI手法と比較して評価すること。
- マクロアクションのサイズ(1シーケンスあたりのアクション数)がアルゴリズムの性能に与える影響を評価すること。
- 共進化的計画が、モンテカルロツリー探索(MCTS)の代替手段としてリアルタイムゲームにおいて実用的である可能性を検討すること。
提案手法
- RHCAは、各プレイヤーごとに分離された2つの行動シーケンスの集団を共進化させ、各個体が固定された計画ホライズン内の行動シーケンスを表すローリングホライズンフレームワークを用いる。
- 各行動シーケンスの適応度は、相手側の集団からサンプリングされた行動シーケンスとの繰り返しロールアウトを通じて評価される。
- 各プレイヤーの集団において、最も適応度の高い個体の最初の行動が、現在のゲーム状態で実行される。
- アルゴリズムは固定されたシミュレーション深さ(計画ホライズン)を用い、各ゲームターンごとに集団を再評価・再最適化することで、将来の行動のローリングウィンドウを維持する。
- 複数回のランダム初期化とゲーム実行の平均化により、確率的ゲームをサポートする。
- 本手法は、MCTS や OneStep、OLMCTS、ランダムまたは回転させたベースラインエージェントなどのオープンループコントローラーと対比される。
実験結果
リサーチクエスチョン
- RQ1ローリングホライズン進化的計画が、単一プレイヤーゲームから2人対戦型リアルタイムゲームへと成功裏に拡張可能か?
- RQ2MCTS やヒューリスティックベースのコントローラーといった、確立された汎用ゲームAI手法と比較して、RHCAの性能は2人対戦環境でどの程度か?
- RQ3マクロアクションのサイズ(1シーケンスあたりのアクション数)が、RHCA および RHGA の性能に顕著な影響を与えるか?
- RQ4共進化的計画により、事前の学習を経ずに高い性能を発揮できるか。これは、ゲームデザインのフィードバックを迅速に得るのに適しているか?
- RQ5RHCA は、リアルタイム2人対戦ゲームにおいて、MCTS と同等かそれ以上の実用的で競争力のある代替手段として成立するか?
主な発見
- RHCAは、全テストゲームで平均76.1%の勝率を記録し、ラウンドロビントーナメントにおいて他のすべてのコントローラーを上回った。
- 武器のないシンプルなバトルゲーム(G₁)では、RHCAはランダムコントローラー(RND)に対して93.5%、回転コントローラー(ROT)に対して100%、OneStepコントローラーに対して87.0%の勝率を記録した。
- RHCAは、平均勝率68.3%を記録したOLMCTS や、平均勝率70.1%を記録したRHGA を顕著に上回った。
- RHCA および RHGA の性能は、マクロアクションあたりのアクション数が増加するにつれて低下した。これは、短い計画ホライズンがより良い結果をもたらすことを示唆している。
- OneStepは全体的に低性能であり、RNDに対しては51.0%、ROTに対しては0.0%の勝率だったが、G₁においてROTに勝利した特定のケースを除いては顕著な成果を上げられなかった。
- OLMCTS は中程度の性能を示し、平均勝率68.3%であったが、どのゲームバージョンにおいてもRHCA や RHGA に明確な優位性を示さなかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。