Skip to main content
QUICK REVIEW

[論文レビュー] Human-Level Performance in No-Press Diplomacy via Equilibrium Search

Jonathan Gray, Adam Lerer|arXiv (Cornell University)|Oct 6, 2020
Artificial Intelligence in Games参考文献 39被引用数 10
ひとこと要約

この論文では、人間のプレイデータからの教師あり模倣学習と、レギュレート最小化を用いた1手先の前方探索を組み合わせたプレッシャーなしのDiplomacy AIエージェントを提示する。このエージェントは人間水準のパフォーマンスを達成し、以前のボットを上回り、熟練した人間のプレーヤーによる搾取にも耐えうる。また、公開Diplomacyプラットフォームにおいて上位2%の成績を収め、協調的・競合的要因が入り混じるマルチエージェント環境における画期的な進展を示している。

ABSTRACT

Prior AI breakthroughs in complex games have focused on either the purely adversarial or purely cooperative settings. In contrast, Diplomacy is a game of shifting alliances that involves both cooperation and competition. For this reason, Diplomacy has proven to be a formidable research challenge. In this paper we describe an agent for the no-press variant of Diplomacy that combines supervised learning on human data with one-step lookahead search via regret minimization. Regret minimization techniques have been behind previous AI successes in adversarial games, most notably poker, but have not previously been shown to be successful in large-scale games involving cooperation. We show that our agent greatly exceeds the performance of past no-press Diplomacy bots, is unexploitable by expert humans, and ranks in the top 2% of human players when playing anonymous games on a popular Diplomacy website.

研究の動機と目的

  • プレッシャーなしDiplomacyで人間水準のパフォーマンスを達成できるAIエージェントの開発。Diplomacyは協力と競争が複雑に絡み合う複雑なゲームである。
  • ポーカーのような2人ゼロサムゲームで成功したレギュレート最小化手法を、複数エージェントが関与する大規模なミックスモチーフゲームに拡張すること。
  • 教師ありポリシー学習と均衡探索のハイブリッドアプローチが、現実世界のマルチエージェント環境で、強固で搾取されないポリシーを生み出せるかどうかの評価。
  • このエージェントが、以前のプレッシャーなしDiplomacyボットを上回り、匿名のオンライン対戦環境でも優れた成績を収めることの実証。

提案手法

  • エージェントは、15万局の人的Diplomacyゲームデータに基づいて教師あり学習で訓練されたブループrintポリシーを用い、熟練プレーヤーの行動を近似する。
  • 実戦中、エージェントは現在のゲーム状態に対してレギュレートマッチング(RM)を用いて近似ナッシュ均衡を計算することで、1手先の前方探索を実行する。
  • すべてのプレーヤー(エージェントを含む)が残りのゲーム中、ブループrintポリシーに従うものと仮定して均衡を計算する。
  • 計算の複雑さを管理するため、すべての可能な行動を探索するのではなく、ブループrintポリシーから行動をサンプリングする。
  • リアルタイムでエージェントのポリシーを改善するために、レギュレート最小化を適用し、完全な再計画なしに戦略的判断を向上させる。
  • 模倣学習によるポリシー初期化と、不確実性下での動的意思決定のための均衡探索を組み合わせた手法。

実験結果

リサーチクエスチョン

  • RQ12人ゼロサムゲームで効果的であったレギュレート最小化手法が、プレッシャーなしDiplomacyのような大規模なミックスモチーフゲームに成功裏に適用可能か。
  • RQ2模倣学習と均衡探索のハイブリッドアプローチが、同盟関係が変動する複雑なマルチエージェント環境で人間水準のパフォーマンスを発揮するポリシーを生み出せるか。
  • RQ3繰り返し対戦を行った場合、熟練した人間プレーヤーによる搾取に対して、このエージェントがどの程度耐性を示せるか。
  • RQ4このエージェントのパフォーマンスは、現実世界のオンライン環境における以前のプレッシャーなしDiplomacyボットと比べてどの程度優れているか。

主な発見

  • エージェントは、競争的および協調的両設定において、すべての以前のプレッシャーなしDiplomacyボットを著しく上回った。
  • 熟練した人間プレーヤーによる繰り返し対戦においても、エージェントは搾取されず、強固な戦略的行動を示した。
  • 人気のあるDiplomacyウェブサイトで実施された匿名のオンラインゲームにおいて、エージェントは人間プレーヤー上位2%にランクされた。これは人間水準のパフォーマンスを示している。
  • 特に安定した同盟維持と搾取されやすいミスの回避において、以前のエージェントよりも優れたパフォーマンスを発揮した。
  • 防御から攻撃への戦略的転換など、複雑な戦略的シフトを、高リスク状況でも最小限の誤りで的確に処理した。
  • 独立したゲームレビューにおいて、高い評価が得られ、特に1つのゲームでは10点満点中10点を獲得。正確かつ高レベルな戦略的プレーが評価された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。