Skip to main content
QUICK REVIEW

[論文レビュー] Modelling Behavioural Diversity for Learning in Open-Ended Games

Nicolas Perez Nieves, Yaodong Yang|arXiv (Cornell University)|Mar 14, 2021
Reinforcement Learning in Robotics参考文献 8被引用数 4
ひとこと要約

本稿では、決定性点過程(DPPs)を用いて厳密な多様性指標を定義する幾何的枠組みを提示し、ゲームにおける行動的多様性を扱う。この指標を最適応答ダイナミクスに統合することで、ナッシュ均衡に収束する多様性を考慮した擬似反復法(Diverse Fictitious Play)と、αランクに収束する多様性を考慮したポリシー空間応答オラクル(D-PSRO)を構築し、多様な非推移的ゲームにおいて、PSROベースラインと比較してより低い利用可能性(exploitability)を達成した。

ABSTRACT

Promoting behavioural diversity is critical for solving games with non-transitive dynamics where strategic cycles exist, and there is no consistent winner (e.g., Rock-Paper-Scissors). Yet, there is a lack of rigorous treatment for defining diversity and constructing diversity-aware learning dynamics. In this work, we offer a geometric interpretation of behavioural diversity in games and introduce a novel diversity metric based on determinantal point processes (DPP). By incorporating the diversity metric into best-response dynamics, we develop diverse fictitious play and diverse policy-space response oracle for solving normal-form games and open-ended games. We prove the uniqueness of the diverse best response and the convergence of our algorithms on two-player games. Importantly, we show that maximising the DPP-based diversity metric guarantees to enlarge the gamescape -- convex polytopes spanned by agents' mixtures of strategies. To validate our diversity-aware solvers, we test on tens of games that show strong non-transitivity. Results suggest that our methods achieve at least the same, and in most games, lower exploitability than PSRO solvers by finding effective and diverse strategies.

研究の動機と目的

  • マルチエージェント強化学習およびゲーム理論における行動的多様性の厳密な取り扱いの欠如に対処すること。
  • 決定性点過程(DPPs)を用いて行動的多様性を幾何的性質として形式化し、根拠に基づいた戦略選択を可能にすること。
  • ナッシュ均衡やαランクといった解概念に収束する多様性に配慮した学習ダイナミクスを構築すること。
  • 多様性最大化が非推移的ゲームにおける利用可能性の低減とゲームスケープの広範なカバーをもたらすことを実証的に検証すること。
  • PSROにおける周期的戦略反復を克服するため、新規で効果的な戦略の発見を促進するDPPに基づく多様性指標を統合すること。

提案手法

  • 戦略集合上でのDPPの期待基数として定義されるDPPに基づく多様性指標を提案し、多様な戦略間の反発をモデル化する。
  • DPP多様性指標を最適応答ダイナミクスに統合し、多様性を考慮した擬似反復法(DFP)と多様性を考慮したポリシー空間応答オラクル(D-PSRO)を構築する。
  • 多様性を考慮した最適応答は、報酬とDPPに基づく多様性の和を最大化する戦略として定義され、2人ゲームにおいて一意性と収束性を保証する。
  • 理論的分析により、DFPが2人ゲームでナッシュ均衡に収束し、D-PSROが2人ゲームでαランクに収束することを証明し、ゲームスケープ拡張の保証を提示する。
  • 28の実世界ゲームおよび合成的なオープンエンドゲームに対して、PSROおよびPSRO rNベースラインと比較して、利用可能性と多様性を評価する実証的評価を実施する。
  • メタゲーム抽象化を用いてエージェントを混合戦略として表現し、大規模なポリシー空間(例:AlphaStarにおける888のポリシー)においてもスケーラブルな評価を可能にする。

実験結果

リサーチクエスチョン

  • RQ1幾何的かつ確率的枠組みを用いて、ゲームにおける行動的多様性を形式的に定義・測定することは可能か?
  • RQ2DPPに基づく多様性指標を最適応答ダイナミクスに統合することで、非推移的ゲームにおける収束性と戦略カバレッジの向上が達成可能か?
  • RQ3DPPに基づく多様性を最大化することは、標準的なPSROと比較して、利用可能性の低減とゲームスケープの広範な探索をもたらすか?
  • RQ4提案された多様性に配慮したソルバーは、周期的戦略反復を回避し、オープンエンドゲームで新規で効果的な戦略を発見できるか?
  • RQ5DPPに基づく多様性指標は、混合戦略が張る凸包(ゲームスケープ)の拡張をどの程度保証するか?

主な発見

  • 提案されたDPPに基づく多様性指標は、エージェントの混合戦略が張る凸包(ゲームスケープ)の拡張を保証し、多様性に幾何的根拠を与える。
  • 多様性を考慮した擬似反復法(DFP)は2人ゲームでナッシュ均衡に収束し、多様性を考慮したPSRO(D-PSRO)はαランクに収束するが、理論的保証がある。
  • 888のポリシーを含むAlphaStarのメタゲームでは、D-PSROは50未満のポリシーでほぼゼロの利用可能性を達成したが、PSROベースラインは飽和した。
  • 非推移的ミックスチャネルモデルでは、DPP-PSROは7つのガウス型のピークを効果的に探索し、ゼロの利用可能性を達成したが、PSROおよびPSRO rNは戦略の循環により失敗した。
  • コロンエル・ブロトゲームでは、D-PSROは3領域と10枚のコインを想定した10回の独立ゲームにおいて、PSROおよびPSRO rNと比較して一貫して低い利用可能性を示した。
  • ランダムに生成されたゼロ和正規形ゲームでは、多様性を考慮したα-PSROは、標準的なα-PSROが強い循環的行動を示すのと比較して、より多くの安定した自己整合的サイクル(SSCCs)を発見し、高いPCSスコアを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。