Skip to main content
QUICK REVIEW

[論文レビュー] Discovering Multi-Agent Auto-Curricula in Two-Player Zero-Sum Games.

Xidong Feng, Oliver Slumbers|arXiv (Cornell University)|Jun 4, 2021
Sports Analytics and Performance参考文献 41被引用数 5
ひとこと要約

本稿では、二対零和ゲームにおけるマルチエージェント強化学習のためのメタ勾配降下フレームワークであるLMACを提案する。この手法は、人為的なゲーム理論的設計を必要とせず、相手選択およびベストリスポンス更新ルールを自動で発見する。人為的に設計されたルールが不要な一方で、スキルゲーム、ラッキーロト、マッチングペニー、クーンポーカー、レデュックポーカーにおいて、最先端の性能を達成または上回る。

ABSTRACT

When solving two-player zero-sum games, multi-agent reinforcement learning (MARL) algorithms often create populations of agents where, at each iteration, a new agent is discovered as the best response to a mixture over the opponent population. Within such a process, the update rules of who to compete (i.e., the opponent mixture) and how to beat them (i.e., finding best responses) are underpinned by manually developed game theoretical principles such as fictitious play and Double Oracle. In this paper we introduce a framework, LMAC, based on meta-gradient descent that automates the discovery of the update rule without explicit human design. Specifically, we parameterise the opponent selection module by neural networks and the best-response module by optimisation subroutines, and update their parameters solely via interaction with the game engine, where both players aim to minimise their exploitability. Surprisingly, even without human design, the discovered MARL algorithms achieve competitive or even better performance with the state-of-the-art population-based game solvers (e.g., PSRO) on Games of Skill, differentiable Lotto, non-transitive Mixture Games, Iterated Matching Pennies, and Kuhn Poker. Additionally, we show that LMAC is able to generalise from small games to large games, for example training on Kuhn Poker and outperforming PSRO on Leduc Poker. Our work inspires a promising future direction to discover general MARL algorithms solely from data.

研究の動機と目的

  • 二対零和ゲームにおけるマルチエージェント強化学習のための相手選択およびベストリスポンス更新ルールの自動発見を実現すること。
  • 集団ベースのMARLにおいて、架空のプレイやダブルオラクルといった人為的に設計されたゲーム理論的原則への依存を排除すること。
  • ゲーム環境との相互作用から直接学習するデータ駆動型フレームワークを構築し、効果的なMARLアルゴリズムを学習すること。
  • 小規模なゲーム(例:クーンポーカー)から大規模なゲーム(例:レデュックポーカー)への学習アルゴリズムの一般化を可能にすること。

提案手法

  • 相手選択モジュールをニューラルネットワークでパrameter化し、ベストリスポンスモジュールを最適化サブルーチンで表現する。
  • 両モジュールを、ゲームエンジンとの相互作用のみを用いてメタ勾配降下で訓練する。両エージェントが不正利用可能性を最小化するようにする。
  • エンドツーエンドの微分可能訓練により、相手混合とベストリスポンス方策を同時に最適化する。
  • 外側のループで相手を選択し、内側のループでベストリスポンスを計算する二段階最適化問題として学習プロセスを定式化する。
  • ベストリスポンス方策のパフォーマンスに基づいて、相手選択方策に対する勾配ベースの更新を適用する。
  • 小規模なゲームで事前学習し、大規模なゲームで微調整することで一般化を実現する。例えば、クーンポーカーからレデュックポーカーへの転移を可能にする。

実験結果

リサーチクエスチョン

  • RQ1データ駆動型フレームワークは、人為的に設計されたゲーム理論的原則が不要な状況でも、効果的な相手選択およびベストリスポンス更新ルールを自動で発見できるか?
  • RQ2PSROのような最先端の集団ベースのソルバーと比較して、発見されたLMACアルゴリズムの性能は、多様な二対零和ゲームにおいてどの程度優れているか?
  • RQ3LMACは、小規模なゲーム(例:クーンポーカー)から大規模でより複雑なゲーム(例:レデュックポーカー)への一般化がどの程度可能か?
  • RQ4LMACに明示的なゲーム理論的設計原則が欠如している場合、既存の手法と比較して、不正利用可能性の最小化が競争的または優れているとされるか?

主な発見

  • LMACは、スキルゲーム、微分可能なロト、非推移的混合ゲーム、繰り返しマッチングペニー、クーンポーカーにおいて、PSROと同等または優れた性能を達成する。
  • フレームワークはクーンポーカーからレデュックポーカーへの一般化に成功し、小規模なゲームでのみ学習したにもかかわらず、より大きなゲームでPSROを上回る。
  • LMACは、架空のプレイやダブルオラクルといった人為的に設計されたゲーム理論的メカニズムに依存せずに、効果的なMARL更新ルールを発見する。
  • LMACで学習されたアルゴリズムは低い不正利用可能性を示し、零和設定における強い戦略的収束性を示している。
  • メタ勾配降下の使用により、ゲームとの相互作用からのみ、相手選択およびベストリスポンス方策のエンドツーエンド学習が可能である。
  • 非推移的かつ微分可能なゲームを含む多様なゲームタイプにおいて、フレームワークは強固な性能を示しており、広範な適用可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。