Skip to main content
QUICK REVIEW

[論文レビュー] Learning Nash Equilibrium for General-Sum Markov Games from Batch Data

Julien Pérolat, Florian Strub|arXiv (Cornell University)|Jun 28, 2016
Game Theory and Applications被引用数 28
ひとこと要約

本稿では、関数近似を用いてバッチデータから一般和マルコフゲームにおけるǫ-ナッシュ均衡を学習するための新規手法を提案する。弱いǫ-ナッシュ均衡の概念を導入し、2つのベルマンに類似した残差のLpノルムを最小化することで、その均衡への収束を保証することを証明した。その後、価値関数と方策を同時に学習するニューラルネットワークアーキテクチャ(NashNetwork)を用いて、複数プレイヤー設定において安定的かつスケーラブルな学習を実現した。合成Garnetゲームにおける実証的評価を通じて有効性を検証した。

ABSTRACT

This paper addresses the problem of learning a Nash equilibrium in $\gamma$-discounted multiplayer general-sum Markov Games (MG). A key component of this model is the possibility for the players to either collaborate or team apart to increase their rewards. Building an artificial player for general-sum MGs implies to learn more complex strategies which are impossible to obtain by using techniques developed for two-player zero-sum MGs. In this paper, we introduce a new definition of $\epsilon$-Nash equilibrium in MGs which grasps the strategy's quality for multiplayer games. We prove that minimizing the norm of two Bellman-like residuals implies the convergence to such an $\epsilon$-Nash equilibrium. Then, we show that minimizing an empirical estimate of the $L_p$ norm of these Bellman-like residuals allows learning for general-sum games within the batch setting. Finally, we introduce a neural network architecture named NashNetwork that successfully learns a Nash equilibrium in a generic multiplayer general-sum turn-based MG.

研究の動機と目的

  • 環境のダイナミクスと報酬が未知である状況下で、複数プレイヤー参加の一般和マルコフゲームにおけるナッシュ均衡を学習する課題に取り組む。
  • 従来の手法が一般和設定で失敗する問題を克服するため、弱いǫ-ナッシュ均衡の概念を導入する。
  • 表形式手法が失敗する大規模な状態空間へスケーリングするため、バッチ設定における関数近似を可能にする。
  • 全プレイヤーの価値関数と方策を統合的に最適化する深層学習フレームワークを構築する。
  • 合成的で決定論的なマルコフゲームにおいて、プレイヤー数の変動にわたるスケーラビリティとロバストネスを実証する。

提案手法

  • 複数プレイヤー参加の一般和マルコフゲームに特化した弱いǫ-ナッシュ均衡の新定義を導入する。
  • 価値関数の一貫性と方策の最適性の両方を表す2つのベルマンに類似した残差を定義し、それらの共同最小化がǫ-ナッシュ均衡への収束を保証することを示す。
  • バッチデータを用いてこれらの残差の経験的Lpノルムを定式化し、オンライン相互作用なしにオフポリシー学習を可能にする。
  • 各プレイヤーごとに共有されたQネットワークと方策ネットワークを備えた新規なニューラルネットワークアーキテクチャ、NashNetworkを提案する。活性化関数にはReLUとソフトマックスを用いる。
  • トレーニングとテストセットの両方で、経験的ベルマン残差ノルムを最小化するように、AdamGradを用いてネットワークを訓練する。学習率と正則化係数はプレイヤーごとに別々に設定する。
  • 一般化とスケーラビリティの評価のため、合成Garnet環境では2値状態符号化と円形報酬関数を用いる。

実験結果

リサーチクエスチョン

  • RQ1一般和マルチプレイヤー・マルコフゲームにおいて、弱いǫ-ナッシュ均衡を形式的に定義・特徴づけることができるか?
  • RQ22つのベルマンに類似した残差の和を最小化することで、そのようなゲームにおいて弱いǫ-ナッシュ均衡への収束が保証されるか?
  • RQ3関数近似をバッチデータと効果的に組み合わせることで、大規模マルチプレイヤー・マルコフゲームにおけるナッシュ均衡を学習可能か?
  • RQ4提案されたNashNetworkアーキテクチャは、合成環境における異なるプレイヤー数にわたってどのようにスケーリングするか?
  • RQ5経験的ベルマン残差ノルムと実際の最良応答誤差との相関度合いは、均衡の質をどの程度示しているか?

主な発見

  • 本手法は、バッチデータのみを用いてマルチプレイヤー一般和マルコフゲームにおける弱いǫ-ナッシュ均衡を効果的に学習し、トレーニングおよびテスト指標において収束が観測された。
  • すべてのプレイヤーにおいて「誤差 vs 最良応答」指標がほぼゼロに低下し、1人のプレイヤーが戦略を単独で変更しても、平均して報酬が8%未満しか向上しないことを示した。
  • 戦略の質はプレイヤー間で良好にバランスが取れており、状態空間全体で標準偏差が5ポイント未満に保たれ、一貫性のあるパフォーマンスを示した。
  • ニューラルネットワークは2人から5人までのプレイヤー数にわたって効果的にスケーリングされ、戦略の質が類似した水準を維持した。プレイヤー数の増加に対してもロバストであることが示された。
  • 経験的ベルマン残差ノルムが「誤差 vs 最良応答」指標と並行して減少したため、トレーニング目的関数が均衡の質と整合していることが確認された。
  • データが不足している場合、過学習が観測された。収束には多数のサンプルが必要であり、本手法のデータ効率性は依然として課題であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。