Skip to main content
QUICK REVIEW

[論文レビュー] Calibration of Shared Equilibria in General Sum Partially Observable Markov Games

Nelson Vadori, Sumitra Ganesh|arXiv (Cornell University)|Jun 23, 2020
Game Theory and Applications参考文献 32被引用数 6
ひとこと要約

本稿では、パラメータ共有ポリシーを用いた一般和部分的に観測可能なマルコフゲームにおける対称的純ナッシュ均衡としての共有均衡(Shared equilibrium)を導入し、自己対戦による収束を証明する。一般和部分的に観測可能なマルコフゲームにおけるパラメータ共有ポリシーを用いた自己対戦による収束を証明する。本稿では、ポリシーネットワークとRLキャリブレータを同時に学習する二重強化学習(dual-RL)アルゴリズムCAL-SHEQを提案し、エージェントタイプ分布を滑らかにキャリブレートすることで、ベイズ最適化を上回る安定的かつ高精度な収束を実現し、実世界の行動的目標に一致させる。

ABSTRACT

Training multi-agent systems (MAS) to achieve realistic equilibria gives us a useful tool to understand and model real-world systems. We consider a general sum partially observable Markov game where agents of different types share a single policy network, conditioned on agent-specific information. This paper aims at i) formally understanding equilibria reached by such agents, and ii) matching emergent phenomena of such equilibria to real-world targets. Parameter sharing with decentralized execution has been introduced as an efficient way to train multiple agents using a single policy network. However, the nature of resulting equilibria reached by such agents has not been yet studied: we introduce the novel concept of Shared equilibrium as a symmetric pure Nash equilibrium of a certain Functional Form Game (FFG) and prove convergence to the latter for a certain class of games using self-play. In addition, it is important that such equilibria satisfy certain constraints so that MAS are calibrated to real world data for practical use: we solve this problem by introducing a novel dual-Reinforcement Learning based approach that fits emergent behaviors of agents in a Shared equilibrium to externally-specified targets, and apply our methods to a n-player market example. We do so by calibrating parameters governing distributions of agent types rather than individual agents, which allows both behavior differentiation among agents and coherent scaling of the shared policy network to multiple agents.

研究の動機と目的

  • 一般和部分的に観測可能なマルコフゲームにおける共有ポリシーを用いるエージェントが到達する均衡のゲーム理論的性質を形式的に特徴づけること。
  • 取引頻度や市場シェア制約などの外部から指定された実世界の目標に、出現するマルチエージェント行動をキャリブレートする課題に対処すること。
  • 繰り返し訓練サイクルを回避するため、エージェントタイプ(スーパータイプ)分布のパラメータを同時に学習するポリシーネットワークとRLベースのキャリブレータを統合した、効率的でスケーラブルな手法を開発すること。
  • 滑らかなパラメータ更新を用いた二時刻スケールの確率的近似フレームワークを導入することで、均衡の安定的収束を保証すること。

提案手法

  • 一般和部分的に観測可能なマルコフゲームにおける対称的純ナッシュ均衡としての共有均衡(Shared equilibrium)を、関数形式ゲーム(Functional Form Game, FFG)の枠組みで導入し、特定のゲーム条件の下で自己対戦による収束を証明する。
  • 共有ポリシーを学習するポリシーネットワークと、エージェントタイプ(スーパータイプ)分布を制御するパラメータを最適化する別個のRLキャリブレータを備えた、二重強化学習(dual-RL)フレームワークであるCAL-SHEQを提案する。
  • 個々のエージェントではなく、スーパータイププロファイル(例:接続性、在庫耐性)を調整することでシステムをキャリブレートし、一貫性のあるスケーリングと行動の差別化を可能にする。
  • キャリブレータでは、取引数量の百分位数や市場シェアを外部目標に一致させるなどの部分的目標を含む重み付き報酬関数を用いる。
  • 二時刻スケールの確率的近似を採用:ポリシーネットワークは速く更新され、キャリブレータは遅く更新され、均衡が安定するまでの時間を確保する。
  • n人プレイヤーの市場シミュレーションに本手法を適用し、異なるスーパータイプの商人が共有ポリシーと目標制約の下で相互作用する。

実験結果

リサーチクエスチョン

  • RQ1一般和部分的に観測可能なマルコフゲームにおいて、異なるタイプのエージェントが共有ポリシーを用いる場合、その均衡のゲーム理論的性質は何か?
  • RQ2このようなマルチエージェントシステムにおける出現的行動を、取引頻度や市場シェアといった実世界の制約にキャリブレートする方法は何か?
  • RQ3繰り返し訓練サイクルを回避しつつ、キャリブレートされた均衡への安定的収束を保証するための統合学習フレームワークを設計できるか?
  • RQ4個々のエージェントパラメータではなく、スーパータイプ分布をキャリブレートすることのスケーラビリティと行動の一貫性という観点での利点は何か?

主な発見

  • CAL-SHEQは、ベイズ最適化を上回る収束速度と安定性を示し、取引数量の百分位数や市場シェアといった目標指標のキャリブレーションが滑らかで高精度に実現された。
  • CAL-SHEQのRLキャリブレータは、エージェントが新しいスーパータイププロファイルに適応する十分な時間を確保することで、負の報酬を回避し、平均報酬をより高く達成した。ベイズ最適化とは異なり、負の報酬を回避した。
  • CAL-SHEQでは、接続性や在庫耐性などのスーパータイプパラメータが滑らかに更新され、ベイズ最適化のベースラインで観察された不安定さや報酬の発散を防止した。
  • 本手法は、実世界の目標(例:スーパータイプ1の10百分位数取引数が8)に商人エージェントタイプの分布を高精度かつ低分散でキャリブレートすることに成功した。
  • 複数の実験において収束が安定的かつ強固であり、CAL-SHEQは異なるスーパータイプ設定(例:2-2-2-3 および 3-4-5-5)において一貫した性能を示した。
  • 二時刻スケールフレームワークにより、キャリブレータが新たな調整を加える前に均衡が確実に達成されるようになり、信頼性の高い一貫性のあるポリシー適応が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。