Skip to main content
QUICK REVIEW

[論文レビュー] No-Regret Learning Dynamics for Extensive-Form Correlated Equilibrium

Andrea Celli, Alberto Marchesi|arXiv (Cornell University)|Apr 1, 2020
Advanced Bandit Algorithms Research参考文献 32被引用数 16
ひとこと要約

本稿では、完全記憶を備えた一般和n人極形式ゲームにおいて、最初の非結合的でレギュレートなし学習ダイナミクスとして、広範な形式相関均衡(EFCE)に収束するICFRを導入する。トリガー正規誤差を定義し、各情報集合で局所的に分解することで、効率的で分散型の学習が可能となり、高確率で漸近的にEFCEに到達する。これは、ハートとマス・コレイユの正規形式結果を、逐次的かつ完全情報ではないゲームに一般化したものである。

ABSTRACT

The existence of simple, uncoupled no-regret dynamics that converge to correlated equilibria in normal-form games is a celebrated result in the theory of multi-agent systems. Specifically, it has been known for more than 20 years that when all players seek to minimize their internal regret in a repeated normal-form game, the empirical frequency of play converges to a normal-form correlated equilibrium. Extensive-form (that is, tree-form) games generalize normal-form games by modeling both sequential and simultaneous moves, as well as private information. Because of the sequential nature and presence of partial information in the game, extensive-form correlation has significantly different properties than the normal-form counterpart, many of which are still open research directions. Extensive-form correlated equilibrium (EFCE) has been proposed as the natural extensive-form counterpart to normal-form correlated equilibrium. However, it was currently unknown whether EFCE emerges as the result of uncoupled agent dynamics. In this paper, we give the first uncoupled no-regret dynamics that converge to the set of EFCEs in $n$-player general-sum extensive-form games with perfect recall. First, we introduce a notion of trigger regret in extensive-form games, which extends that of internal regret in normal-form games. When each player has low trigger regret, the empirical frequency of play is close to an EFCE. Then, we give an efficient no-trigger-regret algorithm. Our algorithm decomposes trigger regret into local subproblems at each decision point for the player, and constructs a global strategy of the player from the local solutions at each decision point.

研究の動機と目的

  • 非結合的でノーレギュレート学習ダイナミクスが、一般和極形式ゲームにおいてEFCEに収束できるかどうかの理解のギャップを埋めること。
  • 正規形式ゲームからの画期的なノーレギュレート収束結果を、より複雑な逐次的かつ完全情報ではないゲームの設定に拡張すること。
  • トリガー正規誤差を最小化し、調整やグローバル知識を必要とせずにEFCEへの収束を保証する、効率的で分散型の学習アルゴリズムを開発すること。
  • EFCEに対する有限時間内での高確率収束バウンドを提供することにより、従来のほとんど確実な収束結果を強化すること。

提案手法

  • 極形式ゲームに特化したトリガー正規誤差の新概念を導入し、正規形式ゲームにおける内部正規誤差を一般化する。
  • 各プレイヤーの情報集合におけるトリガー正規誤差を局所的な部分問題に分解し、分散計算を可能にする。
  • 各情報集合における正規誤差最小化器からの局所的解を統合して、グローバル戦略を構築する。
  • 各情報集合で内部正規誤差と外部正規誤差最小化器を組み合わせ、トリガー正規誤差を制御する。
  • 1ラウンドごとに1つの正規誤差最小化器を使用するように学習プロセスを調整し、グローバル収束を維持する。
  • アルゴリズムをφ正規誤差最小化フレームワーク内に組み込むことで、理論的保証を統一的かつ強化する。

実験結果

リサーチクエスチョン

  • RQ1非結合的でノーレギュレート学習ダイナミクスは、完全記憶を備えたn人一般和極形式ゲームにおいてEFCEに収束できるか?
  • RQ2極形式ゲームの逐次的かつ完全情報ではない設定において、内部正規誤差はどのように一般化できるか?
  • RQ3トリガー正規誤差を最小化し、EFCEへの収束を保証する分散型で効率的なアルゴリズムを設計することは可能か?
  • RQ4このようなダイナミクス下で、EFCEに対する有限時間収束保証はどのように提供できるか?

主な発見

  • ICFRは、プレーの経験的周波数が極限でEFCEにほとんど確実に収束することを保証する。
  • 本稿は、会議版の漸近的保証に比べて顕著な改善をもたらす、EFCEに対する高確率の有限時間収束バウンドを提供する。
  • 9,000を超える情報集合と2ベット制限を有する複雑なLeducポーカーインスタンスにおいて、ICFRは9時間未満でε-EFCEに到達し、24時間でε=0.1に到達できなかった先行手法を上回る。
  • EFCE、EFCCE、NFCCEの各場合において、逸脱するインcentiveの収束速度が類似しており、ICFRが相関均衡解概念全体にわたって堅牢であることを示している。
  • 本手法は、ハートとマス・コレイユのノーレギュレートダイナミクスを逐次的ケースに一般化し、学習ダイナミクスと極形式ゲームにおける相関均衡の間の基盤的リンクを確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。