Skip to main content
QUICK REVIEW

[論文レビュー] Regret Minimization in Behaviorally-Constrained Zero-Sum Games

Gabriele Farina, Christian Kroer|arXiv (Cornell University)|Nov 9, 2017
Economic theories and models被引用数 9
ひとこと要約

本稿は、行動制約付き零和の広範形式ゲームにおけるレジット最小化フレームワークを導入し、Trembling-hand行動をモデル化する摂動を扱えるようにCFR+アルゴリズムを拡張する。状態別最良のナッシュ均衡ソルバーと同等の収束速度を達成するとともに、特に広範形式完全均衡(extensive-form perfect equilibria)の観点で著しく優れた均衡の精錬特性を示す。

ABSTRACT

No-regret learning has emerged as a powerful tool for solving extensive-form games. This was facilitated by the counterfactual-regret minimization (CFR) framework, which relies on the instantiation of regret minimizers for simplexes at each information set of the game. We use an instantiation of the CFR framework to develop algorithms for solving behaviorally-constrained (and, as a special case, perturbed in the Selten sense) extensive-form games, which allows us to compute approximate Nash equilibrium refinements. Nash equilibrium refinements are motivated by a major deficiency in Nash equilibrium: it provides virtually no guarantees on how it will play in parts of the game tree that are reached with zero probability. Refinements can mend this issue, but have not been adopted in practice, mostly due to a lack of scalable algorithms. We show that, compared to standard algorithms, our method finds solutions that have substantially better refinement properties, while enjoying a convergence rate that is comparable to that of state-of-the-art algorithms for Nash equilibrium computation both in theory and practice.

研究の動機と目的

  • 大規模な零和広範形式ゲームにおける均衡の精錬を計算するためのスケーラブルなアルゴリズムの欠如に応えること。
  • ナッシュ均衡が確率がゼロの情報集合におけるパフォーマンスに保証を提供しないという根本的限界を克服すること。
  • 各情報集合における戦略単体への線形制約をサポートするレジット最小化フレームワークを構築すること。
  • 行動的摂動を用いて近似的広範形式完全均衡(EFPEs)の計算を可能にすること。
  • 標準のCFR+およびEGTアルゴリズムと同等の収束速度を維持しながら、精錬品質を向上させること。

提案手法

  • レジットマッチング+(RM+)を、特に各情報集合における線形制約付き単体を含む有限生成凸ポリトープ上でも動作可能に拡張する。
  • 行動的制約付きゲームを、各情報集合における混合戦略への線形制約を備えた広範形式ゲームとしてモデル化する。
  • 摂動戦略空間の基本行列表現を用いてレジット最小化を適用し、摂動確率から導かれる逆行列を用いる。
  • 元の摂動なしゲームにおける純粋行動に対する即時のレジットを計算し、それを摂動ベースへのレジット更新に変換することで、計算オーバーヘッドを回避する。
  • レジット更新と摂動に配慮した戦略更新を統合した修正版CFR+アルゴリズムを用い、標準CFR+と同等の収束速度を維持する。
  • ゲームツリー全体にわたる対戦的価値の計算とレジットの更新を、摂動項を含むレジット更新ルールに統合した再帰的走査メカニズムを採用する。

実験結果

リサーチクエスチョン

  • RQ1広範形式ゲームにおける戦略単体への線形制約を扱えるように、レジット最小化を拡張できるか?
  • RQ2提案手法は、標準のCFR+と比較して、均衡の精錬においてより速い収束速度と優れた精錬特性を達成できるか?
  • RQ3行動的摂動をCFRフレームワークに体系的に統合し、近似的広範形式完全均衡(EFPE)の計算を可能にできるか?
  • RQ4提案アルゴリズムの収束速度は、CFR+ や EGT といった最先端のアルゴリズムと同等か?
  • RQ5得られた戦略は、確率がゼロの情報集合における相手の誤りに対して、どの程度優れたロバストネスを示すか?

主な発見

  • 提案アルゴリズムは、摂動ありおよび摂動なしの両方のゲームにおいて、標準CFR+およびEGTアルゴリズムと同等の収束速度を達成する。
  • 本手法は、特に広範形式完全均衡(EFPE)近似の観点で、標準CFR+と比較して桁違いに優れた精錬特性を持つ戦略を生成する。
  • レジット更新メカニズムにより、摂動なしゲームにおける純粋行動のレジットに基づいてレジットを表現することで、非効率な計算オーバーヘッドを回避する。
  • 行動的制約がさらなる進捗を制限しても、収束が維持されることから、制約の飽和に対してもロバストであることが示された。
  • 行動的摂動と近似的EFPEとの間の明確な理論的関係をフレームワークが確立し、手法の妥当性を理論的に裏付けた。
  • 実験的結果から、摂動を加えたCFR+の変種が、標準CFR+よりも精錬品質に優れており、実用的な収束速度を維持していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。