Skip to main content
QUICK REVIEW

[論文レビュー] Competing Against Equilibria in Zero-Sum Games with Evolving Payoffs

Adrian Rivera Cardoso, Jacob Abernethy|arXiv (Cornell University)|Jul 17, 2019
Game Theory and Applications参考文献 50被引用数 8
ひとこと要約

本稿では、変化する報酬行列を伴うオンライン行列ゲームのための新しいアルゴリズム、SP-RFTLを提案する。プレイヤーは長期平均報酬行列のナッシュ均衡(NE)に対して、NEレジストを最小化することを目的としている。本手法は、行動数に多対数的依存性を示しながらも、サブ線形なNEレジストを達成し、GANの学習において、Unrolled GAN や WGAN といったベースラインを上回る性能を示した。

ABSTRACT

We study the problem of repeated play in a zero-sum game in which the payoff matrix may change, in a possibly adversarial fashion, on each round; we call these Online Matrix Games. Finding the Nash Equilibrium (NE) of a two player zero-sum game is core to many problems in statistics, optimization, and economics, and for a fixed game matrix this can be easily reduced to solving a linear program. But when the payoff matrix evolves over time our goal is to find a sequential algorithm that can compete with, in a certain sense, the NE of the long-term-averaged payoff matrix. We design an algorithm with small NE regret--that is, we ensure that the long-term payoff of both players is close to minimax optimum in hindsight. Our algorithm achieves near-optimal dependence with respect to the number of rounds and depends poly-logarithmically on the number of available actions of the players. Additionally, we show that the naive reduction, where each player simply minimizes its own regret, fails to achieve the stated objective regardless of which algorithm is used. We also consider the so-called bandit setting, where the feedback is significantly limited, and we provide an algorithm with small NE regret using one-point estimates of each payoff matrix.

研究の動機と目的

  • 提示された報酬行列の平均値のミニマックス最適値に、両プレイヤーの長期的報酬が後悔的に近づくような逐次的アルゴリズムを設計すること。
  • 標準のレジスト最小化がNEレジスト制御を達成できない、繰り返しゼロサムゲームにおける敵対的変化する報酬行列の課題に対処すること。
  • 行動数に多対数的依存性を示し、ラウンド数に線形依存性を示すサブ線形NEレジストを達成するアルゴリズムの開発。
  • 1点報酬推定を用いて、バンドイットフィードバック設定へのフレームワークの拡張。
  • GAN学習における実証的妥当性の検証を通し、モードカバレッジとサンプル品質の向上を示すこと。

提案手法

  • 個々のレジスト最小化アルゴリズムの反復を固定区間ごとに平均化する、共同戦略更新ルールであるSP-RFTL(半パラメトリック正則化フォローザレディーレディ)を提案する。
  • 正則化フレームワークを用いて、個々の報酬行列が敵対的に変化しても、平均報酬行列のNEに収束することを保証する。
  • バンドイット設定では、完全なフィードバックを近似するために報酬行列の1点推定を用い、限られた情報のもとでNEレジスト最小化を可能にする。
  • 生成モデルと識別モデルの損失をミニバッチで近似し、固定区間ごとに反復を平均化することで、GAN学習に本手法を適用する。
  • オンライン凸最適化(OCO)の原則に従い、双対平均アプローチを用いて、完全フィードバックおよびバンドイットフィードバックの両設定で低レジストを維持する。
  • 単純な個別レジスト最小化では、サブ線形NEレジストを達成できないことを証明し、共同戦略設計の必要性を示す。

実験結果

リサーチクエスチョン

  • RQ1変化する報酬行列を伴うオンラインゼロサムゲームにおいて、共同戦略がサブ線形なナッシュ均衡レジストを達成できるか?
  • RQ2この設定において、標準的な個別レジスト最小化がなぜNEレジスト制御を保証できないのか?
  • RQ31点報酬推定のみを用いたバンドイットフィードバック設定でも、サブ線形NEレジストを達成できるか?
  • RQ4提案手法は、既存のGAN学習手法と比較して、モードカバレッジおよびサンプル品質の点で優れているか?
  • RQ5非定常設定において、オンライン学習アルゴリズムを平均報酬行列のNEに競わせる、原理的かつ整合的な手法は存在するか?

主な発見

  • SP-RFTLは、行動数に多対数的依存性、ラウンド数に線形依存性を示しながらも、最適な境界に対数要因を除き一致するサブ線形NEレジストを達成する。
  • 8つのガウス分布の混合を学習する際、Unrolled GAN や WGAN より顕著に優れた性能を示し、真の分布をより速く学習し、モード崩壊を回避する。
  • いかなる基礎となるアルゴリズムを用いようと、単純な個別レジスト最小化では、サブ線形NEレジストを達成できないことが判明し、共同戦略設計の必然性が示された。
  • SP-RFTLのバンドイット版は、1点報酬推定のみを用いてもサブ線形NEレジストを達成でき、限られたフィードバック設定への応用を可能にする。
  • 実験結果から、固定回数ごとに反復を平均化すること(SP-RFTLの中心的特徴)が、モード崩壊を防止し、GAN学習の安定性を向上させることを示した。
  • 本手法は敵対的報酬行列の系列に対してもロバストであり、ラウンドごとに行列が任意に変化しても低レジストを維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。