[論文レビュー] Policy Regret in Repeated Games
本稿は、適応的敵対者との繰り返しゲームにおいて、ポリシーの後悔を性能指標として導入し、no-policy regretアルゴリズムが新たな均衡概念であるポリシー均衡に収束することを示している。自己利益志向のゲーム設定において、no-external regretとno-policy regretが両立可能であり、かつ、no-external regretから得られる粗い協調均衡(coarse correlated equilibria)がポリシー均衡の真の部分集合であることを証明しており、ゲーム理論的オンライン学習においてポリシー後悔はより強力で洗練された解概念であることを示している。
The notion of \emph{policy regret} in online learning is a well defined? performance measure for the common scenario of adaptive adversaries, which more traditional quantities such as external regret do not take into account. We revisit the notion of policy regret and first show that there are online learning settings in which policy regret and external regret are incompatible: any sequence of play that achieves a favorable regret with respect to one definition must do poorly with respect to the other. We then focus on the game-theoretic setting where the adversary is a self-interested agent. In that setting, we show that external regret and policy regret are not in conflict and, in fact, that a wide class of algorithms can ensure a favorable regret with respect to both definitions, so long as the adversary is also using such an algorithm. We also show that the sequence of play of no-policy regret algorithms converges to a \emph{policy equilibrium}, a new notion of equilibrium that we introduce. Relating this back to external regret, we show that coarse correlated equilibria, which no-external regret players converge to, are a strict subset of policy equilibria. Thus, in game-theoretic settings, every sequence of play with no external regret also admits no policy regret, but the converse does not hold.
研究の動機と目的
- 適応的敵対者に対するオンライン学習において、ポリシー後悔と外部後悔の両立可能性を分析すること。
- no-policy regretアルゴリズムの極限として定義・特徴づける新しい均衡概念、ポリシー均衡を定義すること。
- 自己利益志向のゲーム設定において、両プレイヤーがそのようなアルゴリズムを使用する場合、no-external regretとno-policy regretの両方が同時に達成可能であることを示すこと。
- 粗い協調均衡がポリシー均衡の真の部分集合であることを確立し、ポリシー後悔が解概念として優れていることを示すこと。
提案手法
- オンライン戦略を固定行動戦略と比較するベンチマークとしてポリシー後悔を提案し、プレイヤー自身の行動とは独立して定義する。
- no-policy regretアルゴリズムが生成する系列の極限点としてポリシー均衡の概念を導入する。
- 記憶制限付き敵対者に対する行動系列の進化をマークフ・チェーンモデルで表現する。
- ミニバッチ還元技術を用いて、記憶制限下でno-external regretアルゴリズムをno-policy regretアルゴリズムに変換する。
- 戦略プロファイル上の分布的解析を用いて、ポリシー均衡への収束を証明する。
- 多プレイヤーゲームに一般化し、異なった記憶制限を持つプレイヤーを扱うフレームワークを拡張し、共同行動履歴上での一般化されたマルコフ過程を定義する。
実験結果
リサーチクエスチョン
- RQ1適応的敵対者を相手にした繰り返しゲームにおいて、no-policy regretとno-external regretは共存可能か?
- RQ2粗い協調均衡と新しいポリシー均衡の概念の関係は何か?
- RQ3no-policy regretアルゴリズムの行動系列は安定な結果に収束するか? もしそうなら、その性質は何か?
- RQ4ゲーム理論的設定において、ポリシー後悔は外部後悔よりも洗練された解概念と見なせるか?
- RQ5記憶制限付きの相手を相手にした一般の多プレイヤーゲームに対して、no-policy regretアルゴリズムを構築可能か?
主な発見
- 一般のオンライン学習設定では、ポリシー後悔と外部後悔は両立不可能であり、一方の測度でサブ線形後悔を達成する任意のアルゴリズムは、他方の測度で線形後悔を被る可能性がある。
- 自己利益志向のゲーム理論的設定において、両プレイヤーが両方の測度でサブ線形後悔を保証するアルゴリズムを使用する場合、no-external regretとno-policy regretの両方が同時に達成可能である。
- no-policy regretアルゴリズムの行動系列は、粗い協調均衡を一般化・洗練化した、新たな解概念であるポリシー均衡に収束する。
- 粗い協調均衡はポリシー均衡の真の部分集合であり、すべてのno-external regretの結果がポリシー均衡であるが、逆は成り立たない。
- 非対称な報酬を持つ2プレイヤーの例を通じて、no-policy regret戦略がno-external regret戦略よりも高い報酬を達成できることを示している。
- 粗い協調均衡でないがポリシー均衡である明示的な例を構築し、厳密な一般化性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。