[論文レビュー] Hedging in games: Faster convergence of external and swap regrets
本稿では、ブーム=マウンサーの外部的から内部的レジームへの還元法と、オプティミスティック・ヘッジを組み合わせた、BM-Optimistic-Hedgeと呼ばれる新しいアルゴリズムを紹介する。このアルゴリズムは、複数プレイヤーのゲームにおける相関均衡への収束をより速く実現する。本稿では、交換レジームの減少率が $ O(m^{1/2}(n\log n/T)^{3/4}) $ であることを証明し、従来の $ O(\sqrt{n\log n/T}) $ の境界を著しく改善した。また、2人ゲームにおけるオプティミスティック・ヘッジは、$ O(1/T^{5/6}) $ のレジーム減少率を達成し、以前の $ O(1/T^{3/4}) $ よりも向上している。一方、バニラ・ヘッジは $ O(1/\sqrt{T}) $ を超えることはできず、これは未解決の問題を解決するものである。
We consider the setting where players run the Hedge algorithm or its optimistic variant to play an $n$-action game repeatedly for $T$ rounds. 1) For two-player games, we show that the regret of optimistic Hedge decays at $ ilde{O}( 1/T ^{5/6} )$, improving the previous bound $O(1/T^{3/4})$ by Syrgkanis, Agarwal, Luo and Schapire (NIPS'15) 2) In contrast, we show that the convergence rate of vanilla Hedge is no better than $ ildeΩ(1/ \sqrt{T})$, addressing an open question posted in Syrgkanis, Agarwal, Luo and Schapire (NIPS'15). For general m-player games, we show that the swap regret of each player decays at rate $ ilde{O}(m^{1/2} (n/T)^{3/4})$ when they combine optimistic Hedge with the classical external-to-internal reduction of Blum and Mansour (JMLR'07). The algorithm can also be modified to achieve the same rate against itself and a rate of $ ilde{O}(\sqrt{n/T})$ against adversaries. Via standard connections, our upper bounds also imply faster convergence to coarse correlated equilibria in two-player games and to correlated equilibria in multiplayer games.
研究の動機と目的
- 繰り返しゲームにおけるレジーム最小化の収束速度を改善すること、特に複数プレイヤー設定における交換レジームの観点から。
- 繰り返しゲームにおいて、バニラ・ヘッジが $ O(1/\sqrt{T}) $ よりも速いレジーム収束を達成できるかどうかという未解決問題を解明すること。
- ブーム=マウンサーの還元法と組み合わせることで、複数プレイヤーゲームにおける交換レジームのより緊密な境界を確立すること。
- 改善されたレジーム境界を通じて、相関均衡へのより速い収束を示すこと。
- BM-Optimistic-Hedgeアルゴリズムが、敵対的環境に対しても頑健性を保ちつつ、より速い収束を達成できることを示すこと。
提案手法
- BM-Optimistic-Hedgeアルゴリズムは、オプティミスティック・ヘッジと、ブームとマウンサーによる外部的から内部的レジームへの還元法を組み合わせたものである。
- オプティミスティック・ヘッジのRVU(利得の変動に基づくレジーム)性質を活用し、個々のプレイヤーのレジームを制限する。
- 戦略軌道の変化を $ \ell_1 $-ノルムで評価し、コストベクトルの変化を $ \ell_\infty $-ノルムで制御する安定性の議論を用いる。
- マコフ連鎖の木定理を適用し、ヘッジによって誘発される遷移行列の微小な摂動に対する定常分布の感度を制御する。
- 戦略の移動と損失ベクトルの変化との関係を、軌道長の議論によって結びつけることで、より緊密なレジーム境界を導出する。
- [7] に記載されたフォルクロアのアルゴリズムに加え、オプティミスティック予測を組み合わせることで、第二の高速なノ・スワップ・レジームアルゴリズムを導出する。
実験結果
リサーチクエスチョン
- RQ1複数プレイヤーのゲームにおける交換レジームの収束速度は、標準的な $ O(\sqrt{n\log n/T}) $ の境界を超えて改善可能か?
- RQ22人ゲームにおけるオプティミスティック・ヘッジは、$ O(1/T^{3/4}) $ よりも速いレジーム減少率を達成できるか?
- RQ3繰り返しゲームにおけるバニラ・ヘッジは、敵対的環境で観察されるように、$ O(1/\sqrt{T}) $ よりも速いレジーム収束を達成できるか?
- RQ4オプティミスティック・ヘッジの戦略軌道は、ブーム=マウンサー還元法と組み合わせても、十分に安定しており、高速収束を可能にするか?
- RQ5近似的に低いレジームを持つスワップ・レジームなしアルゴリズムは、スムーズなゲームにおいて、近似的に最適な社会的効用への高速収束をもたらすか?
主な発見
- BM-Optimistic-Hedgeを用いた $ m $-プレイヤーのゲームにおいて、各プレイヤーの交換レジームは $ O(m^{1/2}(n\log n/T)^{3/4}) $ の速度で減少し、従来の $ O(\sqrt{n\log n/T}) $ の境界を改善した。
- 2人ゲームでは、オプティミスティック・ヘッジの平均レジームが $ O(1/T^{5/6}) $ で減少し、以前の $ O(1/T^{3/4}) $ の境界を上回った。
- バニラ・ヘッジは繰り返しゲームにおいて、$ O(1/\sqrt{T}) $ よりも速いレジーム減少を達成できないことが示され、シルグカニスら[27]の未解決問題が解決された。
- BM-Optimistic-Hedgeを使用するプレイヤーの経験的分布は、$ O(n\log n/\epsilon^{4/3}) $ ラウンドで $ \epsilon $-相関均衡に収束し、従来の $ O(n\log n/\epsilon^2) $ の境界を改善した。
- アルゴリズムは敵対的環境に対しても頑健性を保ち、BM-Optimistic-Hedgeとフォルクロア的・オプティミスティック変種が互いに相手と対戦しても、両者とも高速収束を達成した。
- スムーズなゲームでは、近似的に低いレジームを持つスワップ・レジームなしアルゴリズムを用いるプレイヤーの平均社会的効用が、$ O(1/T) $ の速度で近似的に最適値に収束した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。