Skip to main content
QUICK REVIEW

[論文レビュー] Online Game with Time-Varying Coupled Inequality Constraints

Min Meng, Xiuxian Li|arXiv (Cornell University)|Jun 28, 2023
Advanced Bandit Algorithms ResearchDecision Sciences被引用数 3
ひとこと要約

本稿では、時間変動する結合不等式制約を持つゲームに対する分散型オンライン学習アルゴリズムを提案する。ミラー降下法とプライマルデュアル更新を用いて、サブラインアクレジットと制約違反を達成する。強い単調性のもとで、変分一般化ナッシュ均衡への収束を証明し、バンドイットフィードバック設定への拡張も行う。

ABSTRACT

In this paper, online game is studied, where at each time, a group of players aim at selfishly minimizing their own time-varying cost function simultaneously subject to time-varying coupled constraints and local feasible set constraints. Only local cost functions and local constraints are available to individual players, who can share limited information with their neighbors through a fixed and connected graph. In addition, players have no prior knowledge of future cost functions and future local constraint functions. In this setting, a novel decentralized online learning algorithm is devised based on mirror descent and a primal-dual strategy. The proposed algorithm can achieve sublinearly bounded regrets and constraint violation by appropriately choosing decaying stepsizes. Furthermore, it is shown that the generated sequence of play by the designed algorithm can converge to the variational GNE of a strongly monotone game, to which the online game converges. Additionally, a payoff-based case, i.e., in a bandit feedback setting, is also considered and a new payoff-based learning policy is devised to generate sublinear regrets and constraint violation. Finally, the obtained theoretical results are corroborated by numerical simulations.

研究の動機と目的

  • 将来のコストやグローバル制約についての完全な情報がない分散型設定において、時間変動するコスト関数と結合制約を持つオンラインゲームに対処すること。
  • ローカルコスト関数、ローカル制約、固定連結グラフによる隣接プレイヤーとの通信にのみ依存する、部分情報下での分散型オンライン学習アルゴリズムの設計。
  • 時間変動する制約と限局的フィードバックの下で、サブラインアクレジットと制約違反に関する理論的保証の確立。
  • 勾配が利用できないが、報酬(関数値)情報のみが得られるバンドイットフィードバック設定へのフレームワークの拡張。
  • 強い単調性の仮定のもとで、生成された戦略列が変分一般化ナッシュ均衡(v-GNE)に収束することの証明。

提案手法

  • 時間変動する結合不等式制約とローカル実行可能集合を扱うために、ミラー降下法とプライマルデュアル戦略を組み合わせた、新規の分散型オンライン学習アルゴリズムを設計。
  • ステップサイズを徐々に減少させることで、アクレジットと制約違反のバランスを図り、時間とともにサブライン成長を保証。
  • 局所勾配推定とデュアル変数更新を組み合わせ、時間変動する制約を追跡。収束解析にはリャプノフ型関数と再帰的不等式を用いる。
  • バンドイットフィードバックの場合、単一観測からの勾配情報推定を可能にする新しい報酬ベースの学習方策を導入。勾配へのアクセスなしに、アクレジットと制約違反の境界を導出可能。
  • 主な構成要素には、ステップサイズの減少列(αₜ, βₜ, γₜ, δₜ)、デュアル変数の追跡、および条件付き期待値とリプシッツ連続性の仮定に基づく誤差分解が含まれる。
  • 理論的解析では、条件付き期待値を含む不等式と、勾配および制約関数推定誤差のバウンドを用い、調整パラメータの観点からアクレジットと違反バウンドを導出。

実験結果

リサーチクエスチョン

  • RQ1時間変動する結合制約と限局的フィードバックを伴うオンラインゲームにおいて、分散型オンライン学習アルゴリズムがサブラインアクレジットと制約違反を達成できるか?
  • RQ2時間変動する制約と将来コストに関する事前知識のない分散型オンラインゲームにおいて、プレイヤーはどのように変分一般化ナッシュ均衡(v-GNE)に収束できるか?
  • RQ3勾配が利用不可で関数値のみ観測可能なバンドイットフィードバック設定において、アルゴリズムの性能保証は何か?
  • RQ4減少するステップサイズは、提案アルゴリズムにおけるアクレジットと制約違反のトレードオフにどのように影響するか?
  • RQ5戦略列がv-GNEに収束する条件は何か?また、強い単調性はこの収束においてどのような役割を果たすか?

主な発見

  • 完全情報フィードバックのもとで、アクレジットは 𝒪(∑(δᵢ,ₜ + γₜ + αₜ/δᵢ,ₜ + αₜ/βₜ² + δₜ/βₜ) + 1/αₜ) で有界である。
  • 制約違反は 𝒪(∑(δₜ/βₜ) + (𝔼[R_g(T)])²/B₃(T)) で有界であり、R_g(T) は総制約違反を表す。
  • ステップサイズを αₜ = 𝒪(1/√t), βₜ = 𝒪(1/t), δₜ = 𝒪(1/t) と選ぶと、アクレジットと制約違反の両方が時間 T に対してサブラインで成長する。
  • 強い単調性のもとで、アルゴリズムが生成する戦略列は、元のゲームの変分一般化ナッシュ均衡(v-GNE)に収束する。
  • バンドイットフィードバック設定において、報酬ベースの学習方策は勾配へのアクセスなしにサブラインアクレジットと制約違反を達成する。
  • 数値シミュレーションは理論的結果を裏付け、時間経過とともに低アクレジットと低制約違反を達成できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。