Skip to main content
QUICK REVIEW

[論文レビュー] Nash Equilibrium Seeking in N-Coalition Games via a Gradient-Free Method

Yipeng Pang, Guoqiang Hu|arXiv (Cornell University)|Aug 29, 2020
Distributed Control Multi-Agent Systems参考文献 23被引用数 10
ひとこと要約

本稿では、プレイヤーが局所的コスト関数の明示的勾配にアクセスできないN連合非協力ゲームに対して、離散時間で勾配フリーなナッシュ均衡(NE)探索アルゴリズムを提案する。局所的ガウススムージングを用いた勾配推定と、連合レベルの勾配を集約するための局所的勾配トラッキングを用いることで、強い単調なゲーム写像のもとで、NEの近傍へ幾何的収束を達成し、誤差はステップサイズとスムージングパラメータによって上限が定められる。

ABSTRACT

This paper studies an $N$-coalition non-cooperative game problem, where the players in the same coalition cooperatively minimize the sum of their local cost functions under a directed communication graph, while collectively acting as a virtual player to play a non-cooperative game with other coalitions. Moreover, it is assumed that the players have no access to the explicit functional form but only the function value of their local costs. To solve the problem, a discrete-time gradient-free Nash equilibrium seeking strategy, based on the gradient tracking method, is proposed. Specifically, a gradient estimator is developed locally based on Gaussian smoothing to estimate the partial gradients, and a gradient tracker is constructed locally to trace the average sum of the partial gradients among the players within the coalition. With a sufficiently small constant step-size, we show that all players' actions approximately converge to the Nash equilibrium at a geometric rate under a strongly monotone game mapping condition. Numerical simulations are conducted to verify the effectiveness of the proposed algorithm.

研究の動機と目的

  • プレイヤーが自身の局所的コスト関数の明示的勾配情報にアクセスできないN連合非協力ゲームに対処すること。
  • モデル知識を必要とせず、分散的かつ離散時間で動作するアルゴリズムを構築し、プレイヤーがナッシュ均衡に収束できること。
  • 真のNEの近傍への収束を保証し、誤差の定量的上限を提供すること。
  • 従来、分散最適化に用いられてきた勾配トラッキング手法を、非協力ゲームにおけるナッシュ均衡探索の文脈へ拡張すること。

提案手法

  • 各プレイヤーのコスト関数の偏微分勾配を、関数値測定のみからガウススムージングを用いて局所的に推定する勾配推定器を構築する。
  • 各プレイヤーは、自身の連合内での平均勾配の局所的推定値を、勾配トラッキング機構を用いて維持する。
  • 定常ステップサイズを用いることで幾何的収束を保証し、プレイヤーはトラッキングされた勾配情報をもとに自身の行動を更新する。
  • 報酬ベース最適化技術とゲーム理論的均衡探索を統合し、有向通信グラフ上でも分散実装が可能となる。
  • 各連合内のプレイヤーは、自身の局所的コストの和を最小化するために協力し、他の連合と非協力的ゲームを展開する1つの仮想プレイヤーとして機能する。
  • 滑らかでないコスト関数に対しても対応可能であり、ガウススムージングのロバスト性を活用する。

実験結果

リサーチクエスチョン

  • RQ1関数値のみにアクセス可能な勾配フリーで離散時間のアルゴリズムが、N連合非協力ゲームにおいてナッシュ均衡に幾何的収束を達成できるか。
  • RQ2ガウススムージングと勾配トラッキングの組み合わせが、勾配情報が限られたゲームにおいて収束性をどのように向上させるか。
  • RQ3ステップサイズとスムージングパラメータが、ナッシュ均衡近似の精度に与える影響は何か。
  • RQ4有向通信グラフ上でも、明示的勾配知識なしに収束を維持できるか。
  • RQ5近似均衡と真のナッシュ均衡との間の誤差は、アルゴリズムパラメータにどのように依存するか。

主な発見

  • 強い単調なゲーム写像の条件下で、すべてのプレイヤーの行動がナッシュ均衡の近傍へ幾何的収束する。
  • 近似均衡と真のNEとの間の誤差は、ステップサイズαとスムージングパラメータμに比例する項によって上限が定められる。
  • 十分に小さな定常ステップサイズを用いることで、数値シミュレーションにより期待値における線形収束レートが確認された。
  • ステップサイズとスムージングパラメータを小さくするほど収束精度が向上し、理論的誤差上限が裏付けられた。
  • 1クールに6プレイヤーが所属する4連合のコーナットゲームにおける数値シミュレーションでは、すべてのプレイヤーの行動がNEに近似的に収束した。
  • 異なるステップサイズにおける誤差ギャップは、対数スケールプロットで線形に減少し、幾何的収束が確認された。より小さなステップサイズでは、より高い精度が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。