Skip to main content
QUICK REVIEW

[论文解读] On the Rate of Convergence of Payoff-based Algorithms to Nash Equilibrium in Strongly Monotone Games

Tatiana Tatarenko, Maryam Kamgarpour|arXiv (Cornell University)|Feb 22, 2022
Stochastic Gradient Optimization Techniques被引用 4
一句话总结

本文提出了一类基于收益的算法,用于在凸的、强单调的博弈中仅通过函数评估(零阶信息)学习纳什均衡。在单点反馈设置下建立了 $O(1/√{T})$ 的收敛速率,在两点反馈设置下建立了 $O(1/T)$ 的收敛速率,通过一种新颖的分析方法将迭代过程与时变平滑博弈的均衡进行比较,实现了该类博弈中最佳已知收敛速率。

ABSTRACT

We derive the rate of convergence to Nash equilibria for the payoff-based algorithm proposed in \cite{tat_kam_TAC}. These rates are achieved under the standard assumption of convexity of the game, strong monotonicity and differentiability of the pseudo-gradient. In particular, we show the algorithm achieves $O(\frac{1}{T})$ in the two-point function evaluating setting and $O(\frac{1}{\sqrt{T}})$ in the one-point function evaluation under additional requirement of Lipschitz continuity of the pseudo-gradient. These rates are to our knowledge the best known rates for the corresponding problem classes.

研究动机与目标

  • 填补基于收益学习在凸的、强单调博弈中收敛速率界限的空白。
  • 在仅使用收益反馈的一点和两点函数评估设置下,推导出紧致的收敛速率。
  • 通过将算法迭代过程与时变平滑博弈的解进行比较,建立所推导速率的最优性。
  • 通过引入一种能考虑平滑博弈中混合策略均衡的精细化分析技术,改进先前的 $O(1/T^{1/3})$ 速率。
  • 在标准假设下验证速率:强凸性、强单调性、可微性以及伪梯度的利普希茨连续性。

提出的方法

  • 使用带有高斯噪声的随机梯度估计策略,从仅有的收益信息中近似梯度。
  • 引入一个时变平滑博弈模型,其中纳什均衡随平滑参数 $\rho_t$ 而演化。
  • 通过将算法迭代 $\bm{\mu}(t)$ 与每一步中平滑博弈的纳什均衡 $\mathbf{z}(t)$ 进行比较来分析收敛性。
  • 在抽样分布中采用递减的方差参数 $\sigma_t$,以确保收敛性同时控制估计误差。
  • 应用 Chung 的引理和 Portmanteau 引理,建立迭代过程以几乎必然和依概率收敛到真实纳什均衡。
  • 推导出期望平方距离 $\mathrm{E}[\|\bm{\mu}(t+1) - \mathbf{z}(t)\|^2]$ 的上界,以证明其以 $O(1/t)$ 速率衰减,从而得出最终的收敛速率。

实验结果

研究问题

  • RQ1在仅有收益反馈的情况下,基于收益的算法能否在强单调博弈中实现优于 $O(1/T^{1/3})$ 的收敛速率?
  • RQ2在单点反馈设置下,$O(1/\sqrt{T})$ 的速率是否为零阶随机梯度方法在强凸优化中的最优速率?
  • RQ3在两点反馈设置下,能否在不访问梯度信息的情况下实现 $O(1/T)$ 的收敛速率?
  • RQ4将算法迭代过程与时变平滑博弈的均衡进行比较,是否能比直接与真实均衡比较得到更紧致的收敛界?
  • RQ5在结合镜像下降风格更新时,抽样分布(高斯分布)的选择如何影响收敛性?

主要发现

  • 所提出的算法在单点函数评估设置下实现了 $O(1/\sqrt{T})$ 的收敛速率,优于先前的 $O(1/T^{1/3})$ 速率。
  • 在两点函数评估设置下,算法实现了 $O(1/T)$ 的收敛速率,这是在有界梯度估计条件下零阶随机梯度方法的最优速率。
  • 改进的速率源于一种精细化的分析技术,即比较迭代过程与时变平滑博弈的均衡,而非算法结构的修改。
  • 在两点设置下 $O(1/T)$ 的收敛速率与零阶强凸优化中全梯度访问下的已知下界一致。
  • 在单点设置下 $O(1/\sqrt{T})$ 的收敛速率与零阶光滑强凸优化中的已知下界一致,表明在给定假设下具有最优性。
  • 该分析在假设 $\sigma_t \to 0$ 的条件下,建立了迭代过程以几乎必然和依概率收敛到真实纳什均衡 $\bm{a}^*$。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。