[论文解读] Learning in Non-convex Games with an Optimization Oracle
该论文通过引入一种允许通过 Follow-the-Perturbed-Leader (FTPL) 算法实现高效在线学习的扰动优化预言机,在非凸设置下建立了在线学习与统计学习之间的计算等价性。关键结果是预言机复杂度为多项式形式 $\mathrm{poly}(d, 1/\epsilon)$,在满足温和的利普希茨连续性和有界性假设下,实现了非凸博弈(包括 GAN)中均衡计算的高效性。
We consider online learning in an adversarial, non-convex setting under the assumption that the learner has an access to an offline optimization oracle. In the general setting of prediction with expert advice, Hazan et al. (2016) established that in the optimization-oracle model, online learning requires exponentially more computation than statistical learning. In this paper we show that by slightly strengthening the oracle model, the online and the statistical learning models become computationally equivalent. Our result holds for any Lipschitz and bounded (but not necessarily convex) function. As an application we demonstrate how the offline oracle enables efficient computation of an equilibrium in non-convex games, that include GAN (generative adversarial networks) as a special case.
研究动机与目标
- 为解决在非凸设置下通常更难的在线学习模型与统计学习之间的计算差距。
- 证明在略微强化的预言机模型(允许线性扰动)下,在线学习可变得与统计学习一样高效。
- 利用带有扰动目标的离线优化预言机,实现非凸博弈(如 GAN)中均衡的高效计算。
- 将 FTPL 算法扩展至非凸设置,并在利普希茨连续性和有界性假设下证明其预言机复杂度为多项式形式。
提出的方法
- 引入一种改进的离线优化预言机,可接受损失函数序列和一个随机线性扰动向量 $\sigma$。
- 在非凸设置中应用带独立同分布指数分布扰动 $\sigma$ 的 Follow-the-Perturbed-Leader (FTPL) 算法,以稳定决策。
- 采用随机扰动策略,确保扰动累积损失的最小化器以高概率近似最优固定策略。
- 通过分析期望遗憾并结合集中与覆盖论证,推导出预言机复杂度的多项式上界。
- 利用扰动预言机将在线学习问题转化为一系列具有可控误差的离线优化问题。
- 将该框架应用于双人零和非凸博弈,表明均衡收敛可简化为通过预言机求解最优响应问题。
实验结果
研究问题
- RQ1当存在优化预言机时,非凸设置下的在线学习能否实现与统计学习的计算等价性?
- RQ2在预言机模型中允许对目标函数进行线性扰动,是否能弥合在线学习与统计学习之间的指数级差距?
- RQ3在非凸、有界非凸和利普希茨连续设置下,扰动 FTPL 算法能否实现多项式预言机复杂度?
- RQ4在非凸博弈(如 GAN)中,均衡计算是否与求解相应的离线最优响应问题具有相同难度?
主要发现
- 所提出的算法实现了 $\mathrm{poly}(d, 1/\epsilon)$ 的预言机复杂度,与在相同假设下的统计学习复杂度一致。
- 扰动 FTPL 算法确保在 $T \in \mathrm{poly}(d)/\epsilon^3$ 轮后,期望平均遗憾不超过 $\epsilon$。
- 即使在非凸情况下,只要损失函数是 $G$-利普希茨连续且 $B$-有界的,在线学习与统计学习之间的计算等价性依然成立。
- 在双人零和非凸博弈中,可利用离线预言机高效计算均衡,以高概率实现 $\epsilon$-近似均衡。
- 该框架可直接应用于 GAN,其中生成器与判别器玩家可通过扰动预言机与 FTPL 算法收敛至 $\epsilon$-均衡。
- 该结果通过证明当预言机模型中不允许扰动时,指数级差距才会出现,从而解决了 [11] 中识别出的难度差距。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。