Skip to main content
QUICK REVIEW

[论文解读] On Solving Minimax Optimization Locally: A Follow-the-Ridge Approach

Yuanhao Wang, Guodong Zhang|arXiv (Cornell University)|Oct 16, 2019
Stochastic Gradient Optimization Techniques参考文献 48被引用 18
一句话总结

本文提出了一种名为 Follow-the-Ridge(FR)的新颖极小极大优化算法,通过校正领导者梯度更新以防止其偏离响应脊线,从而保证收敛至局部极小极大平衡点。该方法消除了梯度流中的旋转动力学,允许使用更大的学习率,并且与预条件化和正向动量兼容,显著提升了 GAN 训练及小规模极小极大问题的收敛性能,优于 GDA 和近期基线方法。

ABSTRACT

Many tasks in modern machine learning can be formulated as finding equilibria in \emph{sequential} games. In particular, two-player zero-sum sequential games, also known as minimax optimization, have received growing interest. It is tempting to apply gradient descent to solve minimax optimization given its popularity and success in supervised learning. However, it has been noted that naive application of gradient descent fails to find some local minimax and can converge to non-local-minimax points. In this paper, we propose \emph{Follow-the-Ridge} (FR), a novel algorithm that provably converges to and only converges to local minimax. We show theoretically that the algorithm addresses the notorious rotational behaviour of gradient dynamics, and is compatible with preconditioning and \emph{positive} momentum. Empirically, FR solves toy minimax problems and improves the convergence of GAN training compared to the recent minimax optimization algorithms.

研究动机与目标

  • 解决梯度下降-上升(GDA)在极小极大优化中无法收敛至局部极小极大点的问题。
  • 解决梯度动态在固定点附近持续存在的旋转行为,该行为限制了学习率和收敛性。
  • 设计一种算法,即使在使用预条件化和动量等标准优化技术时,也能保证仅收敛至局部极小极大点。
  • 将理论保证扩展至一般和博弈的斯塔克尔贝格博弈,并在 GAN 和合成极小极大问题上验证性能。

提出的方法

  • FR 在跟随者更新中引入一个校正项,以抵消领导者梯度步长带来的不稳定效应,使联合更新方向与损失景观中的脊线对齐。
  • 该校正项源自损失函数的海森矩阵,特别针对跟随者响应流形的曲率。
  • 该算法确保领导者-跟随者联合更新始终与脊线相切,防止漂移并减少旋转动力学。
  • FR 与预条件化和正向动量兼容,可在保持局部收敛保证的同时实现更快收敛。
  • 该方法在标准可微性和可逆性假设下,理论上证明可收敛至且仅收敛至局部极小极大点。
  • 该方法被扩展至具有类似收敛性质的一般和博弈斯塔克尔贝格博弈。

实验结果

研究问题

  • RQ1能否设计一种极小极大优化算法,使其可证明仅收敛至局部极小极大点,避免收敛至非极小极大固定点?
  • RQ2GDA 中梯度动态的旋转不稳定性由何原因引起,能否进行解析校正?
  • RQ3FR 中的校正项能否从海森结构中推导,以确保与响应脊线对齐?
  • RQ4当与预条件化和正向动量结合时,FR 是否仍保持收敛保证?
  • RQ5FR 在训练 GAN 和求解小规模极小极大问题方面是否优于 GDA 和其他近期极小极大算法?

主要发现

  • FR 可证明仅收敛至局部极小极大点,而 GDA 可能收敛至非极小极大固定点。
  • 该算法消除了梯度流中的旋转动力学,允许使用远大于 GDA 的学习率。
  • 在使用预条件化时,FR 仅需 50,000 次迭代即可收敛,而原始 FR 需要 500,000 次迭代,证明了预条件化的有效性。
  • 正向动量使 FR 在混合高斯分布基准测试中收敛速度提升约 3 倍,使用 γ=0.9 时可在 10,000 次迭代内实现收敛。
  • FR 改进了 GAN 训练的收敛性并减少了模式崩溃,表现为梯度范数更低,生成样本的保真度更高。
  • 谱分析证实,海森矩阵的舒尔补为半正定,判别器海森矩阵为半负定,验证了理论假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。