Skip to main content
QUICK REVIEW

[论文解读] Improved Algorithms for Convex-Concave Minimax Optimization

Wang, Yuanhao, Li, Jian|arXiv (Cornell University)|Jun 11, 2020
Stochastic Gradient Optimization Techniques参考文献 43被引用 16
一句话总结

该论文提出了一种新的算法——近端最优响应(Proximal Best Response),用于凸-凹极小化极大优化问题,其梯度复杂度得到改进。该算法实现了线性收敛,并且在交叉变量相互作用较弱时,对条件数的依赖更紧密,对于二次函数,其性能与已知下界仅相差一个次多项式因子。

ABSTRACT

This paper studies minimax optimization problems $\min_x \max_y f(x,y)$, where $f(x,y)$ is $m_x$-strongly convex with respect to $x$, $m_y$-strongly concave with respect to $y$ and $(L_x,L_{xy},L_y)$-smooth. Zhang et al. provided the following lower bound of the gradient complexity for any first-order method: $Ω\Bigl(\sqrt{\frac{L_x}{m_x}+\frac{L_{xy}^2}{m_x m_y}+\frac{L_y}{m_y}}\ln(1/ε)\Bigr).$ This paper proposes a new algorithm with gradient complexity upper bound $ ilde{O}\Bigl(\sqrt{\frac{L_x}{m_x}+\frac{L\cdot L_{xy}}{m_x m_y}+\frac{L_y}{m_y}}\ln\left(1/ε ight)\Bigr),$ where $L=\max\{L_x,L_{xy},L_y\}$. This improves over the best known upper bound $ ilde{O}\left(\sqrt{\frac{L^2}{m_x m_y}} \ln^3\left(1/ε ight) ight)$ by Lin et al. Our bound achieves linear convergence rate and tighter dependency on condition numbers, especially when $L_{xy}\ll L$ (i.e., when the interaction between $x$ and $y$ is weak). Via reduction, our new bound also implies improved bounds for strongly convex-concave and convex-concave minimax optimization problems. When $f$ is quadratic, we can further improve the upper bound, which matches the lower bound up to a small sub-polynomial factor.

研究动机与目标

  • 填补凸-凹极小化极大问题在梯度复杂度界方面的空白,特别是当跨变量交互作用较弱时。
  • 改进林等人提出的先前最优上界 $\tilde{O}\left(\sqrt{L^2/(m_{\mathbf{x}}m_{\mathbf{y}})}\ln^3(1/\epsilon)\right)$。
  • 实现线性收敛速率,这对高精度解至关重要。
  • 通过约化方法,为强凸-凹和一般凸-凹极小化极大问题提供更紧的界。
  • 对于二次函数,通过实现次多项式因子的接近最优开销,弥合上界与下界之间的差距。

提出的方法

  • 为一般凸-凹极小化极大问题引入一种新算法,称为近端最优响应(PBR)。
  • 利用强凸性和强凹性,结合光滑性参数 $L_{\mathbf{x}}, L_{\mathbf{y}}, L_{\mathbf{xy}}$ 和模量 $m_{\mathbf{x}}, m_{\mathbf{y}}$。
  • 为二次情形设计一种递归矩阵求解器——递归厄米特-反对称-厄米特分裂(RHSS(k)),以降低对条件数的依赖。
  • 使用迭代精化结合矩阵-向量乘积,求解由最优性条件导出的线性系统。
  • 优化 RHSS(k) 中的迭代次数 $k$,以最小化收敛速率中的次多项式因子。
  • 应用约化技术,将强凸-强凹情形的结果推广至更广泛的极小化极大设置。

实验结果

研究问题

  • RQ1我们能否设计一种一阶算法,使凸-凹极小化极大问题的梯度复杂度与已知下界仅相差一个次多项式因子?
  • RQ2当交互项 $L_{\mathbf{xy}}$ 相对于其他光滑性参数较小时,如何改进收敛速率与条件数依赖?
  • RQ3在二次极小化极大问题的迭代线性求解器中,迭代次数与条件数之间最优权衡为何?
  • RQ4我们能否在一般凸-凹设置下实现线性收敛,同时保持对条件数的紧密依赖?
  • RQ5递归矩阵求解器 RHSS(k) 如何降低有效条件数,并在二次情形下提升收敛性?

主要发现

  • 所提出的近端最优响应算法实现了 $\tilde{O}\left(\sqrt{\frac{L_{\mathbf{x}}}{m_{\mathbf{x}}} + \frac{L \cdot L_{\mathbf{xy}}}{m_{\mathbf{x}}m_{\mathbf{y}}} + \frac{L_{\mathbf{y}}}{m_{\mathbf{y}}}} \ln(1/\epsilon)\right)$ 的梯度复杂度,其中 $L = \max\{L_{\mathbf{x}}, L_{\mathbf{xy}}, L_{\mathbf{y}}\}$,优于先前的界。
  • 该算法实现了线性收敛,而林等人所提出的先前最优方法无法保证这一点。
  • 对于二次函数,RHSS(k) 算法实现了上界 $O\left(\sqrt{\frac{L_{\mathbf{x}}}{m_{\mathbf{x}}} + \frac{L_{\mathbf{xy}}^2}{m_{\mathbf{x}}m_{\mathbf{y}}} + \frac{L_{\mathbf{y}}}{m_{\mathbf{y}}}} \left(\frac{L^2}{m_{\mathbf{x}}m_{\mathbf{y}}}\right)^{o(1)} \ln(1/\epsilon)\right)$,与下界仅相差一个次多项式因子。
  • 当 $k = \Theta\left(\sqrt{\ln(L^2/(m_{\mathbf{x}}m_{\mathbf{y}})) / \ln\ln(L^2/(m_{\mathbf{x}}m_{\mathbf{y}}))}\right)$ 时,界中的次多项式因子被最小化,从而实现近似最优收敛。
  • 改进后的界通过约化方法,意味着对强凸-凹和一般凸-凹极小化极大问题的复杂度结果也更紧密。
  • 当 $L_{\mathbf{xy}} \ll \max\{L_{\mathbf{x}}, L_{\mathbf{y}}\}$ 时,新界显著优于先前方法,尤其在弱耦合情形下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。