Skip to main content
QUICK REVIEW

[论文解读] Nonconvex-Nonconcave Min-Max Optimization with a Small Maximization Domain

Dmitrii M. Ostrovskii, Babak Barazandeh|arXiv (Cornell University)|Oct 8, 2021
Sparse and Compressive Sensing Techniques参考文献 101被引用 4
一句话总结

本文提出了一种新颖的方法来求解非凸-非凹的极小极大优化问题,通过在 $ y $ 上使用高阶泰勒展开近似内层最大化,在最大化域 $ Y $ 直径较小的关键假设下实现。主要贡献是理论保证:当 $ Y $ 的直径为 $ O(\varepsilon^{2/(k+1)}) $ 时($ k $ 阶近似),代理问题中的任意 $ \varepsilon $-平稳点在原问题中仍为 $ O(\varepsilon) $-平稳点,且几乎最优的界被证明是必要的。

ABSTRACT

We study the problem of finding approximate first-order stationary points in optimization problems of the form $\min_{x \in X} \max_{y \in Y} f(x,y)$, where the sets $X,Y$ are convex and $Y$ is compact. The objective function $f$ is smooth, but assumed neither convex in $x$ nor concave in $y$. Our approach relies upon replacing the function $f(x,\cdot)$ with its $k$th order Taylor approximation (in $y$) and finding a near-stationary point in the resulting surrogate problem. To guarantee its success, we establish the following result: let the Euclidean diameter of $Y$ be small in terms of the target accuracy $\varepsilon$, namely $O(\varepsilon^{\frac{2}{k+1}})$ for $k \in \mathbb{N}$ and $O(\varepsilon)$ for $k = 0$, with the constant factors controlled by certain regularity parameters of $f$; then any $\varepsilon$-stationary point in the surrogate problem remains $O(\varepsilon)$-stationary for the initial problem. Moreover, we show that these upper bounds are nearly optimal: the aforementioned reduction provably fails when the diameter of $Y$ is larger. For $0 \le k \le 2$ the surrogate function can be efficiently maximized in $y$; our general approximation result then leads to efficient algorithms for finding a near-stationary point in nonconvex-nonconcave min-max problems, for which we also provide convergence guarantees.

研究动机与目标

  • 解决在 $ f $ 关于 $ x $ 非凸且关于 $ y $ 非凹的非凸-非凹极小极大问题中寻找近似一阶平稳点的挑战。
  • 通过利用 $ f(x, \cdot) $ 在 $ y $ 变量上的高阶泰勒近似,为这类问题构建一个可计算的算法框架。
  • 建立理论条件,使得代理问题能为原问题提供近平稳解,特别关注 $ Y $ 的直径所起的作用。
  • 表明所需的直径较小条件几乎是最优的,因为当直径超过推导出的阈值时,该方法的约化会失效。
  • 为 $ k = 0,1,2 $ 提供高效算法并附带收敛保证,使其在生成对抗网络(GANs)和鲁棒训练等机器学习场景中具有实际应用潜力。

提出的方法

  • 用 $ f(x, \cdot) $ 在 $ y $ 上的 $ k $ 阶泰勒近似替换原函数,形成一个更易求解的代理极小极大问题。
  • 利用 $ Y $ 的小直径,具体为 $ k \in \mathbb{N} $ 时 $ O(\varepsilon^{2/(k+1)}) $,$ k=0 $ 时 $ O(\varepsilon) $,以确保代理问题的解能近似原问题的平稳点。
  • 建立理论界,表明代理问题中的任意 $ \varepsilon $-平稳点在原问题中也是 $ O(\varepsilon) $-平稳点,常数依赖于 $ f $ 的正则性参数。
  • 对于 $ k \leq 2 $,代理问题可在 $ y $ 上高效最大化,从而可设计出具有收敛保证的实际算法。
  • 利用拉兹方法高效求解代理问题中的内层最大化子问题,仅需 $ O(m) $ 次矩阵-向量乘积和 $ O(md_{\textsf{y}}) $ 的内存,其中 $ m $ 为拉兹迭代次数。
  • 通过基于 QR 的正交化和块三对角结构,保持数值稳定性,并高效计算 Krylov 子空间中的黑塞矩阵近似。

实验结果

研究问题

  • RQ1在 $ Y $ 的直径满足何种条件下,$ f(x, \cdot) $ 的 $ k $ 阶泰勒近似能保持原极小极大问题中的 $ \varepsilon $-平稳性?
  • RQ2所需直径缩放 $ O(\varepsilon^{2/(k+1)}) $ 是否几乎是最优的,还是可以进一步改进?
  • RQ3对于 $ k \leq 2 $,所得代理问题能否被高效求解,且可建立何种收敛保证?
  • RQ4函数 $ f $ 的正则性参数如何影响近似精度以及 $ Y $ 所需的直径?
  • RQ5所提方法在实际中能否高效实现,特别是在机器学习中常见的高维设置下?

主要发现

  • 当 $ k \in \mathbb{N} $ 时,$ Y $ 的直径必须为 $ O(\varepsilon^{2/(k+1)}) $,$ k=0 $ 时为 $ O(\varepsilon) $,才能确保代理问题中的任意 $ \varepsilon $-平稳点在原问题中仍为 $ O(\varepsilon) $-平稳点。
  • 所需直径条件几乎是最优的:当直径超过推导出的阈值时,该约化方法会失效,从而证明了边界的紧致性。
  • 对于 $ k = 0,1,2 $,代理问题可在 $ y $ 上高效最大化,从而可设计出具有收敛保证的实际算法。
  • 该算法的计算成本为 $ O(m(d_{\textsf{y}} + \text{time}(\text{HVP}))) $,其中 $ m $ 为拉兹迭代次数,$ \text{time}(\text{HVP}) $ 为计算黑塞-向量乘积的成本。
  • 内存使用量为 $ O(md_{\textsf{y}} + \text{mem}(\text{HVP})) $,若仅需最优值而非解向量,则可减少至 $ O(m + d_{\textsf{y}}) $。
  • 只要 $ Y $ 相对于目标精度 $ \varepsilon $ 足够小,该方法可确保代理问题的解在原问题中仍为有效的 $ O(\varepsilon) $-平稳点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。