Skip to main content
QUICK REVIEW

[논문 리뷰] SAPD+: An Accelerated Stochastic Method for Nonconvex-Concave Minimax Problems

Xuan Zhang, Necdet Serhat Aybat|arXiv (Cornell University)|2022. 05. 30.
Stochastic Gradient Optimization Techniques인용 수 4
한 줄 요약

이 논문은 약한 볼록(weakly convex, WC) 목적 함수를 가진 비볼록-볼록 최소화 문제를 위한 가속화된 확률적 원본-이중 방법인 SAPD+를 제안한다. 이는 도메인의 컴actness 조건을 요구하지 않으며, 약한 볼록-강볼록 설정에서 $\mathcal{O}(L\kappa_y\epsilon^{-4})$의 최적 오ракูล 복잡도를 달성하고, 약한 볼록-단순 볼록 설정에서는 $\mathcal{O}(L^3\epsilon^{-6})$의 복잡도를 달성한다. 또한, 변동성 감소(variance-reduced) 변형을 통해 WCSC 설정에서 $\mathcal{O}(L\kappa_y^2\epsilon^{-3})$의 향상된 복잡도를 달성한다.

ABSTRACT

We propose a new stochastic method SAPD+ for solving nonconvex-concave minimax problems of the form $\min\max\mathcal{L}(x,y)=f(x)+Φ(x,y)-g(y)$, where $f,g$ are closed convex and $Φ(x,y)$ is a smooth function that is weakly convex in $x$, (strongly) concave in $y$. Let $δ^2$ denote the variance bound for the unbiased stochastic oracle used within SAPD+ to estimate $ ablaΦ$. When $δ>0$, for both strongly concave and merely concave settings, SAPD+ achieves the best known oracle complexities: $\mathcal{O}\Big(κ_y\max\Big\{1,\frac{δ^2}{ε^2}\Big\}\frac{L\mathcal{G}_0}{ε^{2}}\Big)$ for the strongly concave case without assuming compactness of the problem domain, and $\mathcal{O}\Big(\frac{L^3\mathcal{D}_y^2\mathcal{G}_0}{ε^{4}}\Big(1+\frac{δ^2}{ε^2}\Big)\Big)$ for the merely concave case, where $κ_y\geq 1$ is the condition number, $L$ is the Lipschitz constant of $ abla Φ$, $\mathcal{G}_0$ is the primal-dual gap of the initial point, and $\mathcal{D}_y=\sup\{\|y\|:\ y\in\mathbf{dom} g\}$. We also propose SAPD+ with variance reduction, which enjoys $\mathcal{O}\Big(\max\Big\{κ_y,\sqrt{\fracδε}\Big\}\cdot (1+κ_y\fracδε)\frac{L\mathcal{G}_0}{ε^2}\Big)$ oracle complexity for weakly convex-strongly concave setting --this is the best known upper complexity bound in the literature for this setting and our paper establishes it for the first time. We demonstrate the efficiency of SAPD+ on a distributionally robust learning problem with a nonconvex regularizer and also on a multi-class classification problem in deep learning.

연구 동기 및 목표

  • 비볼록-볼록 최소화 문제에 대해 약한 볼록 목적 함수를 갖는 확률적 1차 방법을 개발하며, 목적 함수 $\mathcal{L}(x,y) = f(x) + \Phi(x,y) - g(y)$ 는 $x$ 에서는 약한 볼록성, $y$ 에서는 (강한) 볼록성을 갖는다.
  • 도메인의 컴 pactness 조건 없이도, 약한 볼록-강볼록(WCSC) 및 약한 볼록-단순 볼록(WCMC) 설정 모두에서 최적의 오라클 복잡도를 달성한다.
  • WCSC 설정에서 수렴 속도를 추가로 향상시키기 위해 변동성 감소 기법을 가속화된 원본-이중 방법에 효과적으로 통합한다.
  • 비볼록 정규화를 갖는 분포로의 강건 학습과 다중 클래스 딥러닝 문제에서 실용적 효율성을 입증한다.

제안 방법

  • 비볼록-볼록 사다리꼴 문제에 적합한 가속화된 경사 하강법과 모멘텀, 적응적 스텝 사이즈를 활용한 확률적 원본-이중 알고리즘인 SAPD+를 제안한다.
  • 모레우( Moreau) 매핑과 일반화된 경사도 매핑을 활용한 새로운 분석 프레임워크를 도입하여, 원본 함수의 경사도 노름과 모레우 매핑의 수렴성을 확보한다.
  • 작은 배치를 이용한 확률적 오라클을 통해 경사도를 추정하며, 배치 크기와 스텝 사이즈를 변동성과 수렴 속도의 균형을 맞추도록 조정한다.
  • 반복적 수렴의 기대 감소를 정교하게 분석함으로써 오라클 복잡도의 경계를 유도하며, 조건 수 $\kappa_y$ 와 리프시츠 상수 $L$ 을 활용한다.
  • WCSC 설정에서 변동성 감소 기법을 SAPD+의 변형에 적용하여 $\mathcal{O}(L\kappa_y^2\epsilon^{-3})$ 의 향상된 복잡도를 달성한다.
  • 비미분 가능 성분을 다루기 위해 모레우 매핑을 통한 스무딩 기법을 사용하며, 약한 볼록 조건 하에서 GNME와 GNP 수렴 기준 간의 등가성을 확립한다.

실험 결과

연구 질문

  • RQ1비볼록-볼록 최소화 문제에 대해 약한 볼록 목적 함수를 갖는 가속화된 확률적 방법을 설계할 수 있는가? 이는 도메인의 컴 pactness 조건 없이도 최적의 오라클 복잡도를 달성할 수 있는가?
  • RQ2약한 볼록-강볼록 및 약한 볼록-단순 볼록 설정에서 확률적 알고리즘의 최선의 가능한 오라클 복잡도는 무엇인가?
  • RQ3어떻게 변동성 감소 기법을 가속화된 원본-이중 방법에 효과적으로 통합하여 이러한 문제에서 수렴 속도를 추가로 향상시킬 수 있는가?
  • RQ4약한 볼록성과 비미분 가능 정규화를 고려할 때, GNME와 GNP 수렴 기준 간의 등가성은 어느 정도 유지되는가?
  • RQ5제안된 방법은 분포로의 강건 학습과 다중 클래스 분류와 같은 실질적인 딥러닝 응용에서 기존 방법을 초월할 수 있는가?

주요 결과

  • SAPD+는 도메인의 컴 pactness 조건 없이도 약한 볼록-강볼록 문제에서 최고의 알려진 오라클 복잡도 $\mathcal{O}(L\kappa_y\epsilon^{-4})$ 를 달성한다.
  • 약한 볼록-단순 볼록 문제에 대해서는 SAPD+가 $\mathcal{O}(L^3\epsilon^{-6})$ 의 오라클 복잡도를 달성하며, 주어진 가정 하에서 최적이 된다.
  • 변동성 감소 변형은 WCSC 설정에서 $\mathcal{O}(L\kappa_y^2\epsilon^{-3})$ 의 복잡도를 달성하여 이전 방법보다 향상된 성능을 보인다.
  • 논문은 약한 볼록 조건 하에서 GNME와 GNP 수렴 기준 간의 등가성을 확립하였으며, GNME 보장 조건을 GNP 보장 조건으로 변환할 때 추가 비용이 거의 없이 가능함을 보였다.
  • 수치 실험을 통해 SAPD+가 비볼록 정규화를 갖는 분포로의 강건 학습과 딥러닝에서의 다중 클래스 분류 문제에서 뛰어난 효율성을 입증하였다.
  • 분석 결과, 일부 알고리즘에 대한 이전의 $\tilde{\mathcal{O}}(\kappa_y^3\epsilon^{-3})$ 복잡도 주장은 최적화되지 않았으며, 동일한 조건 하에서 정확한 복잡도는 $\tilde{\mathcal{O}}(L^{1.5}\kappa_y^4\epsilon^{-3})$ 임을 규명하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.