Skip to main content
QUICK REVIEW

[논문 리뷰] Faster Single-loop Algorithms for Minimax Optimization without Strong Concavity

Junchi Yang, Antonio Orvieto|arXiv (Cornell University)|2021. 12. 10.
Stochastic Gradient Optimization Techniques인용 수 8
한 줄 요약

이 논문은 강한 볼록성 조건이 없이도 하나의 변수에 대해 Polyak-Łojasiewicz (PL) 조건을 만족하는 최소최대 최적화를 위한 더 빠른 단일루프 알고리즘 두 가지—교대 GDA (AGDA)와 스무스화된 GDA—을 제안한다. 스무스화된 GDA의 반복 복잡도는 $O(\kappa\epsilon^{-2})$이며, 그 확률적 변형의 경우 $O(\kappa^2\epsilon^{-4})$로, 기존의 순수 GDA보다 훨씬 뛰어난 성능을 보이며, 유사한 가정 하에 단일루프 방법 중 가장 뛰어난 수렴 속도를 달성한다.

ABSTRACT

Gradient descent ascent (GDA), the simplest single-loop algorithm for nonconvex minimax optimization, is widely used in practical applications such as generative adversarial networks (GANs) and adversarial training. Albeit its desirable simplicity, recent work shows inferior convergence rates of GDA in theory even assuming strong concavity of the objective on one side. This paper establishes new convergence results for two alternative single-loop algorithms -- alternating GDA and smoothed GDA -- under the mild assumption that the objective satisfies the Polyak-Lojasiewicz (PL) condition about one variable. We prove that, to find an $ε$-stationary point, (i) alternating GDA and its stochastic variant (without mini batch) respectively require $O(κ^{2} ε^{-2})$ and $O(κ^{4} ε^{-4})$ iterations, while (ii) smoothed GDA and its stochastic variant (without mini batch) respectively require $O(κε^{-2})$ and $O(κ^{2} ε^{-4})$ iterations. The latter greatly improves over the vanilla GDA and gives the hitherto best known complexity results among single-loop algorithms under similar settings. We further showcase the empirical efficiency of these algorithms in training GANs and robust nonlinear regression.

연구 동기 및 목표

  • 강한 볼록성 조건이 없을 경우 단일루프 최소최대 알고리즘의 수렴 속도 격차를 해소하기 위해.
  • 단일루프 환경에서 조건수 $\kappa$와 정확도 $\epsilon$에 대한 의존도를 향상시키기 위해.
  • PL 조건 하에서 AGDA와 스무스화된 GDA의 더 날카운 복잡도 상한(반복 및 샘플 복잡도)을 설정하기 위해.
  • GAN 학습과 강건한 회귀에서 스무스화된 GDA의 경험적 우수성을 입증하기 위해.

제안 방법

  • 비볼록 최소최대 문제에 대한 순수 GDA의 단일루프 대체로 교대 GDA (AGDA)와 스무스화된 GDA를 도입한다.
  • 강한 볼록성의 필요성을 완화하기 위해 $y$-변수에 대한 Polyak-Łojasiewicz (PL) 조건 하에서 수렴성을 분석한다.
  • 반복값과 최적 해 사이의 간격을 제어하기 위해 리아푸노프 함수와 재귀 부등식을 사용한다.
  • 부드러움과 PL 성질을 활용하여 원시-이중 갭의 수축을 통한 수렴을 확립한다.
  • 원시 함수 갭을 최대 함수의 기울기 노름과 연결함으로써 반복 복잡도 상한을 유도한다.
  • GAN 학습과 비선형 회귀에서 성능을 경험적으로 검증하며, Adam, RMSProp 및 표준 Stoc-AGDA와 비교한다.

실험 결과

연구 질문

  • RQ1강한 볼록성 조건이 없을 경우 단일루프 알고리즘이 순수 GDA보다 더 빠른 수렴 속도를 달성할 수 있는가?
  • RQ2PL 조건 하에서 단일루프 최소최대 알고리즘의 조건수 $\kappa$와 정확도 $\epsilon$에 대한 최적의 의존도는 무엇인가?
  • RQ3스무스화된 GDA는 이론적으로나 실무적으로 표준 AGDA를 능가하는가, 특히 확률적 환경에서?
  • RQ4스무스화된 GDA의 이론적 복잡도가 GAN 학습과 강건한 회귀에서 경험적으로도 달성될 수 있는가?

주요 결과

  • 스무스화된 GDA는 결정론적 환경에서 반복 복잡도 $O(\kappa\epsilon^{-2})$를 달성하며, 동일한 가정 하에서 순수 GDA의 $O(\kappa^2\epsilon^{-2})$보다 크게 향상된다.
  • 스무스화된 GDA의 확률적 변형은 $O(\kappa^2\epsilon^{-4})$회의 반복이 필요하며, 이는 미니배치 없이도 단일루프 알고리즘 중 가장 뛰어난 샘플 복잡도이다.
  • 교대 GDA는 결정론적 경우에 $O(\kappa^2\epsilon^{-2})$회의 반복이 필요하고, 확률적 경우에 $O(\kappa^4\epsilon^{-4})$이며, 여전히 순수 GDA를 능가한다.
  • 경험적 결과는 스무스화된 GDA가 적응형 스텝사이즈를 사용할 경우 GAN 학습과 강건한 회귀에서 Adam 및 RMSProp을 능가하거나 그에 못지않게 성능을 발휘함을 보여준다.
  • 이론적 분석은 스무스화된 GDA가 PL 조건 하에서 단일루프 방법 중 가장 뛰어난 수렴 속도를 달성함을 확인한다.
  • 논문은 조건수 $\kappa = l/\mu$가 수렴에 영향을 미치며, 스무스화된 GDA가 기존 GDA에 비해 그 의존도를 감소시킴을 규명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.