Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Better Understanding of Adaptive Gradient Algorithms in Generative Adversarial Nets

Mingrui Liu, Youssef Mroueh|arXiv (Cornell University)|2019. 12. 26.
Stochastic Gradient Optimization Techniques참고 문헌 49인용 수 21
한 줄 요약

이 논문은 GAN 훈련에서 비볼록 비볼록 최소화-최대화 문제를 위한 적응형 변형인 옵timistic Adagrad (OAdagrad)를 제안한다. 비볼록 비볼록 최소화-최대화 문제에서 $O(\epsilon^{-\frac{2}{1-\alpha}})$의 향상된 적응형 수렴 복잡도를 확립하며, 여기서 $\alpha$는 누적 확률적 기울기의 증가율을 측정한다. 이는 적응형 방법이 GAN에서 비적응형 방법보다 성능이 뛰어나게 되는 이유를 설명한다. 이는 기울기 증가 속도가 느리기 때문이다.

ABSTRACT

Adaptive gradient algorithms perform gradient-based updates using the history of gradients and are ubiquitous in training deep neural networks. While adaptive gradient methods theory is well understood for minimization problems, the underlying factors driving their empirical success in min-max problems such as GANs remain unclear. In this paper, we aim at bridging this gap from both theoretical and empirical perspectives. First, we analyze a variant of Optimistic Stochastic Gradient (OSG) proposed in~\citep{daskalakis2017training} for solving a class of non-convex non-concave min-max problem and establish $O(ε^{-4})$ complexity for finding $ε$-first-order stationary point, in which the algorithm only requires invoking one stochastic first-order oracle while enjoying state-of-the-art iteration complexity achieved by stochastic extragradient method by~\citep{iusem2017extragradient}. Then we propose an adaptive variant of OSG named Optimistic Adagrad (OAdagrad) and reveal an \emph{improved} adaptive complexity $O\left(ε^{-\frac{2}{1-α}} ight)$, where $α$ characterizes the growth rate of the cumulative stochastic gradient and $0\leq α\leq 1/2$. To the best of our knowledge, this is the first work for establishing adaptive complexity in non-convex non-concave min-max optimization. Empirically, our experiments show that indeed adaptive gradient algorithms outperform their non-adaptive counterparts in GAN training. Moreover, this observation can be explained by the slow growth rate of the cumulative stochastic gradient, as observed empirically.

연구 동기 및 목표

  • 적응형 기울기 방법이 지도 학습에서의 이론적 이점이 제한됨에도 불구하고 GAN 훈련에서 비적응형 방법보다 성능이 뛰어나게 되는 이유를 이해하기 위해.
  • 비볼록 비볼록 최소화-최대화 최적화를 위한 적응형 기울기 알고리즘에 대한 이론적 격차를 메우기 위해.
  • 스토하스틱 최소화-최대화 설정에서 적응형 및 옵티미스틱 방법의 수렴 복잡도 한계를 설정하기 위해.
  • GAN에서의 누적 기울기 증가 속도와 향상된 수렴 간의 연관성을 경험적으로 검증하기 위해.

제안 방법

  • 비볼록 비볼록 최소화-최대화 문제를 위한 옵티미스틱 스토하스틱 기울기(OGS)의 적응형 변형인 옵티미스틱 아다그라드(OAdagrad)를 제안한다.
  • OSG의 변형을 분석하고, $\epsilon$-일阶 정류점(Stationary point)을 찾는 데 $O(\epsilon^{-4})$의 반복 복잡도를 증명한다.
  • 누적 확률적 기울기의 증가율을 특징짓는 $\alpha \in [0, 1/2]$를 사용하여 $O(\epsilon^{-\frac{2}{1-\alpha}})$의 적응형 수렴 복잡도를 유도한다.
  • 스토하스틱 일阶 오라클을 사용하고, 적응형 학습률을 통한 헤시안 유사 조정을 통합한다.
  • 이론적 예측을 검증하기 위해 GAN 훈련에서 누적 확률적 기울기의 증가율을 경험적으로 측정한다.
  • CIFAR10에서 WGAN-GP 프레임워크에 이론적 분석을 적용하여, 다양한 배치 크기에서 OAdagrad, OSG, 그리고 번갈아 가며 Adam을 비교한다.

실험 결과

연구 질문

  • RQ1왜 Adam과 같은 적응형 기울기 방법은 지도 학습에서의 성능이 열 劣함에도 불구하고 GAN 훈련에서 비적응형 SGD보다 뛰어나게 되는가?
  • RQ2비볼록 비볼록 최소화-최대화 문제에서 적응형 옵티미스틱 방법의 이론적 수렴 복잡도는 무엇인가?
  • RQ3누적 확률적 기울기의 증가율은 GAN에서 적응형 방법의 수렴에 어떤 영향을 미치는가?
  • RQ4적응형 방법의 경험적 성공은 수렴 복잡도에 대한 이론적 한계에 의해 설명될 수 있는가?

주요 결과

  • 제안된 OAdagrad는 $O(\epsilon^{-\frac{2}{1-\alpha}})$의 적응형 수렴 복잡도를 달성하며, 이는 비적응형 OSG의 $O(\epsilon^{-4})$ 복잡도보다 향상된 것이다.
  • OAdagrad의 수렴 속도는 누적 확률적 기울기의 증가율을 나타내는 $\alpha$에 의존하며, 기울기 증가 속도가 느릴수록 수렴 속도가 빨라진다.
  • 경험적 결과는 OAdagrad가 OSG 및 번갈아 가며 Adam보다 더 빠르게 수렴하는 것으로 나타나며, 특히 더 큰 미니배치 크기에서 두드러진다.
  • GAN 훈련에서의 누적 확률적 기울기는 이론적 예측과 일치하게 느리게 증가한다. 이는 OAdagrad에서 수렴 향상에 기여한다.
  • 미니배치 크기가 증가함에 따라 OAdagrad는 번갈아 가며 Adam을 능가하며, 이는 대규모 배치 훈련에서 적응형 학습률의 이점이 있음을 시사한다.
  • 본 연구는 비볼록 비볼록 최소화-최대화 최적화에서 적응형 기울기 방법에 대한 첫 이론적 복잡도 분석을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.