Skip to main content
QUICK REVIEW

[논문 리뷰] Gradient Free Minimax Optimization: Variance Reduction and Faster Convergence

Tengyu Xu, Zhe Wang|arXiv (Cornell University)|2020. 06. 16.
Stochastic Gradient Optimization Techniques참고 문헌 31인용 수 5
한 줄 요약

이 논문은 함수 값만 이용 가능한 비볼록-강볼록 미니맥스 최적화 문제를 위한 최초의 제로스터드(variance-reduced) 경사수렴-상승(Zeroth-Order Variance-Reduced Gradient Descent Ascent, ZO-VRGDA) 알고리즘을 제안한다. 이 알고리즘은 순환적 분산 감소와 경사수렴 없는 함수 쿼리 기반으로 설계되었으며, 쿼리 복잡도를 $\mathcal{O}(\kappa(d_1+d_2)\epsilon^{-3})$로 달성하여 이론적 하한선과 정확히 일치시키고, 감소하는 스텝 사이즈가 필요 없이 이전 방법들보다 수개의 차수만큼 성능을 뛰어넘는다.

ABSTRACT

Many important machine learning applications amount to solving minimax optimization problems, and in many cases there is no access to the gradient information, but only the function values. In this paper, we focus on such a gradient-free setting, and consider the nonconvex-strongly-concave minimax stochastic optimization problem. In the literature, various zeroth-order (i.e., gradient-free) minimax methods have been proposed, but none of them achieve the potentially feasible computational complexity of $\mathcal{O}(ε^{-3})$ suggested by the stochastic nonconvex minimization theorem. In this paper, we adopt the variance reduction technique to design a novel zeroth-order variance reduced gradient descent ascent (ZO-VRGDA) algorithm. We show that the ZO-VRGDA algorithm achieves the best known query complexity of $\mathcal{O}(κ(d_1 + d_2)ε^{-3})$, which outperforms all previous complexity bound by orders of magnitude, where $d_1$ and $d_2$ denote the dimensions of the optimization variables and $κ$ denotes the condition number. In particular, with a new analysis technique that we develop, our result does not rely on a diminishing or accuracy-dependent stepsize usually required in the existing methods. To our best knowledge, this is the first study of zeroth-order minimax optimization with variance reduction. Experimental results on the black-box distributional robust optimization problem demonstrates the advantageous performance of our new algorithm.

연구 동기 및 목표

  • 함수 값만 접근 가능한 비볼록-강볼록 미니맥스 문제에 대해 효율적인 경사수렴 없는 알고리즘이 부족한 문제를 해결하기 위해.
  • 기존의 제로스터드 방법과 이론적 $\mathcal{O}(\epsilon^{-3})$ 쿼리 복잡도 하한선 사이의 격차를 메우기 위해.
  • 감소하거나 정확도에 의존하는 스텝 사이즈를 피하는 분산 감소 기반 접근법을 개발하기 위해.
  • 상수 스텝 사이즈를 지원하고 향상된 수렴 속도를 보장하는 새로운 분석 프레임워크를 구축하기 위해.

제안 방법

  • 순환적 분산 감소를 사용하는 내재된 루프 기반의 제로스터드 알고리즘인 ZO-VRGDA를 제안한다.
  • 함수 값만으로부터 경사를 근사하기 위해 가우시안 스무딩 경사 추정기(Gaussian Smoothing Gradient Estimators, GauGE)를 적용한다.
  • 감소하거나 정확도에 의존하는 스텝 사이즈에 의존하지 않고도 상수 스텝 사이즈를 허용하는 새로운 분석 기법을 도입한다.
  • 외부 루프와 내부 루프 양쪽에서 순환적 분산 감소를 사용하여 경사 추정기의 분산을 감소시킨다.
  • 이중 수준의 샘플링 기반 설계: 내부 루프는 분산 감소를 위해, 외부 루프는 점진적으로 해를 업데이트하기 위해 사용된다.
  • 외부 목표 함수 $\Phi(x)$의 경사도 노름의 기대값을 유한하게 제한함으로써 수렴성을 확립한다.

실험 결과

연구 질문

  • RQ1비볼록-강볼록 환경에서 제로스터드 미니맥스 알고리즘이 이론적 $\mathcal{O}(\epsilon^{-3})$ 쿼리 복잡도를 달성할 수 있는가?
  • RQ2분산 감소 기법이 제로스터드 미니맥스 최적화에 효과적으로 적용되어 수렴 속도를 향상시킬 수 있는가?
  • RQ3정확도를 저하시키지 않고도 제로스터드 미니맥스 방법에서 상수 스텝 사이즈로 수렴을 달성할 수 있는가?
  • RQ4상수 스텝 사이즈를 지원하고 더 탴밀한 복잡도 한계를 보장하는 새로운 분석 프레임워크를 개발할 수 있는가?

주요 결과

  • 제안된 ZO-VRGDA 알고리즘은 $\mathcal{O}(\kappa(d_1 + d_2)\epsilon^{-3})$의 쿼리 복잡도를 달성하며, 경사 기반 방법의 이론적 하한선과 정확히 일치한다.
  • 이 알고리즘은 이전의 모든 제로스터드 방법들보다 쿼리 복잡도 측면에서 수개의 차수만큼 뛰어나다.
  • 분석 과정에서 감소하거나 정확도에 의존하는 스텝 사이즈가 필요 없어 안정적이고 더 빠른 수렴을 가능하게 한다.
  • 이 알고리즘은 분산 감소와 제로스터드 미니맥스 최적화를 처음 융합한 것으로, 새로운 기준을 설정한다.
  • 블랙박스 분포적 강건 최적화에 대한 실험 결과는 ZO-VRGDA가 기존 방법들보다 뛰어난 성능을 보임을 확인한다.
  • 적절한 파rameter 설정 하에 $T = \mathcal{O}(\kappa\epsilon^{-2})$ 반복 후 $\mathbb{E}[\|\nabla\Phi(\hat{x})\|_2] \leq \epsilon$을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.