Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Variance-Reduced Prox-Linear Algorithms for Nonconvex Composite Optimization

Junyu Zhang, Lin Xiao|arXiv (Cornell University)|2020. 04. 09.
Sparse and Compressive Sensing Techniques참고 문헌 63인용 수 6
한 줄 요약

이 논문은 $ f(g(x)) + h(x) $ 형태의 비볼록 복합 최적화 문제를 위한 확률적 분산 감소 보정 선형 알고리즘을 제안한다. 여기서 $ f $와 $ h $는 볼록이지만 비가속도일 수 있으며, $ g $는 구성요소의 평균이거나 기댓값인 매끄러운 사상이다. SARAH/Spider 및 수정된 SVRG 분산 감소 기법을 활용함으로써, 유한 평균의 경우 $ \mathcal{O}(N + N^{4/5}\epsilon^{-1}) $, 일반 기댓값의 경우 $ \mathcal{O}(\epsilon^{-5/2}) $의 최적 샘플 복잡도를 달성하며, $ f $가 매끄럽다면 더 향상된 복잡도를 확보한다.

ABSTRACT

We consider minimization of composite functions of the form $f(g(x))+h(x)$, where $f$ and $h$ are convex functions (which can be nonsmooth) and $g$ is a smooth vector mapping. In addition, we assume that $g$ is the average of finite number of component mappings or the expectation over a family of random component mappings. We propose a class of stochastic variance-reduced prox-linear algorithms for solving such problems and bound their sample complexities for finding an $ε$-stationary point in terms of the total number of evaluations of the component mappings and their Jacobians. When $g$ is a finite average of $N$ components, we obtain sample complexity $\mathcal{O}(N+ N^{4/5}ε^{-1})$ for both mapping and Jacobian evaluations. When $g$ is a general expectation, we obtain sample complexities of $\mathcal{O}(ε^{-5/2})$ and $\mathcal{O}(ε^{-3/2})$ for component mappings and their Jacobians respectively. If in addition $f$ is smooth, then improved sample complexities of $\mathcal{O}(N+N^{1/2}ε^{-1})$ and $\mathcal{O}(ε^{-3/2})$ are derived for $g$ being a finite average and a general expectation respectively, for both component mapping and Jacobian evaluations.

연구 동기 및 목표

  • 목적이 $ f(g(x)) + h(x) $ 형태이며, $ f $와 $ h $가 볼록이고 $ g $가 매끄러운 벡터 사상인 비볼록 복합 최적화 문제를 다루는 것.
  • 유한 평균과 기댓값 기반 $ g $에 모두 적합한 분산 감소 기법을 도입하여 확률적 보정 선형 방법의 샘플 복잡도를 감소시키는 것.
  • 성분 사상 및 야코비안 평가의 관점에서 $ \epsilon $-정류점에 도달하기 위한 최적 샘플 복잡도 경계를 확보하는 것.
  • SARAH/Spider 및 SVRG와 같은 분산 감소 기법을 보정 선형 계획에 확장하여 표준 확률적 방법 대비 수렴 속도를 향상시키는 것.
  • 유한 평균 및 일반 기댓값 설정에서 이론적 샘플 복잡도를 분석하며, $ f $의 매끄러움 여부에 따라 분석을 수행하는 것.

제안 방법

  • SARAH/Spider 또는 수정된 SVRG 추정기로 분산 감소를 수행하는 확률적 분산 감소 보정 선형 알고리즘을 제안하며, $ g(x^k) $와 $ g'(x^k) $의 미니배치 근사치를 사용한다.
  • 각 반복 단계에서 보정 선형 하위문제를 해결한다: $ x^{k+1} = \arg\min_x \left\{ f(\tilde{g}^k + \tilde{J}^k(x - x^k)) + h(x) + \frac{M}{2}\|x - x^k\|^2 \right\} $, 여기서 $ \tilde{g}^k $와 $ \tilde{J}^k $는 분산 감소 추정치이다.
  • SARAH/Spider에 영감을 받은 재귀적 기울기 추정기법을 도입하여 야코비안 및 함수값 추정의 분산을 감소시키며, 이로 인해 더 낮은 샘플 복잡도를 달성한다.
  • 비가속도 및 유한 평균 케이스에서 수렴을 향상시키기 위해 일阶 보정이 적용된 수정된 SVRG 추정기법을 도입한다.
  • 에포크의 시작 단계에서 큰 배치 크기를 피하기 위해 후반 단계에서 일정한 미니배치 크기 전략을 적용한다.
  • 분산 감소 보정 선형 업데이트의 수렴 속도를 분석하여, $ \epsilon $-정류점에 도달하기 위한 이론적 샘플 복잡도 경계를 유도한다.

실험 결과

연구 질문

  • RQ1유한 평균인 $ g $를 가진 비볼록 복합 최적화 문제에서 확률적 보정 선형 방법의 최적 샘플 복잡도는 무엇인가?
  • RQ2SARAH/Spider와 같은 분산 감소 기법은 비가속도 및 비볼록 문제에 대해 보정 선형 알고리즘에 효과적으로 적용될 수 있는가?
  • RQ3일반 기댓값 설정에서 $ f $의 매끄러움이 달성 가능한 샘플 복잡도에 어떤 영향을 미치는가?
  • RQ4분산 감소 보정 선형 방법에서 배치 크기와 수렴 속도 사이의 상충 관계는 무엇인가?
  • RQ5비가속도인 $ f $에 대해 분산 감소 보정 선형 계획에서 일정한 작은 미니배치 크기를 효과적으로 사용할 수 있는가?

주요 결과

  • 성분 수 $ N $이 유한 평균인 $ g $의 경우, 제안된 알고리즘은 성분 사상 및 야코비안 평가 모두에서 샘플 복잡도 $ \mathcal{O}(N + N^{4/5}\epsilon^{-1}) $를 달성한다.
  • 일반 기댓값인 $ g $의 경우, 성분 사상 평가는 $ \mathcal{O}(\epsilon^{-5/2}) $, 야코비안 평가는 $ \mathcal{O}(\epsilon^{-3/2}) $의 샘플 복잡도를 갖는다.
  • $ f $가 매끄럽다면, 유한 평균의 경우 샘플 복잡도는 $ \mathcal{O}(N + \sqrt{N}\epsilon^{-1}) $로 향상되고, 일반 기댓값의 경우 $ \mathcal{O}(\epsilon^{-3/2}) $가 된다.
  • SARAH/Spider 추정기법의 사용은 SVRG 기반 방법보다 더 낮은 샘플 복잡도를 제공하며, 특히 매끄러운 경우 $ \mathcal{O}(N + \sqrt{N}\epsilon^{-1}) $의 복잡도를 달성한다.
  • 실험을 통해 분산 감소 보정 선형 방법이 표준 확률적 보정 선형 방법 및 S-PL 방법보다 실질적으로 우수한 성능을 보였다.
  • 이론적 분석을 통해 보정 선형 방법이 가우스-뉴턴 근사에 의해 암묵적으로 이阶 정보를 활용할 수 있으며, 이는 일阶 기울기 방법보다 우월한 점을 밝혀냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.