Skip to main content
QUICK REVIEW

[논문 리뷰] Complexity of Finding Stationary Points of Nonsmooth Nonconvex Functions

Jingzhao Zhang, Hongzhou Lin|arXiv (Cornell University)|2020. 02. 10.
Stochastic Gradient Optimization Techniques참고 문헌 42인용 수 15
한 줄 요약

이 논문은 미분 가능하지 않은 비볼록 최적화에서 $\epsilon$-정류점(정류점)을 찾는 데 있어 비가역성 문제를 다루기 위해 $(\delta,\epsilon)$-정류점 프레임워크를 제안한다. 결정론적 및 확률적 환경에서 각각 $\tilde{\mathcal{O}}(\epsilon^{-3}\delta^{-1})$ 및 $\tilde{\mathcal{O}}(\epsilon^{-4}\delta^{-1})$의 복잡도를 가지는 무작위 1차 알고리즘을 제안하며, $\Omega(\delta^{-1})$의 하한을 확립하여, ReLU 네트워크와 같은 하다르드 반미분가능 함수에 대한 최초의 비점근적 분석을 제공한다.

ABSTRACT

We provide the first non-asymptotic analysis for finding stationary points of nonsmooth, nonconvex functions. In particular, we study the class of Hadamard semi-differentiable functions, perhaps the largest class of nonsmooth functions for which the chain rule of calculus holds. This class contains examples such as ReLU neural networks and others with non-differentiable activation functions. We first show that finding an $ε$-stationary point with first-order methods is impossible in finite time. We then introduce the notion of $(δ, ε)$-stationarity, which allows for an $ε$-approximate gradient to be the convex combination of generalized gradients evaluated at points within distance $δ$ to the solution. We propose a series of randomized first-order methods and analyze their complexity of finding a $(δ, ε)$-stationary point. Furthermore, we provide a lower bound and show that our stochastic algorithm has min-max optimal dependence on $δ$. Empirically, our methods perform well for training ReLU neural networks.

연구 동기 및 목표

  • 비미분 가능 비볼록 최적화에 대한 비점근적 수렴 분석에서의 근본적인 격차를 해결하기 위해, 특히 ReLU와 같은 비가역적 활성화 함수를 갖는 경우를 대상으로 한다.
  • 리프시츠 연속성과 방향 미분 가능 함수에서 전통적인 $\epsilon$-정류점의 유한 시간 내 존재가 불가능하다는 것을 보여준다.
  • 유한 시간 수렴 분석이 가능한 조건을 완화한 새로운 정류점 개념인 $(\delta,\epsilon)$-정류점을 도입한다.
  • 결정론적 및 확률적 환경에서 $(\delta,\epsilon)$-정류점을 찾는 데 최적의 복잡도를 가지는 무작위 1차 알고리즘을 설계하고 분석한다.
  • 실증적으로 제안된 이론적 프레임워크를 검증하기 위해, ReLU 활성화 함수를 갖는 ResNet 학습에서 경쟁적인 성능을 보여준다.

제안 방법

  • $(\delta,\epsilon)$-정류점 도입: 점 $\bar{x}$가 $(\delta,\epsilon)$-정류점이 되기 위해서는 $\bar{x}$의 $\delta$-근접 영역 내 점들에서의 일반화된 기울기들의 볼록 조합의 $\epsilon$-구내에 원점이 포함되어야 한다.
  • 결정론적 환경에서 정규화된 기울기 하강 방식의 알고리즘을 제안하여 $(\delta,\epsilon)$-정류점을 찾는 데 $\tilde{\mathcal{O}}(\epsilon^{-3}\delta^{-1})$의 복잡도를 달성한다.
  • 유한 분산 환경에서의 모멘타움 기반 확률적 알고리즘을 설계하여 $\tilde{\mathcal{O}}(\epsilon^{-4}\delta^{-1})$의 복잡도를 달성한다.
  • 현재 반복점으로부터 $\delta$ 이내의 점들에서의 하위기울기를 반환하는 일반화된 기울기 오라클을 사용하여 국소적인 정류점 근사가 가능하도록 한다.
  • 오라클 호출 수에 대한 $\Omega(\delta^{-1})$ 하한을 확립하여, $\delta$에 대한 최소-최대 최적성(최적성)을 입증한다.
  • PyTorch의 자동 미분을 활용하여 실무에서 일반화된 기울기 오라클을 근사하는 확률적 변형인 Stochastic-Ingd를 구현한다.

실험 결과

연구 질문

  • RQ1비미분 가능 비볼록 함수에서 전통적인 $\epsilon$-정류점은 유한 시간 내에 찾을 수 있는가?
  • RQ2비미분 가능 비볼록 문제에 대해 유한 시간 내 비점근적 수렴 분석이 가능한 개선된 정류점 개념이 존재하는가?
  • RQ3결정론적 및 확률적 환경에서 $(\delta,\epsilon)$-정류점을 찾는 데 최적의 복잡도는 무엇인가?
  • RQ4모멘타움 및 적응형 기법은 비미분 가능 설정에서 이론적으로 정당화될 수 있는가? 이는 이론적으로 효과적이지 않다는 점에서 이론적 분석과 대조된다.
  • RQ5제안된 프레임워크는 깊은 ReLU 네트워크 학습에서 이론과 실천의 격차를 메울 수 있는가?

주요 결과

  • 리프시츠 연속성과 방향 미분 가능 함수에서조차, 일반화된 기울기 오라클에 접근할 수 있는 경우에도 $\epsilon$-정류점의 유한 시간 내 존재는 불가능하다.
  • 제안된 $(\delta,\epsilon)$-정류점 개념은 정수점 수렴 분석을 위해 필수적이며 충분하며, $\delta > 0$이어야 비가역성을 피할 수 있다.
  • 결정론적 알고리즘이 $(\delta,\epsilon)$-정류점을 찾는 데 $\tilde{\mathcal{O}}(\epsilon^{-3}\delta^{-1})$의 복잡도를 달성하며, 이는 $\delta$에 대해 $\Omega(\delta^{-1})$ 하한과 일치한다.
  • 확률적 모멘타움 기반 알고리즘이 $\tilde{\mathcal{O}}(\epsilon^{-4}\delta^{-1})$의 복잡도를 달성하며, 로그 인자 외에는 최적이다.
  • 실증 결과로 제안된 Stochastic-Ingd 알고리즘이 SGD와 모멘타움을 사용할 때와 유사한 성능을 보이며, CIFAR-10에서 ResNet 학습 시 ADAM보다 뛰어난 성능을 보였다.
  • 결과는 모멘타움 및 적응형 방법이 비미분 가능 설정에서는 이론적으로 필수적일 수 있으며, 이는 매끄럽지 않은 비볼록 이론과 대조된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.