Skip to main content
QUICK REVIEW

[논문 리뷰] On the Local Minima of the Empirical Risk

Chi Jin, Lydia T. Liu|arXiv (Cornell University)|2018. 03. 25.
Stochastic Gradient Optimization Techniques인용 수 22
한 줄 요약

이 논문은 샘플링 노이즈로 인해 발생하는 유사 국소 최소값을 피하기 위해 부드럽게 처리된 경험 위험에 대한 확률적 경사 하강법(SGD) 알고리즘을 제안한다. 이 알고리즘이 진정한 인구 위험의 $\epsilon$-근사 국소 최소값을 찾을 수 있음을 증명하며, 경험 위험 오차 $\nu$ 가 $O(\epsilon^{1.5}/d)$ 이내로 제한될 경우에만 성립함을 보이며, 비볼록 설정에서 이러한 최적화 문제에 대해 날카롭고 최적의 허용 오차 한계를 확립한다.

ABSTRACT

Population risk is always of primary interest in machine learning; however, learning algorithms only have access to the empirical risk. Even for applications with nonconvex nonsmooth losses (such as modern deep networks), the population risk is generally significantly more well-behaved from an optimization point of view than the empirical risk. In particular, sampling can create many spurious local minima. We consider a general framework which aims to optimize a smooth nonconvex function $F$ (population risk) given only access to an approximation $f$ (empirical risk) that is pointwise close to $F$ (i.e., $\|F-f\|_{\infty} \le ν$). Our objective is to find the $ε$-approximate local minima of the underlying function $F$ while avoiding the shallow local minima---arising because of the tolerance $ν$---which exist only in $f$. We propose a simple algorithm based on stochastic gradient descent (SGD) on a smoothed version of $f$ that is guaranteed to achieve our goal as long as $ν\le O(ε^{1.5}/d)$. We also provide an almost matching lower bound showing that our algorithm achieves optimal error tolerance $ν$ among all algorithms making a polynomial number of queries of $f$. As a concrete example, we show that our results can be directly used to give sample complexities for learning a ReLU unit.

연구 동기 및 목표

  • 기본 인구 위험으로부터 유래된 샘플링 노이즈로 인해 발생하는 경험 위험의 유사 국소 최소값 문제를 다루기 위해.
  • 대규모 노이즈 기반 메커니즘(예: SGLD 또는 시뮬레이티드 앤날링)에 의존하지 않고 얕은 국소 최소값을 피할 수 있는 단순한 최적화 기반 알고리즘을 설계하기 위해.
  • 모든 알고리즘이 여전히 진정한 인구 위험의 $\epsilon$-근사 국소 최소값을 찾을 수 있도록 허용 가능한 최적의 허용 오차 $\nu$ 를 결정하기 위해.
  • 최소한의 노이즈로도 비볼록이고 비연속적인 경험 위험 최소화 문제에서 유사 최소값을 탈출할 수 있는 이론적 보장을 확립하기 위해.

제안 방법

  • 비연속성과 유사 국소 최소값을 줄이기 위해 경험 위험 함수의 부드러운 버전을 제안한다.
  • 이 부드러운 경험 위험에 대해 확률적 경사 하강법(SGD)을 적용하여 인구 위험을 간접적으로 최적화한다.
  • 편차 분석을 통해 고려 확률로 SGD가 경험 위험의 얕은 국소 최소값 근처 영역을 탈출할 수 있음을 보여준다.
  • 재귀적 오차 한계와 행렬 편차 이론을 활용하여 반복값이 진정한 인구 위험 구조에서 벗어나지 않도록 제어한다.
  • 하위레벨 집합의 체적 비율에 기반한 국소화 추론을 도입하여, 유사 최소값에 갇힐 확률을 제한한다.
  • 모든 다항식 쿼리 알고리즘 중에서 $O(\epsilon^{1.5}/d)$ 허용 오차가 최적임을 보여주는 하한선을 도출한다.

실험 결과

연구 질문

  • RQ1SGLD나 시뮬레이티드 앤날링과 같은 큰 노이즈 주입에 의존하지 않고도, 단순하고 노이즈 없는 최적화 알고리즘인 SGD가 경험 위험의 얕은 국소 최소값을 탈출할 수 있는가?
  • RQ2경험 위험의 오차 $\nu$ 가 얼마나 클 수 있는가면 진정한 인구 위험의 $\epsilon$-근사 국소 최소값을 여전히 찾을 수 있는가?
  • RQ3$\nu$ 에 대한 $O(\epsilon^{1.5}/d)$ 허용 오차 한계가 최적인가, 아니면 다른 알고리즘이 더 높은 허용 오차를 달성할 수 있는가?
  • RQ4차원 수 $d$ 와 정밀도 $\epsilon$ 는 샘플링 유도 유사 최소값에 대한 최적화의 강건성에 어떻게 영향을 미치는가?
  • RQ5이 프레임워크는 샘플링을 초월해, $\nu$ 가 적대적 편향을 나타내는 강건학습 또는 개인 정보 보호 학습과 같은 분야에 적용 가능한가?

주요 결과

  • 부드러운 경험 위험에 기반한 제안된 SGD 기반 알고리즘은 높은 확률로 진정한 인구 위험의 $\epsilon$-근사 국소 최소값을 성공적으로 찾는다.
  • 이 알고리즘이 보장되려면 경험 위험 오차가 $\nu \leq O(\epsilon^{1.5}/d)$ 를 만족해야 하며, 이는 최적이 됨을 입증하였다.
  • 거의 일치하는 하한선이 확립되어, 다항식 수의 쿼리를 사용하는 모든 알고리즘이 $O(\epsilon^{1.5}/d)$ 보다 큰 $\nu$ 를 허용할 수 없음을 증명하였다.
  • 분석 결과, 안장점(또는 얕은 국소 최소값)을 탈출할 확률은 최소 $1 - 2\sqrt{\delta}$ 이상이며, $\delta$ 는 실패 확률을 제어한다.
  • 이 프레임워크는 렐루 유닛 학습과 같은 구체적 문제에 적용 가능하며, $\nu$-허용 오차의 상호 관계에 기반한 명시적 표본 복잡도 한계를 제공한다.
  • 결과적으로 큰 노이즈가 필요로 하지 않으며, 유도된 허용 오차 범위 내에서 단순한 SGD와 스무딩만으로도 얕은 국소 최소값을 탈출할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.