Skip to main content
QUICK REVIEW

[논문 리뷰] Empirical Risk Minimization in the Interpolating Regime with Application to Neural Network Learning

Nicole Mücke, Ingo Steinwart|arXiv (Cornell University)|2019. 05. 25.
Model Reduction and Neural Networks참고 문헌 26인용 수 4
한 줄 요약

이 논문은 모델이 훈련 오차를 0으로 줄이는 '보간 영역'에서 경험적 리스크 최소화(Empirical Risk Minimization, ERM)에 대한 이론적 보장을 수립한다. 일부 ERM 방법은 큰 가설 클래스에서 보편적으로 일致하고 최적의 학습률을 달성하는 반면, 다른 방법은 치명적인 실패를 겪는다. 또한 저자들은 깊이가 충분히 넓은 딥 ReLU 네트워크에서도 유사한 행동이 나타나며, 미묘한 조건 하에 일관성과 근사 최적 수렴률을 증명한다.

ABSTRACT

A common strategy to train deep neural networks (DNNs) is to use very large architectures and to train them until they (almost) achieve zero training error. Empirically observed good generalization performance on test data, even in the presence of lots of label noise, corroborate such a procedure. On the other hand, in statistical learning theory it is known that over-fitting models may lead to poor generalization properties, occurring in e.g. empirical risk minimization (ERM) over too large hypotheses classes. Inspired by this contradictory behavior, so-called interpolation methods have recently received much attention, leading to consistent and optimally learning methods for some local averaging schemes with zero training error. However, there is no theoretical analysis of interpolating ERM-like methods so far. We take a step in this direction by showing that for certain, large hypotheses classes, some interpolating ERMs enjoy very good statistical guarantees while others fail in the worst sense. Moreover, we show that the same phenomenon occurs for DNNs with zero training error and sufficiently large architectures.

연구 동기 및 목표

  • 오버파ram터화된 딥 뉴럴 네트워크(DNN)에서 훈련 오차가 0임에도 불구하고 좋은 일반화가 이루어지는 이유를 설명하기 위해.
  • 큰 가설 클래스에서 경험적 리스크 최소화(ERM)가 일관되고 최적의 학습 성능을 낼 수 있는지 분석하기 위해.
  • 영역이 0이 되는 상황에서도 성공하거나 실패하는 보간 ERM 방법을 구분할 수 있는 조건을 규명하기 위해.
  • 전통적인 비모수적 방법에서의 이론적 분석을 훈련 오차가 0인 DNN로 확장하기 위해.
  • 입력 차원과 표본 수에 대해 선형적으로 증가하는 너비를 갖는 특정 DNN 아키텍처가 보간 영역에서 일관성과 근사 최적 학습률을 달성할 수 있음을 보여주기 위해.

제안 방법

  • 일부 보간 최소 제곱 ERM 알고리즘은 보편적으로 일관되지만, 다른 알고리즘은 부정의 회귀 함수로 수렴하는 큰 가설 클래스 $\mathcal{H}_n$를 구성한다.
  • 데이터에 의존하는 세제곱 분할 규칙 $\pi_{m_n,s_n}$를 사용하여 훈련 데이터 기반의 입력 공간 분할 $\mathcal{A}_D$를 정의하고, 히스토그램 기반 예측자 $h_{D,\mathcal{A}_D}$를 구성한다.
  • 커버링 수와 농도 부등식을 적용하여 초과 리스크를 유계로 만들며, $\mathcal{H}_\mathcal{A}$의 $\varepsilon$-커버링 수와 $|\mathcal{P}_n| \leq c n^{1+\beta}$를 활용한다.
  • 베이즈 함수의 허더링 연속성 조건 하에서 경험 히스토그램 규칙의 학습률을 유도하며, $s_n = n^{-\gamma}$ 이며 $\gamma = 1/(2\alpha + d)$로 설정한다.
  • 모든 $s_n \to 0$ 이며 $\ln(ns_n^d)/(ns_n^d) \to 0$ 인 경우, 초과 리스크는 확률적으로 0으로 수렴함을 증명한다.
  • 최소 두 개의 은닉층을 갖는 ReLU DNN로 결과를 확장하여, 일관성과 전체 연결 네트워크의 경우 $\mathcal{O}(d^2 n^2)$ 훈련 시간을 확보한다.

실험 결과

연구 질문

  • RQ1큰 가설 클래스에서 ERM를 수행할 때 훈련 오차가 0이 되더라도 일관되고 최적의 학습 성능을 달성할 수 있는가?
  • RQ2좋은 일반화를 보이는 보간 ERM 방법과 치명적인 실패를 겪는 방법을 구분하는 요소는 무엇인가?
  • RQ3히스토그램 규칙 등 전통적인 비모수적 방법에서 관찰된 통계적 현상이 훈련 오차가 0인 딥 뉴럴 네트워크에서도 나타나는가?
  • RQ4입력 차원과 표본 수에 대해 선형적으로 증가하는 너비를 갖는 딥 ReLU 네트워크가 보간 영역에서 일관성과 근사 최적 학습률을 달성할 수 있는가?
  • RQ5데이터 분할 및 네트워크 아키텍처에 대한 어떤 조건이 보간 예측자가 베이즈 리스크로 수렴하도록 보장하는가?

주요 결과

  • 일부 보간 ERM 방법은 큰 가설 클래스에서 보편적으로 일관되며, 고확률적으로 초과 리스크 경계가 $\mathcal{O}(\ln(n)/n)^{2\alpha\gamma}$ 비율로 감소함을 보여준다.
  • 다른 보간 ERM 방법은 완전히 실패하여 부정의 회귀 함수로 수렴하고 최적에 훨씬 못 미치는 리스크를 달성한다.
  • $\alpha$-허더링 연속성 베이즈 함수의 경우, 제안된 히스토그램 기반 ERM는 알려진 최적 수렴률에 $\ln(n)$ 요소를 제외하고 일치하는 학습률을 달성한다.
  • 모든 $n \to \infty$ 이며 $\ln(ns_n^d)/(ns_n^d) \to 0$ 이며 $s_n \to 0$ 이면, 초과 리스크는 확률적으로 0으로 수렴한다.
  • 입력 차원과 표본 수에 대해 선형적으로 증가하는 너비를 갖는 최소 두 개의 은닉층을 가진 ReLU DNN은 동일한 가정 하에 일관성과 근사 최적 수렴률을 달성한다.
  • 전체 연결 네트워크로 구현할 경우, 이러한 DNN의 훈련은 $\mathcal{O}(d^2 n^2)$ 시간 내에 수행될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.