Skip to main content
QUICK REVIEW

[논문 리뷰] Implicit regularization for deep neural networks driven by an Ornstein-Uhlenbeck like process

Guy Blanc, Neha Gupta|arXiv (Cornell University)|2019. 04. 19.
Stochastic Gradient Optimization Techniques참고 문헌 22인용 수 20
한 줄 요약

이 논문은 독립적인 레이블 노이즈 하에서 확률적 경사하강법(SGD)으로 훈련되는 딥 네ural 네트워크에서 발생하는 새로운 암묵적 정규화 효과를 제안하며, 이러한 훈련 방식이 데이터 포인트들에 대해 모델 기울기의 제곱 ℓ₂ 노름 합을 암묵적으로 최소화함을 보여준다. 주요 결과는 0 훈련 오차 솔루션들이 이 암묵적 정규화자의 국소 최소값으로 끌려가며, 초기화와 관계없이 '간단한' 모델을 촉진한다는 것이다.

ABSTRACT

We consider networks, trained via stochastic gradient descent to minimize $\ell_2$ loss, with the training labels perturbed by independent noise at each iteration. We characterize the behavior of the training dynamics near any parameter vector that achieves zero training error, in terms of an implicit regularization term corresponding to the sum over the data points, of the squared $\ell_2$ norm of the gradient of the model with respect to the parameter vector, evaluated at each data point. This holds for networks of any connectivity, width, depth, and choice of activation function. We interpret this implicit regularization term for three simple settings: matrix sensing, two layer ReLU networks trained on one-dimensional data, and two layer networks with sigmoid activations trained on a single datapoint. For these settings, we show why this new and general implicit regularization effect drives the networks towards "simple" models.

연구 동기 및 목표

  • 과도하게 파rameter화되어 있고 용량이 큰 딥 네트워크가 왜 잘 일반화되는지 설명하기 위해.
  • 확률적 경사하강법에 레이블 노이즈가 첨가되었을 때 발생하는 암묵적 유도 편향을 규명하기 위해.
  • 레이블 노이즈가 있는 SGD가 초기화와 무관하게 '간단한' 모델을 어떻게 이끌어내는지 메커니즘을 수식화하기 위해.
  • 레이블 노이즈가 있는 SGD의 고정점을 새로운 암묵적 정규화자의 국소 최소값으로 특성화하기 위해.

제안 방법

  • 각 훈련 단계에서 독립적이고 평균이 0이며 유계인 레이블 노이즈가 첨가된 SGD의 동역학을 분석한다.
  • 모델 기울기의 ℓ₂ 노름 제곱의 평균으로서 암묵적 정규화자의 수식적 특성화를 도출한다.
  • 0 훈련 오차 파arameter 벡터가 이 정규화자의 국소 최소값일 경우에만 안정적인 고정점이 되도록 증명한다.
  • 행렬 감지, 1차원 데이터에 대한 두 층의 ReLU 네트워크, 단일 데이터 포인트에 대한 두 층의 시그모이드 네트워크의 세 가지 설정에 이 프레임워크를 적용한다.
  • 분석적 및 실험적 방법을 통해 정규화자가 기울기 크기를 낮추는 모델을 선호함을 보이며, 이는 단순성을 의미한다.
  • 정규화자가 구조적 제약—예를 들어 가중치 공유 또는 비활성화된 뉴런—을 강제하여 더 단순하고 일반화 능력이 뛰어난 모델을 만들어내는 것으로 나타났다.

실험 결과

연구 질문

  • RQ1SGD에서의 레이블 노이즈는 딥 네트워크에서 어떻게 암묵적 정규화를 유도하는가?
  • RQ2SGD에 레이블 노이즈가 첨가되었을 때 나타나는 암묵적 정규화자의 수학적 형태는 무엇인가?
  • RQ3왜 레이블 노이즈가 있는 SGD는 단순한 모델로 수렴하는 반면, 표준 SGD는 그렇지 않은가?
  • RQ4이러한 암묵적 정규화는 과도하게 파rameter화된 네트워크에서의 일반화를 어떻게 설명하는가?
  • RQ5암묵적 정규화자는 0 훈련 오차 상태에서 모델 아키텍처와 파arameter 분포를 어떻게 제약하는가?

주요 결과

  • 암묵적 정규화자는 $\frac{1}{n}\sum_{i=1}^{n}\|\nabla_{\theta}h(x_{i},\theta)\|_{2}^{2}$ 로 주어지며, 0 훈련 오차 솔루션은 이 항목의 국소 최소값일 경우에만 끌려간다.
  • 행렬 감지의 경우, 레이블 노이즈 덕분에 어떤 초기화로부터든 최소 질서 해로 수렴할 수 있으며, 이는 이전 연구에서 관찰된 암묵적 질서 정규화를 재현한다.
  • 1차원 데이터에 대한 두 층의 ReLU 네트워크에서는 정규화자가 더 적은 활성 뉴런과 대칭적인 가중치 패턴을 선호하여 단순성을 촉진한다.
  • 단일 데이터 포인트에 대한 두 층의 시그모이드 네트워크에서는 정규화자가 모든 비영 단위가 동일한 활성화 크기와 같은 부호를 가져야 하도록 강제하여 모델 복잡도를 낮춘다.
  • 분석 결과, '반발하지 않는' 고정점은 모든 비영 단위가 $h_i$와 $c_i$ 값을 동일하게 가져야 하며, 부호를 제외한 한도에서 이를 요구함으로써 구조적 단순성을 강제한다.
  • 정규화자의 도함수는 0에서 벗어난 곳에서는 단사적이며, 이는 안정적인 고정점에서 대칭적이거나 비활성화된 단위만 존재할 수 있음을 의미하며, 이는 추가로 단순성을 강화한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.