Skip to main content
QUICK REVIEW

[논문 리뷰] How Implicit Regularization of ReLU Neural Networks Characterizes the Learned Function -- Part I: the 1-D Case of Two Layers with Random First Layer

Jakob Heiss, Josef Teichmann|arXiv (Cornell University)|2019. 11. 07.
Stochastic Gradient Optimization Techniques참고 문헌 33인용 수 5
한 줄 요약

이 논문은 첫 번째 레이어 가중치가 무작위인 두 층으로 이루어진 ReLU 신경망을 훈련시킬 때, 훈련된 함수가 암묵적으로 정규화되며, ℓ² 정규화 하에 부드러운 스퍼플 인터폴레이션으로 수렴함을 규명한다. 최소 제곱 회귀의 경우, 이러한 네트워크에서 조기 정지된 경사하강법은 스무딩 스퍼플 회귀에 해당하며, 훈련의 암묵적 편향과 함수 공간 내 고전적 정규화 사이의 깊은 연결을 드러낸다.

ABSTRACT

In this paper, we consider one dimensional (shallow) ReLU neural networks in which weights are chosen randomly and only the terminal layer is trained. First, we mathematically show that for such networks L2-regularized regression corresponds in function space to regularizing the estimate's second derivative for fairly general loss functionals. For least squares regression, we show that the trained network converges to the smooth spline interpolation of the training data as the number of hidden nodes tends to infinity. Moreover, we derive a novel correspondence between the early stopped gradient descent (without any explicit regularization of the weights) and the smoothing spline regression.

연구 동기 및 목표

  • 무작위 첫 번째 레이어 가중치를 가진 얕은 ReLU 네트워크를 훈련시킬 때 발생하는 암묵적 정규화를 이해하는 것.
  • 이러한 네트워크에서 ℓ²-정규화된 회귀가 학습하는 함수를 특성화하는 것.
  • 무한한 너비 극한에서 조기 정지된 경사하강법과 스무딩 스퍼플 회귀 간의 대응 관계를 확립하는 것.
  • 첫 번째 레이어 가중치가 훈련된 모델의 인덕티브 바이어스를 형성하는 데 수행하는 역할를 명확히 하는 것.
  • 넓고 무작위로 설정된 ReLU 네트워크의 일반화 및 최적화 행동에 대한 엄밀한 이론적 기반을 제공하는 것.

제안 방법

  • 무작위 첫 번째 레이어 가중치와 학습 가능한 두 번째 레이어 가중치를 가진 두 층으로 이루어진 ReLU 네트워크를 분석한다.
  • 무한한 은닉 유닛 수의 극한을 통해 평균장 유형 분석을 통해 거시적 행동을 유도한다.
  • 기능 해석학과 약한 도함수를 사용하여 학습된 함수의 두 번째 도함수를 특성화한다.
  • 두 번째 레이어 가중치의 정규화와 L² 공간에서 함수의 두 번째 도함수 간의 대응 관계를 수립한다.
  • 새로운 정규화 기능을 사용하여 조기 정지된 경사하강법과 스무딩 스퍼플 회귀 간의 등가성을 유도한다.
  • 적응형 회귀 스퍼플을 스킵 연결이 있는 경우와 없는 경우로 나누어 학습된 함수를 모델링하고 정규화 효과를 비교한다.

실험 결과

연구 질문

  • RQ1ℓ²-정규화된 훈련을 통해 첫 번째 레이어 가중치가 무작위인 두 층으로 이루어진 ReLU 네트워크가 함수 공간에서 학습된 함수를 어떻게 정규화하는가?
  • RQ2은닉 유닛 수가 무한히 증가할 때 이러한 네트워크가 수렴하는 극한의 함수 클래스는 무엇인가?
  • RQ3이러한 네트워크에서 조기 정지된 경사하강법은 고전적 스무딩 스퍼플 회귀와 어떻게 관련이 있는가?
  • RQ4첫 번째 레이어 가중치의 분포가 모델의 암묵적 편향을 형성하는 데 수행하는 역할는 무엇인가?
  • RQ5학습된 함수는 첫 번째 레이어 가중치 분포에서 유도된 특정 정규화 항을 가진 스퍼플로 특성화될 수 있는가?

주요 결과

  • ℓ²-정규화된 회귀의 경우, 훈련된 네트워크는 은닉 유닛 수가 무한히 증가함에 따라 훈련 데이터의 스무딩 스퍼플 인터폴레이션으로 수렴한다.
  • 조기 정지된 경사하강법은 이러한 네트워크에서 스무딩 스퍼플 회귀에 정확히 해당하며, 최적화 역학과 고전적 정규화 사이의 직접적인 연결을 확립한다.
  • 학습된 함수의 두 번째 도함수는 첫 번째 레이어 가중치 분포에 따라 정규화되며, 특히 가중치 분포의 꼬리 부분에 대한 적분을 통해 영향을 받는다.
  • 첫 번째 레이어 가중치 분포가 뚜렷한 꼬리(예: 큰 간격에서 균일 분포)를 가질 경우, 선형 항과 절댓값 항의 계수에 대한 정규화 효과가 무시 가능해지며, 스킵 연결이 있는 모델과 없는 모델 간의 행동이 거의 동일해진다.
  • 최적화 문제의 해는 훈련 손실과 첫 번째 레이어 가중치 밀도에서 유도된 가중치를 가진 두 번째 도함수의 가중 L² 노름을 조합한 기능을 최소화하는 것과 등가하다.
  • 첫 번째 레이어 가중치 분포의 꼬리가 점점 더 두꺼워질수록, 적응형 회귀 스퍼플은 스킵 연결 여부와 관계없이 W¹,∞ 공간에서 고전적 스무딩 스퍼플로 균일 수렴한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.