Skip to main content
QUICK REVIEW

[논문 리뷰] Implicit bias of gradient descent for mean squared error regression with wide neural networks

Hui Jin, Guido Montúfar|arXiv (Cornell University)|2021. 05. 04.
Advanced Numerical Analysis Techniques참고 문헌 44인용 수 9
한 줄 요약

이 논문은 평균 제곱 오차 회귀를 위한 넓은 얕은 ReLU 신경망에서의 경사하강법을 분석하여, 해가 초기화 분포의 밀도에 가중된 곡률 페널티를 최소화하는 함수로 수렴함을 보여준다. 1차원 회귀의 경우, 이는 균일한 비대칭 초기화 하에서 자연스러운 세차 곡선 보간을 유도하며, 다변수 설정과 다른 활성화 함수로의 일반화는 점점 감소하는 정규화를 갖는 공간적으로 적응형 스무딩 스퍼린으로 이루어진다.

ABSTRACT

We investigate gradient descent training of wide neural networks and the corresponding implicit bias in function space. For 1D regression, we show that the solution of training a width-n shallow ReLU network is within n−1/2 of the function which fits the training data and whose difference from initialization has smallest 2-norm of the second derivative weighted by 1/ζ. The curvature penalty function 1/ζ is expressed in terms of the probability distribution that is utilized to initialize the network parameters, and we compute it explicitly for various common initialization procedures. For instance, asymmetric initialization with a uniform distribution yields a constant curvature penalty, and thence the solution function is the natural cubic spline interpolation of the training data. While similar results have been obtained in previous works, our analysis clarifies important details and allows us to obtain significant generalizations. In particular, the result generalizes to multivariate regression and different activation functions. Moreover, we show that the training trajectories are captured by trajectories of spatially adaptive smoothing splines with decreasing regularization strength.

연구 동기 및 목표

  • 평균 제곱 오차 회귀 중 넓은 얕은 ReLU 신경망에서 경사하강법의 암묵적 편향을 이해하기 위해.
  • 너비가 증가함에 따라 함수 공간에서의 극한 함수를 특성화하기 위해.
  • 초기화 분포가 해의 곡률 페널티에 어떻게 영향을 미치는지 밝히기 위해.
  • 1차원 결과를 다변수 회귀 및 다른 활성화 함수로 일반화하기 위해.
  • 학습 경로를 시간에 따라 변화하는 정규화를 갖는 공간적으로 적응형 스무딩 스퍼린과 연결하기 위해.

제안 방법

  • 평균 제곱 오차 손실을 갖는 너비-n 얕은 ReLU 신경망에서의 경사하강법을 분석한다.
  • 초기화 밀도 ζ에 의해 가중된 2-norm의 두 번째 도함수를 최소화하는 극한 해를 유도한다.
  • 예를 들어 균일한 비대칭 초기화와 같은 일반적인 초기화 방법에 대해 1/ζ의 곡률 페널티를 명시적으로 계산한다.
  • 초기화 밀도 ζ에 의해 가중된 곡률 페널티 하에서, 해가 최적 함수와 n−1/2 이내로 수렴함을 확립한다.
  • 분석을 다변수 회귀 및 1차원 외의 설정으로 일반화한다.
  • 학습 경로를 시간에 따라 감소하는 정규화 강도를 갖는 공간적으로 적응형 스무딩 스퍼린으로 모델링한다.

실험 결과

연구 질문

  • RQ11차원 회귀에서 넓은 ReLU 신경망에서의 경사하강법은 함수 공간에서 어떻게 수렴하는가?
  • RQ2초기화 분포는 경사하강법의 암묵적 편향을 어떻게 형상화하는가?
  • RQ3암묵적 편향은 곡률 페널티로 특성화될 수 있으며, 초기화 밀도에 따라 어떻게 표현되는가?
  • RQ4결과는 다변수 회귀 및 다른 활성화 함수로 확장되는가?
  • RQ5학습 경로는 시간에 따라 변화하는 정규화를 갖는 스무딩 스퍼린 역학과 어떻게 관련되는가?

주요 결과

  • 1차원 회귀에서, 너비-n 얕은 ReLU 신경망을 훈련한 해는 1/ζ에 의해 가중된 두 번째 도함수의 2-norm를 최소화하는 함수와 n−1/2 이내에 있다.
  • 균일한 비대칭 초기화 하에서는 곡률 페널티가 일정해지며, 이는 훈련 데이터의 자연스러운 세차 곡선 보간을 유도한다.
  • 다양한 초기화 절차에 대해 1/ζ의 곡률 페널티를 명시적으로 계산하여, 초기화와 암묵적 편향을 연결한다.
  • 분석은 다변수 회귀로 일반화되며, 동일한 암묵적 편향 구조를 유지한다.
  • 학습 경로는 정규화 강도가 시간에 따라 감소하는 공간적으로 적응형 스무딩 스퍼린으로 잘 묘사된다.
  • 암묵적 편향는 다양한 활성화 함수에 대해 강건하며, 1차원을 초월해 고차원으로까지 확장된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.