[논문 리뷰] Implicit Bias of Gradient Descent for Mean Squared Error Regression with Two-Layer Wide Neural Networks
이 논문은 평균 제곱 오차 회귀를 위한 넓은 두 층의 ReLU 신경망에서 경사하강법이 부드러운 함수로의 암묵적 편향을 보임을 규명한다. 이는 해가 보간 스퍼린과 매우 유사한 형태를 띤다. 단변수 회귀의 경우, 해는 이차 도함수의 곡률 가중 2노름을 최소화하는 함수로 수렴하며, 이 가중치는 초기화 분포에 따라 달라진다. 균일한 초기화 하에서는 자연 스퍼린이, 다변수 경우에서는 다항형 스퍼린이 유도된다.
We investigate gradient descent training of wide neural networks and the corresponding implicit bias in function space. For univariate regression, we show that the solution of training a width-$n$ shallow ReLU network is within $n^{- 1/2}$ of the function which fits the training data and whose difference from the initial function has the smallest 2-norm of the second derivative weighted by a curvature penalty that depends on the probability distribution that is used to initialize the network parameters. We compute the curvature penalty function explicitly for various common initialization procedures. For instance, asymmetric initialization with a uniform distribution yields a constant curvature penalty, and thence the solution function is the natural cubic spline interpolation of the training data. \hj{For stochastic gradient descent we obtain the same implicit bias result.} We obtain a similar result for different activation functions. For multivariate regression we show an analogous result, whereby the second derivative is replaced by the Radon transform of a fractional Laplacian. For initialization schemes that yield a constant penalty function, the solutions are polyharmonic splines. Moreover, we show that the training trajectories are captured by trajectories of smoothing splines with decreasing regularization strength.
연구 동기 및 목표
- 과파ram터화된 두 층의 ReLU 신경망에서 평균 제곱 오차 회귀에 대해 경사하강법의 암묵적 편향을 규명하는 것.
- 최적화 경로와 최종 해가 점점 감소하는 정규화 강도를 갖는 스무딩 스퍼린 모델과 연결되는 방식을 설명하는 것.
- 초기화 분포에 기반한 함수 공간에서의 곡률 페널티의 명시적 형태를 유도하는 것.
- 분수 라플라스 연산자와 라돈 변환을 사용하여 단변수 분석을 다변수 회귀로 확장하는 것.
- 확률적 경사하강법이 표준 경사하강법과 동일한 암묵적 편향을 보이는지 확인하는 것.
제안 방법
- 넓은 네트워크의 선형화된 학습 동역학을 사용하여 커널 영역에서의 경로 유량 동역학을 분석한다.
- 함수 공간에서의 변분 문제를 유도하여, 암묵적 편향이 이차 도함수(또는 다변수 경우 분수 라플라스 연산자)의 가중 2노름을 최소화하는 것으로 특징지운다.
- 해를 시간이 지남에 따라 감소하는 정규화 강도를 갖는 스무딩 스퍼린으로 표현하며, 이는 학습 경로와 연결된다.
- 균일하고 비대칭 초기화와 같은 일반적인 초기화 방법에 대해 곡률 페널티 함수를 명시적으로 계산한다.
- 신경 탄성 커널(NTK) 프레임워크를 사용하여 매개변수 공간 최적화와 함수 공간 보간 간의 관계를 규명한다.
- 커널 리지 회귀와 스퍼린 이론의 결과를 적용하여 넓이가 증가하고 학습이 진행됨에 따라 보간 스퍼린으로 수렴함을 보여준다.
실험 결과
연구 질문
- RQ1평균 제곱 오차 손실로 훈련된 넓은 두 층의 ReLU 신경망에서 경사하강법이 해를 어떻게 편향시키는가?
- RQ2단변수 회귀에서 암묵적 편향의 함수 형태는 무엇이며, 초기화 분포에 어떻게 의존하는가?
- RQ3암묵적 편향은 다변수 회귀로 어떻게 일반화되며, 분수 라플라스 연산자는 어떤 역할을 하는가?
- RQ4학습 경로는 감소하는 정규화 강도를 갖는 스무딩 스퍼린의 시퀀스로 기술될 수 있는가?
- RQ5확률적 경사하강법은 이 설정에서 표준 경사하강법과 동일한 암묵적 편향을 보이는가?
주요 결과
- 단변수 회귀의 경우, 훈련된 함수는 초기화 분포에 의존하는 곡률 페널티로 가중된 이차 도함수의 2노름을 최소화하는 보간 함수와 $ n^{-1/2} $ 이내에 존재한다.
- 균일한 초기화 하에서는 곡률 페널티가 일정하며, 해는 훈련 데이터의 자연 스퍼린 보간으로 수렴한다.
- 다변수 회귀의 경우, 암묵적 편향은 분수 라플라스 연산자의 라돈 변환에 의해 지배되며, 페널티가 일정할 경우 해는 다항형 스퍼린에 해당한다.
- 경사하강법의 학습 경로는 감소하는 정규화 강도를 갖는 스무딩 스퍼린의 시퀀스로 잘 근사된다.
- 확률적 경사하강법은 표준 경사하강법과 동일한 암묵적 편향을 보이며, 최적화 방법의 변형에 대한 강건성을 확인한다.
- 결과는 다른 활성화 함수로도 확장 가능하며, 커널 영역이 유지되는 한 최적화 절차의 선택에 대해 강건하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.