Skip to main content
QUICK REVIEW

[논문 리뷰] Implicit Regularization in ReLU Networks with the Square Loss

Gal Vardi, Ohad Shamir|arXiv (Cornell University)|2020. 12. 09.
Stochastic Gradient Optimization Techniques참고 문헌 36인용 수 6
한 줄 요약

이 논문은 ReLU 네트워크에서 제곱 손실을 사용할 경우, 모델 파라미터의 명시적 함수로는 암시적 정규화를 정확히 기술할 수 없음을 보여준다. 단일 뉴런 또는 한 은닉층 네트워크일지라도 마찬가지이며, 그러나 $β$-노름은 진짜 암시적 편향을 약 2배 이내의 상수 요인으로 근사함으로써 일반화 분석을 위한 실용적인 대체 측정법을 제공한다.

ABSTRACT

Understanding the implicit regularization (or implicit bias) of gradient descent has recently been a very active research area. However, the implicit regularization in nonlinear neural networks is still poorly understood, especially for regression losses such as the square loss. Perhaps surprisingly, we prove that even for a single ReLU neuron, it is impossible to characterize the implicit regularization with the square loss by any explicit function of the model parameters (although on the positive side, we show it can be characterized approximately). For one hidden-layer networks, we prove a similar result, where in general it is impossible to characterize implicit regularization properties in this manner, except for the "balancedness" property identified in Du et al. [2018]. Our results suggest that a more general framework than the one considered so far may be needed to understand implicit regularization for nonlinear predictors, and provides some clues on what this framework should be.

연구 동기 및 목표

  • 제곱 손실로 훈련되는 비선형 신경망에서 암시적 정규화의 성격을 이해하기 위해.
  • ReLU 네트워크에서 경 Gradient flow가 명시적 정규화 함수 $Π(\mathbf{\theta})$로 특징지워질 수 있는지 조사하기 위해.
  • 이러한 네트워크에서의 암시적 편향이 알려진 노름(예: $β$-노름)으로 근사될 수 있는지 판단하기 위해.
  • 딥 러닝 이론에서 지배적인 명시적 정규화 함수 프레임워크에 도전하기 위해.
  • 노름 기반 특징 기술을 초월하여 암시적 편향을 이해하기 위한 새로운 이론적 기반을 제공하기 위해.

제안 방법

  • 제곱 손실을 사용하는 단일 ReLU 뉴런 네트워크에서의 경 Gradient flow 역학을 분석하며, 영손실 해로 수렴하는 데 중점을 둔다.
  • 단일 ReLU 뉴런에서 암시적 편향을 특징짓는 데 어떤 비상수 함수 $Π(\mathbf{w})$도 존재하지 않음을 증명하며, 그러한 함수는 $\mathbb{R}^d \setminus \{\mathbf{0}\}$ 위에서 반드시 상수여야 한다.
  • 단일 ReLU 뉴런에서 $β$-노름이 진짜 암시적 편향을 약 2배 이내의 상수 요인으로 근사함을 확립한다.
  • 분석을 한 은닉층 ReLU 네트워크로 확장하며, 일반적인 암시적 편향은 파라미터의 명시적 함수로 기술될 수 없지만, Du 등(2018)에서 제시한 균형성 성질은 여전히 유효함을 보인다.
  • 스케일링 추론과 회전 대칭성을 활용하여, 동일한 데이터 변환 하에 다른 해로 수렴하는 반례를 구성한다.
  • 매개변수 공간을 $\Psi^{-1}$를 통해 변환하여 네트워크 매개변수를 특징 공간의 해와 연결함으로써, 한계점의 분석을 가능하게 한다.

실험 결과

연구 질문

  • RQ1제곱 손실을 사용하는 단일 ReLU 뉴런에서 Gradient flow의 암시적 정규화는 가중치의 비상수 명시적 함수로 특징지어질 수 있는가?
  • RQ2제곱 손실로 훈련된 ReLU 네트워크에서 $β$-노름은 암시적 편향의 타당한 근사인가?
  • RQ3더 깊은 ReLU 네트워크에서 관찰된 균형성 성질이 제곱 손실과 함께 Gradient flow를 통해 유지되는가?
  • RQ4비선형 네트워크에서의 암시적 편향은 정규화 함수로 기술될 수 있는가, 아니면 더 일반적인 프레임워크가 필요한가?
  • RQ5제로 손실 해를 갖는 ReLU 네트워크에서 Gradient flow 궤적의 기하학적 성질과 불변성은 무엇인가?

주요 결과

  • 제곱 손실을 사용하는 단일 ReLU 뉴런에서, 어떤 비상수 함수 $\mathcal{R}(\mathbf{w})$도 암시적 정규화를 정확히 기술할 수 없으며, 그러한 함수는 $\mathbb{R}^d \setminus \{\mathbf{0}\}$ 위에서 반드시 상수여야 한다.
  • $\ell_2$-노름은 암시적 편향을 상수 요인으로 근사한다: $\mathbf{w}^*$가 최소 $\ell_2$-노름 영손실 해일 경우, $\|\mathbf{w}(\infty)\|_2 \leq 2\|\mathbf{w}^*\|_2$이다.
  • 한 은닉층 ReLU 네트워크에서는 일반적인 암시적 정규화가 파라미터의 어떤 명시적 함수로도 기술될 수 없으며, Du 등(2018)에서 제시한 균형성 성질를 제외하고는 그렇지 않다.
  • 논문은 데이터가 회전 변환에 대해 동일한 경우에도 Gradient flow가 다른 한계점으로 수렴하는 예시를 구성하며, 이러한 변환 하에서 암시적 편향이 불변이 아님을 보여준다.
  • 결과적으로, 제곱 손실을 갖는 비선형 모델에서 암시적 편향을 이해하기 위해 노름 기반 정규화를 초월한 더 일반적인 프레임워크가 필요하다는 것을 시사한다.
  • 분석 결과, 제곱 손실을 갖는 ReLU 네트워크에서의 암시적 편향은 이전에 상정한 것보다 훨씬 더 복잡하며, 표준 정규화 함수로는 특징지어지지 않음을 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.