Skip to main content
QUICK REVIEW

[논문 리뷰] Implicit Bias in Leaky ReLU Networks Trained on High-Dimensional Data

Spencer Frei, Gal Vardi|arXiv (Cornell University)|2022. 10. 13.
Stochastic Gradient Optimization Techniques인용 수 5
한 줄 요약

이 논문은 고차원적이고 거의 직교적인 데이터에서 훈련되는 두 층의 리키 ReLU 네트워크에서 경사 하강법과 경사 유량의 암묵적 편향을 조사한다. 그 결과, 경사 유량은 점점 커지면서 랭크가 최대 두인 네트워크를 생성하며, 이는 $β$-최대 마진 해법을 근사함을 보여주며, 작은 초기화를 사용한 경사 하강법은 훈련 전반에 걸쳐 가중치 행렬의 안정적 랭크를 상수로 유지하면서 급격히 감소시킴을 보여준다.

ABSTRACT

The implicit biases of gradient-based optimization algorithms are conjectured to be a major factor in the success of modern deep learning. In this work, we investigate the implicit bias of gradient flow and gradient descent in two-layer fully-connected neural networks with leaky ReLU activations when the training data are nearly-orthogonal, a common property of high-dimensional data. For gradient flow, we leverage recent work on the implicit bias for homogeneous neural networks to show that asymptotically, gradient flow produces a neural network with rank at most two. Moreover, this network is an $\ell_2$-max-margin solution (in parameter space), and has a linear decision boundary that corresponds to an approximate-max-margin linear predictor. For gradient descent, provided the random initialization variance is small enough, we show that a single step of gradient descent suffices to drastically reduce the rank of the network, and that the rank remains small throughout training. We provide experiments which suggest that a small initialization scale is important for finding low-rank neural networks with gradient descent.

연구 동기 및 목표

  • 고차원적이고 거의 직교적인 데이터를 가진 두 층의 리키 ReLU 네트워크에서 경사 기반 최적화의 암묵적 편향을 이해하는 것.
  • 이러한 데이터 조건 하에서 경사 유량과 경사 하강법이 어떻게 저랭크 해법으로 수렴하는지 분석하는 것.
  • 유한 시간 훈련 중에 네트워크의 안정적 랭크를 결정하는 초기화 스케일의 역할을 조사하는 것.
  • 합성 고차원 데이터와 CIFAR-10에서의 실험을 통해 이론적 결과를 검증하며, 초기화 분산이 미치는 영향을 부각하는 것.

제안 방법

  • 동차 신경망에 관한 최근 결과를 활용하여, 리키 ReLU 네트워크에서의 경사 유량이 $β$-최대 마진 문제의 KKT 점으로 방향 수렴함을 보여준다.
  • 네트워크 복잡도의 지표로 첫 번째 레이어 가중치 행렬 $W^{(t)}$ 의 안정적 랭크를 분석하며, 이는 $\|W^{(t)}\|_F^2 / \|W^{(t)}\|_2^2$ 로 정의된다.
  • 작은 초기화 분산을 가진 경사 하강법 한 스텝 이후, 안정적 랭크가 $O(\min(m,d))$ 에서 $m$, $d$, $n$ 과 무관한 절대 상수로 감소함을 증명한다.
  • 유한 시간 분석을 가능하게 하기 위해 리키 ReLU 활성화 함수의 스무딩 근사값을 고려한다.
  • SGD를 사용하여 합성 이진 클러스터 데이터와 CIFAR-10에서 결과를 실증적으로 검증하며, 표준 초기화와 작은 초기화 스케일을 비교한다.
  • 모델 복잡도의 척도로 안정적 랭크를 사용하고, 훈련 중 변화를 추적하여 암묵적 편향을 평가한다.

실험 결과

연구 질문

  • RQ1고차원적이고 거의 직교적인 데이터에서 훈련되는 두 층의 리키 ReLU 네트워크에서 경사 유량이 저랭크 해법으로 수렴하는가?
  • RQ2작은 초기화 분산을 가진 경사 하강법이 훈련 중에 가중치 행렬의 안정적 랭크를 빠르게 감소시키고 유지할 수 있는가?
  • RQ3가중치 초기화 스케일이 훈련된 네트워크의 안정적 랭크와 일반화 행동에 어떤 영향을 미치는가?
  • RQ4유한 시간 내에서 경사 하강법의 암묵적 편향은 경사 유량에서 관찰된 점점 커지는 행동과 어느 정도 유사한가?
  • RQ5고차원적이고 거의 직교적인 데이터에서 경사 하강법을 사용할 경우 안정적 랭크가 유한하게 유지되는가?

주요 결과

  • 경사 유량의 경우, 점점 커지는 해법의 랭크는 최대 두이며, 결정 경계에서 근사적인 $β$-최대 마진 선형 예측기와 대응된다.
  • 작은 초기화 분산을 가진 경사 하강법 한 스텝 이후, 가중치 행렬의 안정적 랭크는 $O(\min(m,d))$ 에서 $m$, $d$, $n$ 과 무관한 절대 상수로 감소한다.
  • 작은 분산 초기화를 사용할 경우, 훈련 전반에 걸쳐 네트워크의 안정적 랭크가 절대 상수로 유한하게 유지된다.
  • 고차원 합성 데이터에서의 실험은 작은 초기화가 안정적 랭크 감소를 빠르게 유도하는 반면, 더 큰 초기화는 높은 랭크를 유지함을 확인한다.
  • CIFAR-10에서 표준 TensorFlow 초기화를 사용할 경우 안정적 랭크는 74 이상을 유지하지만, 분산을 1/50으로 줄이면 3.25로 감소하고 오버피팅 시에는 10 이상으로 증가한다.
  • 더 작은 학습률일수록 안정적 랭크 감소가 더 빠르며, 작은 학습률로 장기간 훈련할 경우 더 낮은 랭크로 감소할 수 있어, 스텝 크기와 초기화 스케일 사이의 상충 관계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.