Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Networks Efficiently Learn Low-Dimensional Representations with SGD

Alireza Mousavi-Hosseini, Sejun Park|arXiv (Cornell University)|2022. 09. 29.
Stochastic Gradient Optimization Techniques인용 수 6
한 줄 요약

이 논문은 입력 차원 $d$가 크더라도, 두 층의 ReLU 신경망에서 가중치 감소를 동반한 확률적 경사 하강법(SGD)이 낮은 차원의 표현을 효율적으로 학습할 수 있음을 보여준다. 이는 첫 번째 층의 가중치가 진짜 모델의 방향으로 생성하는 $k$차원 주성분 부분공간으로 수렴함을 증명함으로써, 네트워크의 너비에 관계없이 일반화 경계를 확보하고, 단일색인 모델의 경우 샘플 복잡도가 $d$에 선형적으로 의존함을 보여준다. 이는 커널 방법보다 뛰어난 성능을 발휘한다.

ABSTRACT

We study the problem of training a two-layer neural network (NN) of arbitrary width using stochastic gradient descent (SGD) where the input $\boldsymbol{x}\in \mathbb{R}^d$ is Gaussian and the target $y \in \mathbb{R}$ follows a multiple-index model, i.e., $y=g(\langle\boldsymbol{u_1},\boldsymbol{x} angle,...,\langle\boldsymbol{u_k},\boldsymbol{x} angle)$ with a noisy link function $g$. We prove that the first-layer weights of the NN converge to the $k$-dimensional principal subspace spanned by the vectors $\boldsymbol{u_1},...,\boldsymbol{u_k}$ of the true model, when online SGD with weight decay is used for training. This phenomenon has several important consequences when $k \ll d$. First, by employing uniform convergence on this smaller subspace, we establish a generalization error bound of $O(\sqrt{{kd}/{T}})$ after $T$ iterations of SGD, which is independent of the width of the NN. We further demonstrate that, SGD-trained ReLU NNs can learn a single-index target of the form $y=f(\langle\boldsymbol{u},\boldsymbol{x} angle) + ε$ by recovering the principal direction, with a sample complexity linear in $d$ (up to log factors), where $f$ is a monotonic function with at most polynomial growth, and $ε$ is the noise. This is in contrast to the known $d^{Ω(p)}$ sample requirement to learn any degree $p$ polynomial in the kernel regime, and it shows that NNs trained with SGD can outperform the neural tangent kernel at initialization. Finally, we also provide compressibility guarantees for NNs using the approximate low-rank structure produced by SGD.

연구 동기 및 목표

  • 목표가 $k \ll d$ 방향에 의존할 때, 넓은 두 층의 신경망에서 SGD가 낮은 차원의 구조를 어떻게 학습하는지 이해하는 것.
  • 네트워크 너비에 독립적인 SGD로 훈련된 네트워크의 일반화 보장을 확립하는 것.
  • SGD로 훈련된 ReLU 네트워크가 다항식 목표를 $d$에 선형적인 샘플 복잡도로 학습할 수 있으며, 이는 커널 방법보다 뛰어나다는 것을 보여주는 것.
  • SGD에 의해 유도된 낮은 질서의 구조에 기반한 압축 가능성 보장을 제공하는 것.

제안 방법

  • 임의의 너비 $m$을 가진 두 층의 ReLU 신경망의 훈련 동역학을 온라인 SGD와 가중치 감소를 사용하여 분석한다.
  • 가우스형 입력과 노이즈가 있는 링크 함수를 가진 다중색인 함수 $y = g(\langle \mathbf{u}_1, \mathbf{x} \rangle, \dots, \langle \mathbf{u}_k, \mathbf{x} \rangle)$로 목표를 모델링한다.
  • SGD의 첫 번째 층 가중치가 $\mathbf{u}_1, \dots, \mathbf{u}_k$로 생성하는 $k$차원 주성분 부분공간으로 수렴함을 증명한다.
  • 낮은 차원의 부분공간에서의 균일 수렴을 사용하여 $T$ 반복 후 일반화 오차 경계를 $\mathcal{O}(\sqrt{kd/T})$로 유도한다.
  • 서브가우시안 및 서브지수 농도 불등식을 사용하여 무작위 특징과 기울기 갱신의 행동을 제어한다.
  • 레데마처 복잡도와 대칭화를 활용하여 일반화 갭을 경계화하고 샘플 복잡도 결과를 확립한다.

실험 결과

연구 질문

  • RQ1목표가 $k \ll d$일 때, 넓은 두 층의 ReLU 네트워크에서 SGD가 진짜 모델의 방향으로 생성하는 주성분 부분공간으로 수렴하는가?
  • RQ2SGD로 훈련된 네트워크의 일반화 오차는 네트워크 너비에 독립적으로 경계지을 수 있는가?
  • RQ3SGD로 훈련된 ReLU 네트워크는 다항식 목표를 $d$에 선형적인 샘플 복잡도로 학습할 수 있는가? 이는 커널 방법이 요구하는 $d^{\Omega(p)}$와 대비된다.
  • RQ4SGD로 훈련된 네트워크의 압축 가능성은 무엇이며, 일반화와의 관계는 어떠한가?

주요 결과

  • SGD로 훈련된 두 층의 ReLU 네트워크에서 첫 번째 층 가중치는 진짜 모델의 방향 $\mathbf{u}_1, \dots, \mathbf{u}_k$로 생성하는 $k$차원 주성분 부분공간으로 수렴한다.
  • 반복 $T$ 후 일반화 오차는 네트워크 너비 $m$에 관계없이 $\mathcal{O}(\sqrt{kd/T})$로 경계지어진다.
  • 단일색인 모델에서 $f$가 단조적이며 다항식 성장성을 가지는 경우, SGD는 $d$에 선형적인 샘플 복잡도(로그 인자까지)를 달성하며, 커널 방법이 요구하는 $d^{\Omega(p)}$의 샘플 수보다 뛰어나다.
  • SGD에 의해 유도된 낮은 질서의 구조는 압축 가능성 보장을 가능하게 하며, 모델 복잡도를 압축된 표현의 크기와 연결한다.
  • SGD로 훈련된 ReLU 네트워크는 초기화 시 신경 기저 커널(Neural Tangent Kernel)보다 특정 다항식 목표를 더 효율적으로 학습할 수 있다.
  • 주성분 부분공간으로의 수렴은 향상된 특징 학습을 가능하게 하여, 무작위 특징보다 더 우수한 일반화 성능을 이끈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.