Skip to main content
QUICK REVIEW

[논문 리뷰] On Learning Over-parameterized Neural Networks: A Functional Approximation Perspective

Lili Su, Pengkun Yang|arXiv (Cornell University)|2019. 01. 01.
Stochastic Gradient Optimization Techniques인용 수 22
한 줄 요약

이 논문은 입력 분포에서 유도된 적분 연산자 거듭제곱을 적용하는 최적화 과정으로서 과도하게 파rameter화된 두 층 ReLU 네트워크의 경사하강법 학습을 연구한다. 너비가 Ω(n log n)일 때, 경험적 손실은 표적 함수의 저질서 근사 오차로 선형 수렴하며, 이는 샘플 크기 n에 독립적인 수렴 속도를 갖는다. 또한 거의 선형 과도한 파rameter화가 빠른 수렴을 위한 충분조건임을 증명한다.

ABSTRACT

We consider training over-parameterized two-layer neural networks with Rectified Linear Unit (ReLU) using gradient descent (GD) method. Inspired by a recent line of work, we study the evolutions of network prediction errors across GD iterations, which can be neatly described in a matrix form. When the network is sufficiently over-parameterized, these matrices individually approximate {\em an} integral operator which is determined by the feature vector distribution $ ho$ only. Consequently, GD method can be viewed as {\em approximately} applying the powers of this integral operator on the underlying/target function $f^*$ that generates the responses/labels. We show that if $f^*$ admits a low-rank approximation with respect to the eigenspaces of this integral operator, then the empirical risk decreases to this low rank approximation error at a linear rate which is determined by $f^*$ and $ ho$ only, i.e., the rate is independent of the sample size $n$. Furthermore, if $f^*$ has zero low-rank approximation error, then, as long as the width of the neural network is $\Omega(n\log n)$, the empirical risk decreases to $\Theta(1/\sqrt{n})$. To the best of our knowledge, this is the first result showing the sufficiency of nearly-linear network over-parameterization. We provide an application of our general results to the setting where $ ho$ is the uniform distribution on the spheres and $f^*$ is a polynomial. Throughout this paper, we consider the scenario where the input dimension $d$ is fixed.

연구 동기 및 목표

  • 과도하게 파arameter화된 두 층 ReLU 네트워크에서 경사하강법에 따른 일반화 및 최적화 역학을 이해하기 위해.
  • 예측 오차의 변화가 입력 분포에 의해 유도된 적분 연산자와 어떻게 관련되어 있는지 규명하기 위해.
  • 경사하강법이 표적 함수의 저질서 근사로 빠른 선형 수렴을 달성할 수 있는 조건을 설정하기 위해.
  • 특히 샘플 크기 n에 대한 네트워크 너비의 상대적 수준을 기준으로 수렴을 위한 최소 과도한 파arameter화 수준을 결정하기 위해.

제안 방법

  • 예측 오차의 변화를 행렬 표현을 통해 모델링하여, 이는 적분 연산자 구조를 반영한다.
  • 과도하게 파arameter화된 영역에서 헤시안 유사 행렬이 입력 분포 $\rho$에 의해 결정되는 적분 연산자로 수렴함을 보여준다.
  • 경사하강법의 역학을 표적 함수 $f^*$에 대해 이 적분 연산자의 거듭제곱을 약간 적용하는 것으로 해석한다.
  • 적분 연산자의 스펙트럼 분석을 통해, 수렴 속도가 $f^*$와 $\rho$에만 의존하고 샘플 크기 $n$에는 영향을 받지 않음을 입증한다.
  • 표적 함수 $f^*$가 적분 연산자의 고유공간 내에서 저질서 근사를 갖는다면, 경험적 손실이 선형으로 감소함을 증명한다.
  • 네트워크 너비가 $\Omega(n\log n)$일 때, 저질서 근사 오차가 0이면 손실이 $\Theta(1/\sqrt{n})$로 수렴함을 보여준다.

실험 결과

연구 질문

  • RQ1경사하강법은 기능 근사 측면에서 과도하게 파arameter화된 ReLU 네트워크를 어떻게 최적화하는가?
  • RQ2입력 분포 $\rho$는 경사하강법의 수렴 속도를 결정하는 데 어떤 역할을 하는가?
  • RQ3거의 선형 과도한 파arameter화($\Omega(n\log n)$)가 표적 함수로의 빠른 수렴을 위한 충분한 조건가능한가?
  • RQ4경험적 손실이 샘플 크기 $n$에 독립적으로 선형으로 감소하는 조건은 무엇인가?
  • RQ5표적 함수 $f^*$의 스펙트럼 구조가 적분 연산자에 대해 어떻게 구성되어 있는가에 따라 최적화 역학은 어떻게 영향을 받는가?

주요 결과

  • 표적 함수 $f^*$가 적분 연산자의 고유공간 내에서 저질서 근사를 갖는다면, 경험적 손실은 $f^*$와 $\rho$에 의해 결정되는 속도로 선형 감소하며, 이는 샘플 크기 $n$에 영향을 받지 않는다.
  • 네트워크 너비가 $\Omega(n\log n}$일 때, 표적 함수의 저질서 근사 오차가 0이면 경험적 손실은 $\Theta(1/\sqrt{n})$로 수렴한다.
  • 경사하강법의 최적화 역학은 입력 분포 $\rho$에서 유도된 적분 연산자의 거듭제곱을 적용하는 것과 약간의 근사로 동일하다.
  • 수렴 속도는 샘플 수 $n$에 독립적이며, 과도하게 파arameter화된 네트워크의 근본적인 성질을 강조한다.
  • 분석을 통해 거의 선형 과도한 파arameter화가 빠른 수렴을 위한 충분조건임을 밝혀내었으며, 이는 문헌에서 새로운 결과이다.
  • 결과는 고정된 입력 차원 $d$를 가정하여, 네트워크 너비, 샘플 크기, 함수 복잡도 간의 상호작용에 집중한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.