Skip to main content
QUICK REVIEW

[논문 리뷰] Analysis of the rate of convergence of an over-parametrized deep neural network estimate learned by gradient descent

Michael Köhler, Adam Krzyżak|arXiv (Cornell University)|2022. 10. 04.
Mathematical Approximation and Integration인용 수 4
한 줄 요약

이 논문은 경량화된 초과 매개변수를 가진 딥 네ural 네트워크 추정기의 경사하강법을 통한 수렴 속도를 비모수적 회귀에서 분석한다. 헬더-연속성 회귀 함수의 지수 $p \in [1/2,1]$ 조건 하에서 기대 $L_2$ 오차가 $n^{-1/(1+d)}$ 근처의 속도로 수렴함을 입증하며, 적절한 초기화와 경사하강법 초모수 설정 조건 하에서 상호작용 모델에서 최적의 $d^*$-차원 수렴 속도를 달성한다.

ABSTRACT

Estimation of a regression function from independent and identically distributed random variables is considered. The $L_2$ error with integration with respect to the design measure is used as an error criterion. Over-parametrized deep neural network estimates are defined where all the weights are learned by the gradient descent. It is shown that the expected $L_2$ error of these estimates converges to zero with the rate close to $n^{-1/(1+d)}$ in case that the regression function is Hölder smooth with Hölder exponent $p \in [1/2,1]$. In case of an interaction model where the regression function is assumed to be a sum of Hölder smooth functions where each of the functions depends only on $d^*$ many of $d$ components of the design variable, it is shown that these estimates achieve the corresponding $d^*$-dimensional rate of convergence.

연구 동기 및 목표

  • 초과 매개변수화와 최적화 역학을 무시하는 기존 이론의 격차를 메우기 위해, 경사하강법으로 훈련된 초과 매개변수를 가진 딥 네럴 네트워크의 수렴 성질을 이론적으로 분석하는 것.
  • 실제 훈련 조건 하에서 비모수적 회귀에서 딥 네럴 네트워크 추정기의 기대 $L_2$ 위험의 수렴 속도를 확립하는 것.
  • 초과 매개변수를 가진 네트워크가 매개변수 수가 표본 크기 초과일지라도, 거의 최적의 수렴 속도를 달성할 수 있음을 보여주는 것.
  • 회귀 함수가 입력의 $d^*$개 성분에만 의존하는 상호작용 모델에서 이러한 추정기가 $d^*$-차원 수렴 속도를 달성할 수 있는지 조사하는 것.
  • 실제 훈련 동역학—랜덤 초기화와 경사하강법—을 수렴 속도 분석에 통합하여 실용적 딥 러닝과 이론 분석 간 격차를 메우는 것.

제안 방법

  • 저자는 모든 가중치가 랜덤 초기화에서 출발하여 경사하강법으로 학습되는 초과 매개변수를 가진 딥 네럴 네트워크 추정기를 정의한다.
  • 초기화 제약 조건을 통해 유한한 가중치를 가진 네럴 네트워크 클래스의 거리 엔트로피 한계를 제어하여 일반화 오차를 제어한다.
  • 최적화 과정은 정규화를 도입하고, 유한한 스텝 수와 스텝 크기 제약을 통해 경사하강법 중 내부 가중치의 변화를 제어함으로써 분석된다.
  • 과잉 매개변수화와 네트워크 구조를 통해 근사 오차를 제어하며, 외부 가중치가 적절히 훈련될 경우 초기 내부 가중치의 부분집합이 좋은 근사 가능성을 보장한다.
  • 이론적 분석은 거리 엔트로피, 테일러 근사, 조각별 다항식 근사 기법을 결합하여 커버링 수를 제한하고 일반화 오차를 제어한다.
  • 핵심 기술 도구로는 네트워크 함수의 도함수에 대한 한계와 가중치 제약 조건에 의해 유도되는 함수 클래스의 커버링 수 추정치가 포함된다.

실험 결과

연구 질문

  • RQ1경사하강법으로 훈련된 초과 매개변수를 가진 딥 네럴 네트워크가 비모수적 회귀에서 거의 최적의 수렴 속도를 달성할 수 있는가?
  • RQ2진짜 회귀 함수가 지수 $p \in [1/2,1]$를 가진 헬더-연속일 경우, 이러한 추정기의 기대 $L_2$ 오차의 수렴 속도는 얼마인가?
  • RQ3회귀 함수가 입력의 $d^*$개 성분에만 의존하는 상호작용 모델에서 추정기가 $d^*$-차원 수렴 속도를 달성하는가?
  • RQ4초기화 제약 조건과 경사하강법 초모수(스텝 크기, 스텝 수)가 일반화 및 근사 성질에 어떤 영향을 미치는가?
  • RQ5초과 매개변수화 조건 하에서 스위치 또는 결정적 경사하강법으로 훈련된 딥 네트워크에 대해 이론적 수렴 보장을 도출할 수 있는가?

주요 결과

  • 헬더 연속성 지수 $p \in [1/2,1]$ 조건 하에서, 경사하강법으로 훈련된 초과 매개변수를 가진 딥 네럴 네트워크 추정기의 기대 $L_2$ 오차는 임의의 $\epsilon > 0$에 대해 순서 $n^{-1/(1+d) + \epsilon}$ 속도로 0으로 수렴한다.
  • 회귀 함수가 $d^*$변량 헬더-연속 함수의 합으로 구성된 상호작용 모델에서는 추정기가 $d^*$-차원 최적 수렴 속도인 $n^{-2p/(d^*+1)}$를 달성한다.
  • 수렴 속도는 거의 최적이며, $n^{-1/(1+d)}$에 가까워지며, 이는 헬더 연속성 조건 하에서 비모수적 회귀의 최소 최대 수렴 속도와 일치한다.
  • 분석 결과, 고도의 확률로 랜덤 초기화된 내부 가중치의 부분집합이 외부 가중치가 적절히 훈련될 경우 좋은 근사를 가능하게 함을 보여준다.
  • 경사하강법의 스텝 수와 스텝 크기를 조심스럽게 선택하여 내부 가중치의 큰 변화를 방지함으로써 안정성과 일반화를 확보한다.
  • 이론적 한계는 유한한 가중치를 가진 네럴 네트워크 함수 클래스에 대한 거리 엔트로피와 커버링 수 추정치를 기반으로 하며, 테일러 기반 근사 논증과 결합된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.