Skip to main content
QUICK REVIEW

[논문 리뷰] Universal scaling laws in the gradient descent training of neural networks

Maksim Velikanov, Dmitry Yarotsky|arXiv (Cornell University)|2021. 05. 02.
Stochastic Gradient Optimization Techniques참고 문헌 30인용 수 5
한 줄 요약

이 논문은 넓은 신경망의 경사하강법 학습 중 손실의 보편적 힘법칙 스케일링 법칙을 수립한다. 손실은 $ L(t) \sim t^{-\xi} $ 로 감소하며, 이때 지수 $ \xi $ 는 데이터 차원 $ d $, 활성화 함수의 매끄러움 정도, 목표 함수의 클래스에만 의존한다. 신경태도핵(Neural Tangent Kernel, NTK)의 스펙트럼 분석을 통해 손실, 고유값, 계수 분포의 명시적 점근적 형태를 도출하였으며, 다양한 데이터와 활성화 함수에 걸쳐 보편성이 확인되었다.

ABSTRACT

Current theoretical results on optimization trajectories of neural networks trained by gradient descent typically have the form of rigorous but potentially loose bounds on the loss values. In the present work we take a different approach and show that the learning trajectory can be characterized by an explicit asymptotic at large training times. Specifically, the leading term in the asymptotic expansion of the loss behaves as a power law $L(t) \sim t^{-ξ}$ with exponent $ξ$ expressed only through the data dimension, the smoothness of the activation function, and the class of function being approximated. Our results are based on spectral analysis of the integral operator representing the linearized evolution of a large network trained on the expected loss. Importantly, the techniques we employ do not require specific form of a data distribution, for example Gaussian, thus making our findings sufficiently universal.

연구 동기 및 목표

  • 넓은 신경망에서 경사하강법의 장기적 행동에 대한 정량적이고 보편적인 이론을 개발하기 위해.
  • 이론적 경계를 넘어서는 명시적 힘법칙 형태를 사용하여 학습 손실의 점근적 감소를 기술하기 위해.
  • 손실 감소 지수 $ \xi $ 가 데이터 차원 $ d $, 활성화 함수의 매끄러움 정도, 목표 함수 클래스에 어떻게 의존하는지 규명하기 위해.
  • 이 스케일링 법칙이 데이터 분포에 독립적이므로 널리 적용 가능하다는 것을 입증하기 위해.
  • 다양한 데이터 분포에서 고유값과 계수 분포에 대한 수치 실험을 통해 이론적 예측을 검증하기 위해.

제안 방법

  • 예상 손실을 기반으로 학습된 넓은 네트워크의 선형화된 진동 연산자에 스펙트럼 분석을 적용하기 위해.
  • 신경태도핵(NTK)을 사용하여 학습 동역학을 모델링하고, 특히 고유값 스펙트럼과 고유벡터 전개에 중점을 두기 위해.
  • 손실 $ L(t) \sim t^{-\xi} $, 고유값 $ \lambda_n \sim n^{-\nu} $, 계수 부분합 $ s_n \sim n^{-\kappa} $ 의 점근적 힘법칙을 유도하기 위해.
  • 특이 적분 연산자 이론을 사용하여 NTK의 구조, 특히 차수 1의 동차 특이성을 분석하기 위해.
  • 손실 지수 $ \xi $ 를 활성화 함수의 매끄러움 정도와 목표 함수 간의 관계를 통해 $ \xi = \frac{\beta}{d+\alpha} $ 로 연결하기 위해, 여기서 $ \beta $ 와 $ \alpha $ 는 매끄러움 정도를 캡슐화한다.
  • 다양한 데이터 분포를 가진 얕은 ReLU 및 Erf 활성화를 가진 네트워크에서의 수치 실험을 통해 이론적 예측을 확인하기 위해.

실험 결과

연구 질문

  • RQ1넓은 신경망에서 장기적인 경사하강법 학습 중 손실의 명시적 점근적 형태는 무엇인가?
  • RQ2손실 감소 지수 $ \xi $ 는 데이터 차원 $ d $, 활성화 함수의 매끄러움 정도, 목표 함수 클래스에 어떻게 의존하는가?
  • RQ3손실 감소가 데이터 분포에 독립적인 힘법칙으로 보편적으로 특징지어질 수 있는가?
  • RQ4NTK 고유값 스펙트럼과 손실 감소 역학 간의 관계는 무엇인가?
  • RQ5목표 함수의 고유벡터 전개에서의 계수 기여는 손실 스케일링에 어떻게 기여하는가?

주요 결과

  • 손실은 $ L(t) \sim t^{-\xi} $ 로 감소하며, ReLU 네트워크에서 지표 함수를 근사할 경우 $ \xi = \frac{1}{d+1} $ 이다.
  • 랜덤으로 초기화된 넓은 ReLU 네트워크에서 생성된 목표 함수에 대해 $ \xi = \frac{3}{d+1} $ 이다.
  • ReLU 활성화에 대해 NTK 고유값은 $ \lambda_n \sim n^{-1 - \frac{1}{d}} $ 의 힘법칙을 따르며, Erf 활성화에 대해서는 $ \lambda_n \sim \Lambda e^{-an} $ 로 지수적으로 감소한다.
  • 고유벡터 전개에서의 계수 부분합은 GP 목표 함수에 대해 $ s_n \sim n^{-\frac{3}{d}} $, 지표 목표 함수에 대해 $ s_n \sim n^{-\frac{1}{d}} $ 로 스케일링된다.
  • 손실, 고유값, 계수에 대한 이론적 힘법칙은 $ d=2 $ 와 $ d=4 $ 에서의 수치 실험을 통해 확인되었다.
  • 스케일링 법칙은 데이터 분포에 대해 강건하다: 대칭 분포는 퇴화된 고유값 스펙트럼을 유도하지만, 비대칭 혼합은 스펙트럼을 매끄럽게 만들며, 여전히 힘법칙이 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.