Skip to main content
QUICK REVIEW

[논문 리뷰] Asymptotics of Wide Networks from Feynman Diagrams

Ethan Dyer, Guy Gur-Ari|arXiv (Cornell University)|2019. 09. 25.
advanced mathematical theories참고 문헌 36인용 수 45
한 줄 요약

이 논문은 Feynman 도식에서 영감을 받은 일반적인 다이어그램 방법을 개발하여 넓은 신경망의 상관함수의 점근을 한정하고 이를 학습 동역학에 적용하여 유한 폭 보정과 더 촘촘한 SGD/NTK 결과를 얻는다.

ABSTRACT

Understanding the asymptotic behavior of wide networks is of considerable interest. In this work, we present a general method for analyzing this large width behavior. The method is an adaptation of Feynman diagrams, a standard tool for computing multivariate Gaussian integrals. We apply our method to study training dynamics, improving existing bounds and deriving new results on wide network evolution during stochastic gradient descent. Going beyond the strict large width limit, we present closed-form expressions for higher-order terms governing wide network training, and test these predictions empirically.

연구 동기 및 목표

  • 넓은(대형 폭의) 신경망과 그들의 학습 동역학에 대한 이해를 고취한다.
  • 다이어그램 방식(diagrammatic approach)을 사용하여 네트워크 상관함수의 점근을 일반적으로 한정하는 방법을 도입한다.
  • 이 방법을 학습 동역학에 적용하여 gradient flow와 SGD 진화에 대한 경계(상한/하한)를 더 촘촘하게 한다.
  • 무한 폭 한계에 대한 유한 폭 보정과 이를 Neural Tangent Kernel(NTK) 동역학과 연결한다.

제안 방법

  • 상관함수를 파라미터에 대한 네트워크 출력과 도함수의 앙상블 평균으로 정의한다.
  • 파생된 Feynman 도식 기법을 추측된 스케일링 경계(Conjecture 1)로 대폭 폭 행태를 한정하기 위해 적응시킨다.
  • 깊은 선형 네트워크에 대해 이 추측을 정확히 증명하고, 비선형성(ReLU, tanh) 및 비가우시안 초기화가 포함된 네트워크에 대해 증거/부분 증명을 제시한다.
  • 무한 폭 극한을 기준으로 전개하고 커널과 네트워크 맵의 연립 방정식을 풀어 학습 동역학에 대한 유한 폭 보정을 도출한다.
  • 다이어그램 기여를 계산하고 그들의 n-의존성을 한정하기 위해 Feynman 규칙을 개발·적용한다.
  • 대폭 폭 극한에서 SGD 업데이트가 학습율에 선형이며 NTK와 네트워크 진화에 대한 선도적 유한 폭 보정을 계산한다.

실험 결과

연구 질문

  • RQ1큰 폭에서 다이어그램 방식으로 네트워크의 상관함수를 한정할 수 있는가?
  • RQ2유한 폭 보정이 Gradient Flow 및 SGD 하에서 NTK와 네트워크 진화에 어떤 변화를 주는가?
  • RQ3제안된 경계가 깊은 선형 네트워크를 넘어 ReLU, tanh 같은 비선형 활성화 네트워크로 확장되는가?
  • RQ4학습 동역학 및 NTK의 고유 스펙트럼에 대한 유한 폭의 선도 보정은 무엇인가?

주요 결과

  • 클러스터 구성요소(수렴 그래프의 짝수/홀수)에 의해 너비에 의존하는 지수로 상관함수를 한정하는 일반 추측이 제시된다.
  • 깊은 선형 네트워크의 경우 이 추측이 증명되며, ReLU 또는 하나의 은닉층에서의 매끄러운 활성화가 있는 네트워크에 대해서도 특정 조건 하에 추측이 성립한다.
  • 학습 동역학에서 NTK는 gradient flow와 SGD 모두에서 O(n^{-1}) 보정에 대해서도 불변이다.
  • 네트워크 맵과 NTK에 대한 선도적 유한 폭 보정이 닫힌 형태로 도출되며, O_s 함수와 NTK 스펙트럼 적분을 통해 표현된다.
  • 실험적 결과(예: 이진 MNIST)에서 activations 및 초기화 스키마에 상관없이 O(n^{-1}) 스케일링과 예측된 유한 폭 보정을 검증한다.
  • 이 방법은 이전 결과들보다 커널 진화에 대한 더 촘촘한 경계를 제시하고 대폭 폭 영역에서 SGD의 학습 속도 선형성을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.