Skip to main content
QUICK REVIEW

[논문 리뷰] Random Fully Connected Neural Networks as Perturbatively Solvable Hierarchies

Boris Hanin|arXiv (Cornell University)|2022. 04. 03.
Neural Networks and Applications인용 수 4
한 줄 요약

이 논문은 가우시안 가중치와 절편을 갖는 무작위로 연결된 완전 연결 신경망을 분석하기 위한 섭동 프레임워크를 개발한다. 출력값과 그 도함수의 공동 누적량이 $1/n$의 거듭제곱으로 전개되는 계층적 구조를 이루며, 이는 네트워크의 너비 $n$에 대해 유도 가능하다. 주요 결과는 깊이 대 너비 비율 $L/n$으로 정의되는 효과적 깊이가 비가우시안 변동성과 상관관계를 결정하며, 기울기의 폭주/소실 문제를 제어한다. 이 효과는 주로 $L/n$ 비율에 따라 결정되며, 주로 $L/n$의 순서로 스케일링된다.

ABSTRACT

This article considers fully connected neural networks with Gaussian random weights and biases as well as $L$ hidden layers, each of width proportional to a large parameter $n$. For polynomially bounded non-linearities we give sharp estimates in powers of $1/n$ for the joint cumulants of the network output and its derivatives. Moreover, we show that network cumulants form a perturbatively solvable hierarchy in powers of $1/n$ in that $k$-th order cumulants in one layer have recursions that depend to leading order in $1/n$ only on $j$-th order cumulants at the previous layer with $j\leq k$. By solving a variety of such recursions, however, we find that the depth-to-width ratio $L/n$ plays the role of an effective network depth, controlling both the scale of fluctuations at individual neurons and the size of inter-neuron correlations. Thus, while the cumulant recursions we derive form a hierarchy in powers of $1/n$, contributions of order $1/n^k$ often grow like $L^k$ and are hence non-negligible at positive $L/n$. We use this to study a somewhat simplified version of the exploding and vanishing gradient problem, proving that this particular variant occurs if and only if $L/n$ is large. Several key ideas in this article were first developed at a physics level of rigor in a recent monograph of Daniel A. Roberts, Sho Yaida, and the author. This article not only makes these ideas mathematically precise but also significantly extends them, opening the way to obtaining corrections to all orders in $1/n$.

연구 동기 및 목표

  • 무작위로 연결된 완전 연결 신경망에서 유한한 너비 효과를 수학적으로 엄밀하게 분석할 수 있는 프레임워크를 제공하는 것.
  • 깊이와 너비가 함께 네트워크 출력 및 기울기의 통계적 성질에 미치는 영향을 규명하는 것.
  • 누적량 기반 분석을 통해 무한한 너비 근사 이외의 일반적이고 비점근적인 설정에서 기울기 폭주/소실 문제를 수학적으로 규명하는 것.
  • 이전의 물리학에 기반한 결과들을 $1/n$에 대한 완전히 엄밀한 고차 섭동 형식으로 확장하는 것.

제안 방법

  • 모든 순서에서 $1/n$에 대해 유효한, 각 층에서 출력값과 그 도함수의 공동 누적량에 대한 정확한 재귀 관계를 유도한다.
  • $1/n$에 대한 섭동 전개를 사용하여, $k$-번째 차수 누적량이 주로 이전 층의 낮은 차수 누적량에만 의존함을 보인다.
  • 모든 $n, L \to \infty$ 이면서 $L/n \to \xi \in [0, \infty)$가 되는 이중 스케일링 근사에서, 양의 $\xi$에서 비가우시안 행동이 드러남을 보여준다.
  • 두 번째, 세 번째, 네 번째 차수 누적량에 대한 명시적 점근적 해를 계산하며, 기울기의 분산과 상관관계를 포함한 통계적 구조를 규명한다.
  • 이 형식을 적용하여 입력 또는 첫 번째 층의 가중치에 대한 기울기 분산의 주요 순서 행동을 유도하며, $L/n$ 비율에 따라 스케일링됨을 보여준다.
  • 누적량 생성 함수와 위크 정리를 사용하여, 큰 $n$ 근사에서 고차 모멘트와 상관관계를 계산한다.

실험 결과

연구 질문

  • RQ1유한한 너비 효과는 깊은 무작위 신경망에서 출력과 기울기의 공동 분포에 어떻게 나타나는가?
  • RQ2깊이 대 너비 비율 $L/n$은 무작위 네트워크에서 변동성과 상관관계의 척도를 결정하는 데 어떤 역할을 하는가?
  • RQ3기울기 폭주/소실 문제는 무한한 너비 근사 이외의 일반적인 설정에서 수학적으로 기술될 수 있는가?
  • RQ4무작위로 연결된 완전 연결 네트워크에서 $1/n$에 대한 누적량 재귀 관계는 유한 너비에서 가우시안 프로세스 근사에 대한 체계적인 수정을 어떻게 가능하게 하는가?

주요 결과

  • 비선형성 함수가 $K_* = 0$ 유니버설리티 클래스에 속할 경우, 네트워크 출력의 $2k$-번째 누적량은 $k = 2,3,4$ 에서 $(L/n)^{k/2 - 1}$ 비율로 증가하며, 이는 $L/n$ 이 비가우시안 성질을 지배함을 시사한다.
  • 입력 또는 첫 번째 층의 가중치에 대한 네트워크 출력 기울기의 분산은 $1/n$의 주요 순서에서 $L/n$ 비율에 따라 스케일링되며, 기울기 폭주/소실 문제에 대한 정확한 수학적 기술을 제공한다.
  • 효과적 깊이 $L/n$은 상호 뉴런 상관관계와 단일 뉴런 변동성 모두를 지배하며, $1/n^k$ 순서에서 $L^k$ 비율로 증가함을 보여, $L/n$ 이 주요 제어 매개변수임을 확인한다.
  • 누적량 계층은 섭동적으로 해석 가능하다: $\ell+1$-번째 층의 $k$-번째 차수 누적량은 주로 $\ell$-번째 층의 $j \leq k$-번째 차수 누적량에만 의존한다.
  • 모든 $n, L \to \infty$ 이면서 $L/n \to \xi$ 가 되는 이중 스케일링 근사에서, $L/n \to 0$ 근사에서 포착되지 않는 비가우시안 및 비선형 효과가 나타남을 보여준다.
  • 명시적 점근적 해는 $S_{(11)}^{(\ell)} \sim \frac{\ell}{3n} K_{(11)}^{(\ell)}$ 를 확인하며, 기울기 분산이 $L/n$에 대해 선형으로 스케일링됨을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.