Skip to main content
QUICK REVIEW

[논문 리뷰] Finite size corrections for neural network Gaussian processes

Joseph M. Antognini|arXiv (Cornell University)|2019. 08. 27.
Gaussian Processes and Bayesian Inference참고 문헌 24인용 수 17
한 줄 요약

이 논문은 단일 은닉층을 가진 크고 유한한 너비의 완전 연결 신경망에 대해, 초기화 시 출력 분포가 제4 헤르미트 다항식으로 편향된 가우시안 프로세스에 의해 잘 근사됨을 보여준다. 이 편향의 크기는 은닉 유닛 수 N과 반비례하게 변화하며, 이는 유한한 크기 보정으로서 에지워스 전개가 무한한 너비 가우시안 프로세스 근사에 대해 타당함을 확인한다.

ABSTRACT

There has been a recent surge of interest in modeling neural networks (NNs) as Gaussian processes. In the limit of a NN of infinite width the NN becomes equivalent to a Gaussian process. Here we demonstrate that for an ensemble of large, finite, fully connected networks with a single hidden layer the distribution of outputs at initialization is well described by a Gaussian perturbed by the fourth Hermite polynomial for weights drawn from a symmetric distribution. We show that the scale of the perturbation is inversely proportional to the number of units in the NN and that higher order terms decay more rapidly, thereby recovering the Edgeworth expansion. We conclude by observing that understanding how this perturbation changes under training would reveal the regimes in which the Gaussian process framework is valid to model NN behavior.

연구 동기 및 목표

  • 무한한 너비 신경망 가우시안 프로세스와 실용적인 유한 너비 네트워크 사이의 격차를 메우기 위해.
  • 유한 너비 신경망의 초기화 시 출력 분포에서 비가우시안성의 정도를 정량화하기 위해.
  • 에지워스 전개가 신경망 출력의 유한 크기 효과를 정확히 기술하는지 확인하기 위해.
  • 학습 중 비가우시안 보정이 얼마나 안정적으로 유지되는지 평가하여, 신경망 동역학 모델링에 있어 가우시안 프로세스 프레임워크의 타당성에 대한 통찰을 제공하기 위해.

제안 방법

  • 특성 함수 분석을 사용하여 N개의 은닉 유닛을 가진 단일 은닉층 신경망의 출력 분포를 유도한다.
  • 에지워스 전개를 적용하여 가우시안 근사 이외의 고차 누적모멘트를 모델링하며, 특히 네 번째 누적모멘트에 집중한다.
  • 출력 분포에서 가우시안 분포에 대한 주요 보정을 제3 헤르미트 다항식으로 기술한다.
  • N=128인 10^8개의 네트워크를 샘플링하여 실험적 검증을 수행하고, 경험적 CDF를 예측된 편향된 가우시안과 비교한다.
  • N ∈ [8, 148] 범위에서 N에 따른 편향 크기의 스케일링을 측정하고, 편차를 α·N^−1 스케일링에 맞추어 피팅한다.
  • 일致하고 유한한 분산을 보장하기 위해 글로로트 균일 가중치 초기화와 ReLU 활성화 함수를 사용한다.

실험 결과

연구 질문

  • RQ1유한 너비 신경망의 출력 분포는 초기화 시 어떻게 가우시안 프로세스에서 벗어나는가?
  • RQ2유한 너비 네트워크에서 가우시안 근사에 대한 주요 보정의 기능 형태는 무엇인가?
  • RQ3비가우시안 보정의 크기는 은닉 유닛 수 N과 어떻게 스케일링되는가?
  • RQ4학습 중 이 편향은 안정적으로 유지되거나 크게 변화하는가? 이는 가우시안 프로세스 프레임워크의 타당성에 어떤 함의를 갖는가?
  • RQ5에지워스 전개는 큰 유한 너비 신경망에서 출력 분포를 정확히 기술할 수 있는가?

주요 결과

  • 유한 너비 신경망의 초기화 시 출력 분포는 제4 헤르미트 다항식이 아닌 제3 헤르미트 다항식으로 편향된 가우시안 프로세스에 의해 가장 잘 기술된다 — CDF 비교를 통한 수정 확인.
  • 편향 크기의 스케일링은 약 N^−1.07로 나타나며, 네트워크 너비에 따라 반비례 감쇠가 일어남을 확인한다.
  • N=128인 10^8개의 네트워크에서의 경험적 CDF는 예측된 편향된 가우시안 모델과 뛰어난 일치를 보였다.
  • 주요 보정은 제3 헤르미트 다항식에 의해 지배되며, 고차항들은 더 빠르게 감쇠되며, 이는 에지워스 전개와 일치한다.
  • 초기화 조건 하에서 편향은 안정적이며, 이는 유한 크기 효과가 체계적으로 측정 가능하다는 것을 시사하며, 학습 중 가우시안 프로세스 프레임워크의 타당성에 영향을 준다.
  • 결과적으로, 비가우시안 보정을 유한 크기 보정을 통해 고려한다면, 가우시안 프로세스가 여전히 유한 네트워크에 대해 강력한 근사가 될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.