Skip to main content
QUICK REVIEW

[논문 리뷰] Richer priors for infinitely wide multi-layer perceptrons

Russell Tsuchida, Fred Roosta|arXiv (Cornell University)|2019. 11. 29.
Neural Networks and Applications참고 문헌 33인용 수 6
한 줄 요약

이 논문은 무한히 넓은 다층퍼셉트론(Multi-Layer Perceptrons, MLPs)과 가우시안 프로세스(Gaussian Processes, GPs) 간의 고전적 연결을 확장하여 더 풍부한 사전분포를 도입한다: 비영 평균과 부분적으로 교환가능한(RCE) 사전분포. 이러한 사전분포는 초점화된 하이퍼파rameter에 대한 계층적 추론을 가능하게 하는 GP 극한을 유도하며, 더 표현력 있는 커널을 만들어내어 깊이가 깊어질수록 발생하는 병리적 현상을 피한다. 다만 깊이가 증가함에 따라 우도의 조건수가 점점 악화된다.

ABSTRACT

It is well-known that the distribution over functions induced through a zero-mean iid prior distribution over the parameters of a multi-layer perceptron (MLP) converges to a Gaussian process (GP), under mild conditions. We extend this result firstly to independent priors with general zero or non-zero means, and secondly to a family of partially exchangeable priors which generalise iid priors. We discuss how the second prior arises naturally when considering an equivalence class of functions in an MLP and through training processes such as stochastic gradient descent. The model resulting from partially exchangeable priors is a GP, with an additional level of inference in the sense that the prior and posterior predictive distributions require marginalisation over hyperparameters. We derive the kernels of the limiting GP in deep MLPs, and show empirically that these kernels avoid certain pathologies present in previously studied priors. We empirically evaluate our claims of convergence by measuring the maximum mean discrepancy between finite width models and limiting models. We compare the performance of our new limiting model to some previously discussed models on synthetic regression problems. We observe increasing ill-conditioning of the marginal likelihood and hyper-posterior as the depth of the model increases, drawing parallels with finite width networks which require notoriously involved optimisation tricks.

연구 동기 및 목표

  • 무한히 넓은 MLP에서 i.i.d. 영 평균 가중치가 GP로 수렴하는 고전적 결과를 비영 평균 사전분포를 允허함으로써 일반화하기 위해.
  • 퍼미터의 순열 대칭성과 SGD 학습 동역학에서 자연스럽게 유도되는 부분적으로 교환가능한 사전분포(RCE)를 도입하기 위해.
  • 이러한 더 풍부한 사전분포 하에서 깊은 MLP의 극한 GP 커널을 유도하고 그 성질을 분석하기 위해.
  • 유한한 너비 모델에서 극한 GP로의 수렴을 경험적으로 평가하고, 합성 회귀 과제에서의 성능을 평가하기 위해.
  • 새로운 사전분포 구조 하에서 깊은 모델의 우도와 하이퍼사후분포의 조건수가 어떻게 되는지 조사하기 위해.

제안 방법

  • 중앙극한정리와 함수적 중심극한정리를 사용하여 일반적인 영 또는 비영 평균 i.i.d. 사전분포 하에서 깊은 MLP의 극한 GP 커널을 유도한다.
  • 계층적 대칭성을 유지하면서 층 내부의 의존성을 允허함으로써 i.i.d. 사전분포를 일반화하는 부분적으로 교환가능한 사전분포(RCE)를 도입한다.
  • 결과적으로 모델이 하이퍼파rameter에 대한 적분이 필요한 계층적 사전분포를 갖는 GP가 되며, 이는 수준 II 추론(하이퍼파rameter에 대한 적분)이 필요함을 보여준다.
  • 비영 평균이 있는 ReLU 및 Leaky ReLU 활성화 함수 하에서 커널의 명시적 표현을 유도한다.
  • 유한한 너비 모델과 극한 GP 사이의 수렴 정도를 측정하기 위해 최대 평균 차이(MMD)를 사용한다.
  • 평균과 분산에 비정보성 사전분포를 두고, 이원정규분포 제안을 사용하는 메트로폴리스-해스팅스 샘플러를 통해 하이퍼사후분포를 탐색한다.

실험 결과

연구 질문

  • RQ1사전분포에서 비영 평균을 允허함으로써 깊은 MLP에서의 극한 GP 커널에 어떤 영향을 미치는가?
  • RQ2퍼미터의 대칭성과 SGD 학습 동역학으로부터 부분적으로 교환가능한 사전분포(RCE)를 도출할 수 있으며, 이는 i.i.d. 사전분포를 어떻게 일반화하는가?
  • RQ3비영 평균과 RCE 사전분포 하에서 극한 GP 커널의 구조적 및 기능적 성질은 무엇이며, 기존의 i.i.d. 사전분포와 비교해 볼 때 어떻게 다른가?
  • RQ4새로운 사전분포 하에서 깊은 모델의 우도와 하이퍼사후분포는 어떻게 행동하는가? 깊이가 증가함에 따라 조건수가 악화되는가?
  • RQ5새로운 커널 구조는 기존의 GP 사전분포에 비해 합성 회귀 과제에서 일반화 성능을 향상시킬 수 있는가?

주요 결과

  • 비영 평균 사전분포 하에서의 극한 GP는 특히 깊은 네트워크에서 표준 영 평균 사례에 비해 더 표현력 있는 커널 구조를 보인다.
  • RCE 사전분포는 MLP의 순열 대칭성과 SGD 학습 동역학에서 자연스럽게 유도된다.
  • 결과적으로 모델은 계층적 추론을 갖는 GP가 되며, 사전 및 사후 예측 분포는 하이퍼파rameter에 대한 적분이 필요하다.
  • 경험적 평가 결과, 유한한 너비 모델과 극한 GP 사이의 MMD는 너비가 증가함에 따라 감소하며, 수렴을 확인한다.
  • 우도와 하이퍼사후분포는 깊이가 증가함에 따라 점점 더 악조건이 되며, 이는 유한한 너비 네트워크 최적화에서의 과제와 유사하다.
  • 비영 평균을 가진 모델은 특히 깊은 아키텍처에서 과적합에 더 취약함을 보이며, 표현력과 일반화 사이의 상충관계를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.