Skip to main content
QUICK REVIEW

[논문 리뷰] The Limitations of Large Width in Neural Networks: A Deep Gaussian Process Perspective

Geoff Pleiss, John P. Cunningham|arXiv (Cornell University)|2021. 06. 11.
Gaussian Processes and Bayesian Inference인용 수 8
한 줄 요약

이 논문은 딥 가우시안 프로세스(Deep GP)를 분석하여 넓은 신경망의 인도적 편향(inductive biases)을 조사한다. 넓이가 증가함에 따라 Deep GP는 단일층 가우시안 프로세스로 수렴함을 증명하며, 이는 계층적 표현 능력의 손실을 의미한다. 놀랍게도 최적의 테스트 성능는 넓이가 1 또는 2일 때 발생하며, 이는 과도한 넓이가 충분한 표현 능력이 확보된 후에도 모델의 적응 가능성과 성능을 해칠 수 있음을 시사한다.

ABSTRACT

Large width limits have been a recent focus of deep learning research: modulo computational practicalities, do wider networks outperform narrower ones? Answering this question has been challenging, as conventional networks gain representational power with width, potentially masking any negative effects. Our analysis in this paper decouples capacity and width via the generalization of neural networks to Deep Gaussian Processes (Deep GP), a class of nonparametric hierarchical models that subsume neural nets. In doing so, we aim to understand how width affects (standard) neural networks once they have sufficient capacity for a given modeling task. Our theoretical and empirical results on Deep GP suggest that large width can be detrimental to hierarchical models. Surprisingly, we prove that even nonparametric Deep GP converge to Gaussian processes, effectively becoming shallower without any increase in representational power. The posterior, which corresponds to a mixture of data-adaptable basis functions, becomes less data-dependent with width. Our tail analysis demonstrates that width and depth have opposite effects: depth accentuates a model's non-Gaussianity, while width makes models increasingly Gaussian. We find there is a "sweet spot" that maximizes test performance before the limiting GP behavior prevents adaptability, occurring at width = 1 or width = 2 for nonparametric Deep GP. These results make strong predictions about the same phenomenon in conventional neural networks trained with L2 regularization (analogous to a Gaussian prior on parameters): we show that such neural networks may need up to 500 - 1000 hidden units for sufficient capacity - depending on the dataset - but further width degrades performance.

연구 동기 및 목표

  • 표준 신경망을 비모수적 일반화인 딥 가우시안 프로세스(Deep GP)로 일반화하여 넓이와 표현 능력의 영향을 분리한다.
  • 특정 모델링 과제에 대해 충분한 표현 능력이 확보된 이후에도 넓이가 추가로 유익한가를 조사한다.
  • 특히 넓이가 계층적 모델에 도입하는 인도적 편향을 분석하며, 넓이가 사후 적응성과 비가우시안성에 미치는 영향을 다룬다.
  • 표현 능력이 더 이상 제한적이지 않은 이후에도 넓이가 성능에 악영향을 미치는가를 판단한다.
  • 딥 가우시안 프로세스의 통찰을 L2 정규화로 훈련된 전통적 신경망에 확장하며, 파rameter에 가우시안 prior를 유도한다.

제안 방법

  • 각 층이 벡터 값 가우시안 프로세스인 표준 신경망을 딥 가우시안 프로세스로 일반화하여 표현 능력을 넓이와 독립적으로 제어한다.
  • 무한 넓이 근사에서 딥 가우시안 프로세스가 단일층 가우시안 프로세스로 수렴함을 증명한다(정리 1). 이는 깊이와 계층적 특징 학습 능력의 상실을 의미한다.
  • 딥 가우시안 프로세스의 사후 평균을 재생핵 힐버트 공간에서 데이터 적응형 기저 함수의 혼합으로 분석하여, 넓이가 증가할수록 데이터 의존성이 감소함을 보여준다.
  • 꼬리 분석을 수행하여 넓이와 깊이의 영향을 비교한다: 깊이가 비가우시안성(더 두꺼운 尾, 더 날카로운 피크)을 증가시키지만, 넓이는 가우시안성(정리 2 및 3)을 증가시킨다.
  • MNIST 및 CIFAR10에서의 실험을 통해 이론적 결과를 검증한다. L2 정규화를 적용한 베이지안 및 전통적 신경망을 훈련하고, 한계 가우시안 프로세스와 동일한 초모수를 설정한다.
  • 딥 가우시안 프로세스와 신경망의 초모수를 한계 가우시안 프로세스와 일치시켜 공정한 비교를 보장한다. 베이지안 모델의 경우 로그 주변 가능도 최적화 및 NUTS 샘플링을 사용한다.

실험 결과

연구 질문

  • RQ1충분한 표현 능력이 확보된 이후에도 넓이를 늘리면 계층적 모델의 일반화 성능이 향상되는가, 아니면 표현 유연성의 손실로 인해 성능이 떨어지는가?
  • RQ2무한 넓이 근사에서 딥 가우시안 프로세스의 사후 및 인도적 편향은 어떻게 변화하며, 이는 데이터에 대한 모델 적응성에 어떤 영향을 미치는가?
  • RQ3넓이와 깊이가 비가우시안성에 어떻게 다르게 영향을 미치는가? 특히 尾 행동과 피크 날카로움 측면에서 설명하라.
  • RQ4비모수적 딥 가우시안 프로세스에서의 통찰은 L2 정규화를 적용한 모수적 신경망으로 확장 가능한가? 이러한 모델의 최적 넓이는 무엇인가?
  • RQ5모델이 얕은 가우시안 프로세스 근사로 붕괴되기 전에 테스트 성능을 최대화하는 '최적의 넓이'가 존재하는가?

주요 결과

  • 딥 가우시안 프로세스는 무한 넓이 근사에서 단일층 가우시안 프로세스로 수렴하며, 이는 깊이와 계층적 특징 학습 능력을 상실함을 의미한다(정리 1).
  • 딥 가우시안 프로세스의 사후 평균은 넓이가 증가할수록 데이터 의존성이 감소하며, 데이터에 의존하지 않는 커널로 붕괴됨을 보여, 특징 학습 능력이 감소함을 시사한다.
  • 넓이와 깊이는 상반된 영향을 미친다: 깊이가 비가우시안성(더 두꺼운 尾, 더 날카로운 피크)을 증가시키지만, 넓이는 가우시안성(정리 2 및 3)을 증가시킨다.
  • 비모수적 딥 가우시안 프로세스의 경우 최적의 테스트 성능는 넓이가 1 또는 2일 때 달성되며, 더 넓어질수록 성능이 악화된다.
  • L2 정규화를 적용한 베이지안 및 전통적 신경망의 경우, 특정 넓이를 초과하면 성능이 떨어지며, 소규모 데이터셋(N ≤ 1000)에서는 최적 성능가 16개 이하의 뉴런에서 달성된다.
  • 더 큰 데이터셋인 CIFAR10에서는 전통적 신경망의 최적 넓이 역시 제한되어 있으며, 성능은 500~1000개의 은닉 뉴런을 초과하면 데이터셋 및 아키텍처에 따라 감소한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.