Skip to main content
QUICK REVIEW

[논문 리뷰] Why bigger is not always better: on finite and infinite neural networks

Laurence Aitchison|Bristol Research (University of Bristol)|2019. 10. 17.
Gaussian Processes and Bayesian Inference참고 문헌 19인용 수 5
한 줄 요약

이 논문은 무한히 넓은 베이지안 신경망이 표현 학습이 부족하고 커널이 고정되어 있기 때문에 유한한 네트워크보다 성능이 열 劣하다고 주장한다. 저자는 무한한 네트워크에 버티컬을 도입함으로써 이론적 접근 가능성은 유지하면서도 커널 적응이 가능하게 만들었으며, 분석과 실험을 통해 실제 최신 SOTA 네트워크인 ResNets가 출력 커널에 가까운 표현을 학습한다는 것을 보여주었다—무한한 네트워크 예측과는 정반대이다.

ABSTRACT

Recent work has argued that neural networks can be understood theoretically by taking the number of channels to infinity, at which point the outputs become Gaussian process (GP) distributed. However, we note that infinite Bayesian neural networks lack a key facet of the behaviour of real neural networks: the fixed kernel, determined only by network hyperparameters, implies that they cannot do any form of representation learning. The lack of representation or equivalently kernel learning leads to less flexibility and hence worse performance, giving a potential explanation for the inferior performance of infinite networks observed in the literature (e.g. Novak et al. 2019). We give analytic results characterising the prior over representations and representation learning in finite deep linear networks. We show empirically that the representations in SOTA architectures such as ResNets trained with SGD are much closer to those suggested by our deep linear results than by the corresponding infinite network. This motivates the introduction of a new class of network: infinite networks with bottlenecks, which inherit the theoretical tractability of infinite networks while at the same time allowing representation learning.

연구 동기 및 목표

  • 최신 유한 신경망과 무한 베이지안 신경망 사이의 성능 격차를 설명하기 위해.
  • 무한 네트워크에서 성능이 열 劣한 근본 원인을 특정하기 위해: 표현 학습 부족으로 인한 커널 고정.
  • 이론적 접근 가능성은 유지하면서도 커널 적응과 표현 학습이 가능한 새로운 이론 모델 클래스—무한한 버티컬 네트워크—를 개발하기 위해.
  • 실제 네트워크가 SGD로 훈련될 때 입력 커널이 아니라 출력 커널에 가까운 표현을 학습한다는 것을 경험적으로 검증하기 위해.
  • 표현 학습 역학을 깊이 있는 선형 네트워크에서 모델링하여 이론적 무한 네트워크와 실용적 유한 네트워크 사이의 격차를 메우기 위해.

제안 방법

  • 유한한 깊은 선형 네트워크에서 표현의 사전 공분산을 분석하여 커널 유연성을 수량화하기 위해.
  • 이론적 접근 가능성과 학습 가능한 표현을 결합한 하이브리드 모델로 무한한 버티컬 네트워크를 도입하기 위해.
  • 해석적 유도를 통해 공간적으로 구조화된 입력에서 더 좁고 깊은 네트워크와 CNN이 LCN보다 더 큰 표현 유연성을 제공한다는 것을 보여주기 위해.
  • MAP 및 사후 샘플링을 통한 사후 추론을 모델링하여 훈련 중 표현이 입력 커널에서 출력 커널으로의 전이를 추적하기 위해.
  • 숨어 있는 뉘앙스의 수치 비율(N/Y → 0, ∞, 그리고 N/Y = 1)에 따른 상한선 근사값을 유도하기 위해.
  • 깊은 선형 모델의 이론적 예측과 CIFAR-10에서 훈련된 ResNets의 표현을 비교하여 결과를 검증하기 위해.

실험 결과

연구 질문

  • RQ1정확한 베이지안 추론이 최적임에도 불구하고, 왜 무한한 베이지안 신경망은 SGD로 훈련된 유한한 네트워크보다 성능이 열 劣할까?
  • RQ2무한 네트워크의 고정된 커널이 표현 학습을 방해하고 성능을 제한하는 방식은 무엇인가?
  • RQ3유한한 깊은 선형 네트워크에서 표현의 유연성은 무엇에 의해 결정되며, 이는 무한 네트워크의 행동과 어떻게 비교되는가?
  • RQ4이론적 접근 가능성은 유지하면서도 커널 적응과 표현 학습이 가능한 무한 네트워크의 클래스를 설계할 수 있는가?
  • RQ5SGD로 훈련된 실제 최신 SOTA 네트워크인 ResNets의 표현은 무한 네트워크 모델이 예측한 것과 어떻게 비교되는가?

주요 결과

  • 무한한 베이지안 신경망은 상위 레이어 커널이 하이퍼파ram터에 의해 고정되어 있기 때문에 표현 학습을 수행할 수 없으며, 이는 일반화 성능이 열 劣하게 이어진다.
  • 유한한 깊은 선형 네트워크는 더 좁고 깊을수록 더 큰 표현 유연성을 보이며, 공간적으로 구조화된 입력에서는 CNN이 LCN보다 뛰어난 성능을 보인다.
  • MAP와 사후 샘플링 모두에서 학습된 네트워크의 표현은 입력 커널(입력 내적)에서 출력 커널(레이블 원-핫 내적)으로 전이된다.
  • MAP 추론의 경우 네트워크의 넓이에 관계없이 이 전이가 발생하지만, 베이지안 네트워크에서는 넓이를 늘릴수록 표현이 사전에 점점 더 영향을 받고 데이터에 덜 민감해진다.
  • SGD로 CIFAR-10에서 훈련된 ResNet에서 학습된 표현은 입력 커널보다는 출력 커널에 훨씬 더 가깝다—무한한 버티컬을 가진 깊은 선형 모델의 예측과 일치한다.
  • 상위 레이어 커널의 점근적 행동은 은닉 유닛 수와 출력 채널 수의 비율에 따라 달라진다: N/Y → 0일 때는 출력 커널로 수렴하고, N/Y → ∞일 때는 항등행렬로 수렴하며, N/Y = 1일 땐 중간 행동을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.