Skip to main content
QUICK REVIEW

[논문 리뷰] Disentangling Trainability and Generalization in Deep Neural Networks

Xiao, Lechao, Jeffrey Pennington|arXiv (Cornell University)|2019. 12. 30.
Stochastic Gradient Optimization Techniques인용 수 14
한 줄 요약

이 논문은 넓고 깊은 신경망에서 학습 가능성과 일반화를 분리하여 신경미분 커널(NTK) 스펙트럼을 분석함으로써 이를 다룹니다. 분석 결과, 컨볼루션 신경망(CNN)에서 풀링 레이어는 NTK의 조건수와 주요 고유값을 감소시켜 일반화 성능을 크게 향상시키는 것으로 드러났으며, 전결합 네트워크(FCN)는 전역 평균 풀링을 적용함에도 불구하고 훈련 데이터를 기억하지만 일반화 성능이 떨어집니다.

ABSTRACT

A longstanding goal in the theory of deep learning is to characterize the conditions under which a given neural network architecture will be trainable, and if so, how well it might generalize to unseen data. In this work, we provide such a characterization in the limit of very wide and very deep networks, for which the analysis simplifies considerably. For wide networks, the trajectory under gradient descent is governed by the Neural Tangent Kernel (NTK), and for deep networks the NTK itself maintains only weak data dependence. By analyzing the spectrum of the NTK, we formulate necessary conditions for trainability and generalization across a range of architectures, including Fully Connected Networks (FCNs) and Convolutional Neural Networks (CNNs). We identify large regions of hyperparameter space for which networks can memorize the training set but completely fail to generalize. We find that CNNs without global average pooling behave almost identically to FCNs, but that CNNs with pooling have markedly different and often better generalization performance. These theoretical results are corroborated experimentally on CIFAR10 for a variety of network architectures and we include a colab notebook that reproduces the essential results of the paper.

연구 동기 및 목표

  • 무한한 너비와 깊이의 극한에서 깊은 신경망 아키텍처가 학습 가능하고 잘 일반화되는 조건을 규명하는 것.
  • 다양한 아키텍처에서 NTK 스펙트럼을 분석함으로써 학습 가능성과 일반화를 분리하는 것.
  • 유사한 기억 용량을 지닌 아키텍처(예: 풀링이 있는 CNN)가 왜 전결합 네트워크(FCN)보다 더 잘 일반화되는지 탐구하는 것.
  • 초기화 분산 및 아키텍처 선택(예: 풀링, 활성화 함수)이 일반화 성능에 미치는 영향을 이론적이고 경험적으로 검증하는 것.

제안 방법

  • 전결합 네트워크(FCN)와 컨볼루션 신경망(CNN)에 대해, 전역 평균 풀링이 있는지 여부에 관계없이 깊이가 매우 클 경우 NTK 스펙트럼에 대한 이론적 분석.
  • 네트워크 깊이, 너비, 초기화 조건 등에 따라 NTK의 최대 및 최소 고유값, 조건수에 대한 渐近적 표현을 유도하는 것.
  • NTK 프레임워크를 사용해 경사 하강법의 역학을 분석적으로 모델링함으로써 일반화 성능을 정밀하게 예측하는 것.
  • NTK와 NNGP(신경망 가우시안 프로세스) 예측을 비교하여 일반화가 붕괴되거나 유지되는 깊이 척도를 파악하는 것.
  • SGD를 사용한 CIFAR-10에 대한 경험적 검증으로 다양한 초기화 분산 및 깊이 설정을 포함한 초기화 조건을 시험하는 것.
  • 이론적 예측의 탄력성을 시험하기 위해 편향 분산 및 정규화 강도에 대한 체계적 스윕을 수행하는 것.

실험 결과

연구 질문

  • RQ1신경미분 커널(NTK)의 스펙트럼은 넓고 깊은 신경망의 학습 가능성과 일반화 성능를 어떻게 결정하는가?
  • RQ2두 아키텍처 모두 훈련 데이터를 기억할 수 있음에도 불구하고, 전역 평균 풀링이 있는 CNN이 왜 전결합 네트워크(FCN)보다 더 잘 일반화되는가?
  • RQ3깊은 네트워크에서 평탄화 대비 풀링이 NTK의 고유값 분포와 조건수에 어떤 영향을 미치는가?
  • RQ4가중치 초기화 분산 및 깊이와 같은 초기화 조건이 NTK 및 NNGP 프레임워크에서 일반화 깊이 척도에 어떤 영향을 미치는가?
  • RQ5CNN에 풀링이 있는 경우, 완전히 연결된 네트워크와 비교해 일시적인 성능 우월 또는 열등이 나타나는 잠깐의 깊이 영역이 존재하는가?

주요 결과

  • 전역 평균 풀링이 있는 CNN은 조건수가 약 $ d imes l imes ilde{ ho}^{-l} $ 만큼 증가함을 보이며, 여기서 $ d $ 는 풀링 크기임을 시사함. 이는 FCN보다 더 높은 안정성과 일반화 성능을 의미함.
  • 풀링이 적용된 CNN의 NTK 주요 고유값은 FCN 대비 $ d $ 배 감소함을 확인함. 이는 직접적으로 일반화 성능 향상에 기여함.
  • 혼돈 단계에서는 풀링이 대각선 NTK 항목의 성장 속도를 $ d $ 배 느리게 하여 예측자 $ P( heta) $ 를 $ d $ 배 향상시킴. 이로 인해 CNN-P가 CNN-F보다 일시적으로 우월한 임시 영역이 발생함.
  • 정렬 단계에서는 풀링이 적용된 CNN의 NTK 조건수가 $ d $ 배 증가함을 확인함. 이는 FCN가 풀링이 있는 CNN보다 일시적으로 우월한 임시 영역이 존재할 수 있음을 시사함.
  • NTK의 일반화 가능한 깊이 척도는 $ ilde{ ho}^{-1} = -1/( ext{log}( ho_c^*) - ext{log}( ho_1)) $ 로 표현되며, 이는 NNGP보다 작음을 확인함. 이는 NTK 역학에서 일반화 실패가 더 이르게 발생함을 의미함.
  • CIFAR-10에서의 경험적 결과는 이론적 예측를 확인함: 풀링이 적용된 네트워크는 다양한 초기화 조건에서 더 잘 일반화되며, 일반화 깊이 척도가 편향 분산 및 정규화 강도의 변화에 대해 탄력적임.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.