Skip to main content
QUICK REVIEW

[논문 리뷰] What Can Be Learnt With Wide Convolutional Neural Networks?

Francesco Cagnetta, Alessandro Favero|arXiv (Cornell University)|2022. 08. 01.
Stochastic Gradient Optimization Techniques인용 수 4
한 줄 요약

이 논문은 무한히 넓은 깊은 합성곱 신경망(CNN)에서 일반화를 신경 탄성 커널(NTK) 영역를 사용하여 연구한다. NTK 스펙트럼이 계층적 구조를 물려받으며, 이는 CNN이 목표 함수의 유효 차원성에 적응할 수 있음을 보여주는데, 함수가 국소적 입력 부분집합에 의존할 경우 오차 감소 속도는 국소적 수신장 크기에 의해 결정되고, 전반적인 입력 차원이 지배할 경우 전체 입력 차원에 의해 결정된다.

ABSTRACT

Understanding how convolutional neural networks (CNNs) can efficiently learn high-dimensional functions remains a fundamental challenge. A popular belief is that these models harness the local and hierarchical structure of natural data such as images. Yet, we lack a quantitative understanding of how such structure affects performance, e.g., the rate of decay of the generalisation error with the number of training samples. In this paper, we study infinitely-wide deep CNNs in the kernel regime. First, we show that the spectrum of the corresponding kernel inherits the hierarchical structure of the network, and we characterise its asymptotics. Then, we use this result together with generalisation bounds to prove that deep CNNs adapt to the spatial scale of the target function. In particular, we find that if the target function depends on low-dimensional subsets of adjacent input variables, then the decay of the error is controlled by the effective dimensionality of these subsets. Conversely, if the target function depends on the full set of input variables, then the error decay is controlled by the input dimension. We conclude by computing the generalisation error of a deep CNN trained on the output of another deep CNN with randomly-initialised parameters. Interestingly, we find that, despite their hierarchical structure, the functions generated by infinitely-wide deep CNNs are too rich to be efficiently learnable in high dimension.

연구 동기 및 목표

  • 깊은 CNN의 계층적이고 국소적인 구조가 고차원 함수 근사에서 일반화에 어떻게 영향을 미치는지 이해한다.
  • 깊은 CNN에서 데이터 구조가 일반화 오차 감소 속도에 미치는 영향을 정량적으로 이해하지 못한 점을 해결한다.
  • 무한히 넓은 깊은 CNN에서 NTK의 스펙트럼을 특성화하여 일반화 한계를 도출한다.
  • 계층적 CNN이 국소성 또는 전반적 의존성의 정도가 다른 함수를 효율적으로 학습할 수 있는지 조사한다.
  • CNN의 인덕티브 바이어스가 고차원 설정에서 차원의 저주를 완화시키는지 여부를 규명한다.

제안 방법

  • 비중첩 패치와 풀링 없이 무한한 넓이 근사에서 깊은 CNN의 신경 탄성 커널(NTK)을 분석한다.
  • 각 은닉층의 수신장에 대응하는 영역에 따라 고유함수를 분해하여 NTK의 스펙트럼을 특성화한다.
  • 층 $ l $에서의 수신장의 유효 차원성 $ d_{\text{eff}}(l) $ 를 기반으로 NTK 고유값의 渐近적 행동을 유도한다.
  • 커널 리지 회귀(Caponnetto & De Vito, 2007)의 일반화 한계를 적용하여 오차 감소가 목표 함수의 유효 차원성과 관련이 있음을 규명한다.
  • 이론적 분석과 합성 및 실질 데이터셋(예: CIFAR-10)에서의 경험적 검증을 통해 예측을 테스트한다.
  • 다양한 입력 분포(다중구면, 초입방체, 가우시안)와 패치 유형(중첩 대비 비중첩) 간의 학습 곡선을 비교한다.

실험 결과

연구 질문

  • RQ1깊은 CNN의 계층적 구조는 무한한 넓이 근사에서 NTK의 스펙트럼에 어떻게 영향을 미치는가?
  • RQ2깊은 CNN이 목표 함수의 공간 척도에 따라 일반화 성능을 얼마나 잘 적응시킬 수 있는가?
  • RQ3각 층에서 수신장의 유효 차원성이 일반화 오차 감소 속도를 결정하는가?
  • RQ4무한히 넓은 CNN은 오직 저차원의 국소적 입력 부분집합에 의존하는 고차원 함수를 효율적으로 학습할 수 있는가?
  • RQ5계층적 CNN의 성능은 고차원이고 구조화된 함수 근사 과제에서 완전히 연결된 네트워크와 비교해 어떻게 되는가?

주요 결과

  • 깊은 CNN에서 NTK의 스펙트럼은 각 층의 수신장에만 의존하는 영역별 고유함수로 구성된다.
  • 고유값은 다항식 차수와 층 $ l $에서의 유효 차원성 $ d_{\text{eff}}(l) $ 의 함수로 渐近적으로 감소하며, $ d_{\text{eff}}(l) $ 가 작을수록 고유값이 더 크다.
  • 일반화 오차는 $ \epsilon(n) \sim n^{-\beta} $ 로 감소하며, 목표 함수가 국소적 입력 부분집합에 의존할 경우 $ \beta \propto 1/d_{\text{eff}} $ 를 만족한다.
  • 목표 함수가 전체 입력 차원에 의존할 경우 오차 감소는 입력 전체 차원 $ d $ 에 의해 결정되며, 이는 차원의 저주를 나타낸다.
  • 비록 계층적 구조를 지녔지만, 무한히 넓은 깊은 CNN이 생성하는 함수는 고차원 입력 공간에서 효율적으로 학습하기에 너무 풍부하다.
  • CIFAR-10과 합성 데이터에서의 경험적 학습 곡선은 이론적 예측을 확인하며, 중첩 패치 조건에서도 깊이 있는 계층적 CNN이 완전히 연결된 아키텍처를 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.