Skip to main content
QUICK REVIEW

[논문 리뷰] On Exact Computation with an Infinitely Wide Neural Net

Sanjeev Arora, Simon S. Du|arXiv (Cornell University)|2019. 04. 26.
Gaussian Processes and Bayesian Inference참고 문헌 36인용 수 61
한 줄 요약

이 논문은 CNN용 CNTK를 정확하고 GPU 친화적으로 계산하는 알고리즘을 제시하고, 유한 너비의 넓은 네트가 CNTK 커널 회귀로 수렴함을 증명하며, CNTK가 CIFAR-10에서 강한 성능을 발휘함을 보여준다.

ABSTRACT

How well does a classic deep net architecture like AlexNet or VGG19 classify on a standard dataset such as CIFAR-10 when its width --- namely, number of channels in convolutional layers, and number of nodes in fully-connected internal layers --- is allowed to increase to infinity? Such questions have come to the forefront in the quest to theoretically understand deep learning and its mysteries about optimization and generalization. They also connect deep learning to notions such as Gaussian processes and kernels. A recent paper [Jacot et al., 2018] introduced the Neural Tangent Kernel (NTK) which captures the behavior of fully-connected deep nets in the infinite width limit trained by gradient descent; this object was implicit in some other recent papers. An attraction of such ideas is that a pure kernel-based method is used to capture the power of a fully-trained deep net of infinite width. The current paper gives the first efficient exact algorithm for computing the extension of NTK to convolutional neural nets, which we call Convolutional NTK (CNTK), as well as an efficient GPU implementation of this algorithm. This results in a significant new benchmark for the performance of a pure kernel-based method on CIFAR-10, being $10\%$ higher than the methods reported in [Novak et al., 2019], and only $6\%$ lower than the performance of the corresponding finite deep net architecture (once batch normalization, etc. are turned off). Theoretically, we also give the first non-asymptotic proof showing that a fully-trained sufficiently wide net is indeed equivalent to the kernel regression predictor using NTK.

연구 동기 및 목표

  • 무한히 넓은 CNN이 CIFAR-10과 같은 표준 데이터셋에서 어떻게 성능을 발휘하는지 이해를 촉진한다.
  • CNN에 대한 Convolutional Neural Tangent Kernel (CNTK)을 정확하고 효율적으로 계산하는 알고리즘을 개발한다.
  • 완전하게 학습된 넓은 네트가 CNTK를 이용한 커널 회귀와 동등함을 입증한다.
  • 비점근 수렴 결과를 제공하고 CNTK 성능을 유한 네트와 비교한다.
  • 커널 기반의 이해를 심화하기 위한 실용적인 GPU 구현과 벤치마크를 제시한다.

제안 방법

  • 무한 너비 한계에서의 신경망 구조를 정의하고 CNTK를 파라미터에 대한 출력의 기울기로부터 유도된 커널로 기술한다.
  • vanilla CNN과 전역 평균 풀링(GAP)이 포함된 CNN의 CNTK 수식을 합성곱과 풀링 단계를 포함하여 명시적으로 도출한다.
  • 비점근 수렴을 입증한다: 최소 층 너비가 Omega(L^6/epsilon^4 log(L/delta))로 스케일링되어 초기화 시 NTK 수렴(ReLU 활성화)을 보장한다.
  • 완전하게 학습된 넓은 네트와 finite-width 교란 한계(정리 3.2)에 따른 NTK 기반 커널 회귀 간의 동등성을 입증한다.
  • CNTK를 정확히 계산하기 위한 정확한 동적 계획법 기반 알고리즘을 제시하고 GPU에서 구현을 최적화한다.

실험 결과

연구 질문

  • RQ1합성곱 네트워크에 풀링이 있는 경우 CNTK를 정확하게 계산할 수 있는가?
  • RQ2완전히 학습된 무한히 넓은 CNN이 NTK 하에서 커널 회귀에 대응하는가?
  • RQ3CNTK 기반 커널의 성능이 CIFAR-10에서 유한 너비 CNN에 비해 얼마나 근접한가?
  • RQ4NTK 수렴을 보장하기 위한 유한 너비의 요건은 무엇이며 커널 회귀와 같은 동작을 보장하는가?
  • RQ5깊이와 전역 평균 풀링이 이미지 분류 작업에서 CNTK 성능에 실질적으로 영향을 미치는가?

주요 결과

  • CNTKs는 11레이어 CNN-GAP에서 CIFAR-10에 77.43% 정확도를 달성하며, 이전 GP 기반 커널보다 약 10%포인트 정도 우수하다.
  • GAP가 있는 11레이어 CNTK는 배치 정규화 및 데이터 증강이 제어될 때 해당 유한 심층 네트의 성능에 약 5% 내외로 근접하다.
  • CNTK 기반 커널은 CIFAR-10에서 초기 고정 커널 GP 방법들보다 상당히 강력하며 최대 약 10% 정도 우수하다.
  • 깊이와 전역 평균 풀링은 CNTK 성능에 큰 영향을 미치며, GAP는 일반 CNN에 비해 상당한 이점을 제공한다.
  • CNTK(무한 너비)와 유한 CNN 간에는 여전히 5–6%의 차이가 남아 있어 유한 너비의 이점이 지속됨을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.