Skip to main content
QUICK REVIEW

[논문 리뷰] On the Similarity between the Laplace and Neural Tangent Kernels

Amnon Geifman, Abhay Kumar Yadav|arXiv (Cornell University)|2020. 07. 03.
Neural Networks and Applications참고 문헌 48인용 수 12
한 줄 요약

이 논문은 데이터가 초구면으로 정규화될 경우, 완전히 연결된 ReLU 네트워크의 신경미분 커널(Neural Tangent Kernel, NTK)이 수학적으로 라플라스 커널과 동일하다고 보여준다. 이는 동일한 고유함수와 다항식 고유값 감쇠 비율을 공유하며, 이는 동일한 재생 커널 힐버트 공간(RKHS)을 유도함을 의미한다. 이는 일반화 및 훈련 동역학이 유사함을 설명하며, 실제 데이터셋에서 거의 동일한 성능을 보이며, 일반화된 γ-지수 커널을 사용할 경우 약간 향상된 성능을 기록한다.

ABSTRACT

Recent theoretical work has shown that massively overparameterized neural networks are equivalent to kernel regressors that use Neural Tangent Kernels(NTK). Experiments show that these kernel methods perform similarly to real neural networks. Here we show that NTK for fully connected networks is closely related to the standard Laplace kernel. We show theoretically that for normalized data on the hypersphere both kernels have the same eigenfunctions and their eigenvalues decay polynomially at the same rate, implying that their Reproducing Kernel Hilbert Spaces (RKHS) include the same sets of functions. This means that both kernels give rise to classes of functions with the same smoothness properties. The two kernels differ for data off the hypersphere, but experiments indicate that when data is properly normalized these differences are not significant. Finally, we provide experiments on real data comparing NTK and the Laplace kernel, along with a larger class ofγ-exponential kernels. We show that these perform almost identically. Our results suggest that much insight about neural networks can be obtained from analysis of the well-known Laplace kernel, which has a simple closed-form.

연구 동기 및 목표

  • 신경미분 커널(NTK)과 고전적 커널 방법, 특히 라플라스 커널 간의 이론적 및 실증적 관계를 조사하기 위해.
  • 딥 러닝에서 NTK의 성공이 라플라스 커널과 같은 잘 이해된 커널들과 공유하는 성질 때문인지 규명하기 위해.
  • 라플라스 커널에서의 통찰을 활용해 NTK 기반 학습을 이해하거나 향상시킬 수 있는지 평가하기 위해.
  • 실세계 데이터셋에서 NTK, 라플라스, 가우시안, γ-지수 커널을 비교하여 성능 차이를 평가하기 위해.

제안 방법

  • 구면 조화함수와 적분 연산자를 사용하여 초구면 𝕊^{d−1}에서 NTK와 라플라스 커널의 고유함수 및 고유값 감쇠 비율에 대한 이론적 분석을 수행하였다.
  • 초구면에서 라플라스 커널의 스펙트럼 성질과 깊이 있는 완전히 연결된 네트워크의 NTK 스펙트럼 성질에 대한 새로운 결과를 유도하였다.
  • 교차검증과 스케일러블 커널 리지 회귀를 위한 FALKON 알고리즘을 사용하여 MNIST, CIFAR-10 및 대규모 UCI 데이터셋에서 NTK, 라플라스, 가우시안, γ-지수 커널 간의 실증적 비교를 수행하였다.
  • 이미지 데이터를 모델링하기 위해 계층적 지수 커널(C-Exp)을 사용하였으며, 이는 국소 패치 유사성과 계층 간 커널 조합을 통합한다.
  • 정규화된 이미지 패치에서 두 층의 ReLU 네트워크의 NTK를 일치시키기 위해 C-Exp 커널의 커널 파라미터를 비선형 최소제곱 최적화로 피팅하였다.
  • 수치적 안정성을 확보하기 위해 커널 행렬을 정규화하고 릿지 정규화(λ=5×10⁻⁵)를 적용하였다.

실험 결과

연구 질문

  • RQ1데이터가 초구면에 있을 경우, 신경미분 커널(NTK)과 라플라스 커널은 동일한 재생 커널 힐버트 공간(RKHS)을 공유하는가?
  • RQ2초구면에서 NTK와 라플라스 커널의 고유함수와 고유값 감쇠 비율이 동일한가? 이는 동일한 함수 클래스를 의미하는가?
  • RQ3실제로 NTK의 일반화 및 훈련 동역학은 라플라스 커널과 어떻게 비교되는가?
  • RQ4일반화된 γ-지수 커널은 실제 기계학습 벤치마크에서 NTK를 뛰어넘을 수 있는가?
  • RQ5초구면 외부에서 커널 행동의 차이가 실생활 데이터 응용에서 성능에 얼마나 큰 영향을 미치는가?

주요 결과

  • 초구면에서 깊이 있는 ReLU 네트워크의 NTK와 라플라스 커널은 동일한 고유함수를 가지며, 동일한 다항식 고유값 감쇠 비율을 보이며, 𝕊¹에서의 경험적 기울기는 -1.94, 𝕊²에서의 기울기는 -2.75이다.
  • 이 스펙트럼 동치성은 두 커널이 동일한 재생 커널 힐버트 공간(RKHS)을 유도함을 의미하며, 이는 동일한 부드러운 함수 클래스를 나타낸다.
  • MNIST 및 CIFAR-10에서의 실험 결과, 라플라스 커널은 NTK와 거의 동일한 성능을 보이며, 여러 시행에서 유사한 테스트 정확도를 기록하였다.
  • 일반화된 γ-지수 커널은 HIGGS 및 SUSY와 같은 여러 표준 데이터셋에서 NTK를 略히 뛰어넘는 성능을 기록하였으며, 최적의 γ 값은 약 1.6–1.8 범위였다.
  • 대규모 데이터셋(MillionSongs, HIGGS, SUSY)에서는 γ-지수 커널이 NTK 및 라플라스 커널을 모두 능가하였으며, 최적의 하이퍼파rameter는 교차검증을 통해 확보되었다.
  • 계층적 C-Exp 커널 아키텍처는 국소 유사성을 계층 간에 조합하여 이미지 데이터를 성공적으로 모델링하였으며, NTK 행동을 일치시키기 위해 최적화된 파라미터를 통해 경쟁 가능한 성능을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.