Skip to main content
QUICK REVIEW

[論文レビュー] On the Similarity between the Laplace and Neural Tangent Kernels

Amnon Geifman, Abhay Kumar Yadav|arXiv (Cornell University)|Jul 3, 2020
Neural Networks and Applications参考文献 48被引用数 12
ひとこと要約

この論文は、データが超球に正規化されている場合、全結合ReLUネットワークのニューラルタングェントカーネル(NTK)が数学的にラプラシアンカーネルと同等であることを示しており、同一の固有関数と多項式固有値減衰率を共有している。これは同一の再生核ヒルベルト空間(RKHS)を意味し、一般化性能および学習ダイナミクスが類似していることを説明する。実験では、実データセット上での性能がほぼ同一であり、一般化されたγ-指数カーネルを用いることでわずかに性能が向上している。

ABSTRACT

Recent theoretical work has shown that massively overparameterized neural networks are equivalent to kernel regressors that use Neural Tangent Kernels(NTK). Experiments show that these kernel methods perform similarly to real neural networks. Here we show that NTK for fully connected networks is closely related to the standard Laplace kernel. We show theoretically that for normalized data on the hypersphere both kernels have the same eigenfunctions and their eigenvalues decay polynomially at the same rate, implying that their Reproducing Kernel Hilbert Spaces (RKHS) include the same sets of functions. This means that both kernels give rise to classes of functions with the same smoothness properties. The two kernels differ for data off the hypersphere, but experiments indicate that when data is properly normalized these differences are not significant. Finally, we provide experiments on real data comparing NTK and the Laplace kernel, along with a larger class ofγ-exponential kernels. We show that these perform almost identically. Our results suggest that much insight about neural networks can be obtained from analysis of the well-known Laplace kernel, which has a simple closed-form.

研究の動機と目的

  • ニューラルタングェントカーネル(NTK)と古典的カーネル手法、特にラプラシアンカーネルの理論的および実験的関係を調査すること。
  • 深層学習におけるNTKの成功が、理解が進んでいるカーネル(例:ラプラシアンカーネル)と共通する性質に起因するかどうかを特定すること。
  • ラプラシアンカーネルからの知見を活用して、NTKに基づく学習の理解や改善を図ること。
  • MNIST、CIFAR-10、および大規模UCIデータセット上でNTK、ラプラシアンカーネル、ガウスカーネル、およびγ-指数カーネルの性能差を評価すること。

提案手法

  • 球面調和関数と積分作用素を用いて、超球𝕊^{d−1}上でのNTKとラプラシアンカーネルの固有関数および固有値減衰率の理論的分析。
  • 超球上でのラプラシアンカーネルのスペクトル的性質および深層全結合ネットワークにおけるNTKのスペクトル的性質に関する新規結果の導出。
  • 交差検証とスケーラブルなカーネルリッジ回帰のためのFALKONアルゴリズムを用いて、MNIST、CIFAR-10、および大規模UCIデータセット上でNTK、ラプラシアンカーネル、ガウスカーネル、γ-指数カーネルの実験的比較。
  • 画像データをモデル化するために、局所的パッチ類似度と層間のカーネル合成を組み合わせた階層的指数カーネル(C-Exp)の使用。
  • 2層ReLUネットワークのNTKに一致するように、C-Expカーネルのパラメータを非線形最小二乗最適化によりフィッティング。
  • 数値的安定性を確保するため、カーネル行列の正規化とリッジ正則化(λ=5×10⁻⁵)の適用。

実験結果

リサーチクエスチョン

  • RQ1データが超球上にある場合、ニューラルタングェントカーネルとラプラシアンカーネルは同一の再構成核ヒルベルト空間(RKHS)を共有するか?
  • RQ2超球上でのNTKとラプラシアンカーネルの固有関数および固有値減衰率は同一か? これは同一の関数クラスを意味するか?
  • RQ3実際の応用において、NTKの一般化性能および学習ダイナミクスはラプラシアンカーネルと比べてどうなるか?
  • RQ4一般化されたγ-指数カーネルは、実世界の機械学習ベンチマークでNTKを上回る性能を示すか?
  • RQ5超球上でのカーネル挙動の差が、実データ応用における性能に与える影響はどの程度か?

主な発見

  • 超球上では、深層ReLUネットワークのNTKとラプラシアンカーネルは同一の固有関数を共有し、同じ多項式固有値減衰率を示す。実験的勾配は𝕊¹上で-1.94、𝕊²上で-2.75である。
  • このスペクトル的同等性は、両カーネルが同一の再構成核ヒルベルト空間(RKHS)を誘導することを意味し、滑らかな関数の同一クラスを表す。
  • MNISTおよびCIFAR-10における実験では、ラプラシアンカーネルがNTKとほぼ同一の性能を示し、複数回の実行で同等のテスト精度を達成した。
  • 一般化されたγ-指数カーネルは、HIGGSやSUSYなどの複数の標準データセットでNTKをわずかに上回る性能を示し、最適なγ値は約1.6–1.8であった。
  • 大規模データセット(例:MillionSongs、HIGGS、SUSY)では、γ-指数カーネルがNTKおよびラプラシアンカーネルを上回り、交差検証により最適なハイパーパrameterが特定された。
  • 局所的類似度を層間で合成する階層的C-Expカーネルアーキテクチャは、画像データを効果的にモデル化でき、NTK挙動を再現するように最適化されたパラメータで競争力ある性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。