Skip to main content
QUICK REVIEW

[論文レビュー] Neural tangent kernels, transportation mappings, and universal approximation

Ziwei Ji, Matus Telgarsky|arXiv (Cornell University)|Apr 30, 2020
Stochastic Gradient Optimization Techniques参考文献 29被引用数 12
ひとこと要約

この論文は、ランダムな初期値の輸送写像によって得られる重みを用いて、無限幅線形化ネットワークとしてのターゲット関数をモデル化することで、ニューラルトランジットカーネル(NTK)の普遍的近似率を確立する。高い確率で、初期重みを O(B/(eps * sqrt(m))) のオーダーで摂動させることで、ターゲット関数および対応する浅いネットワークの両方に対して (sqrt(eps) + B/sqrt(eps * m))^2 の近似が得られ、既知の浅いネットワークのレートと一致し、普遍的近似がNTK領域に内在していることを示唆する。

ABSTRACT

This paper establishes rates of universal approximation for the neural tangent kernel (NTK) in the standard setting of microscopic changes to initial weights. Concretely, given a target function f, a target width m, and a target approximation error eps>0, then with high probability, moving the initial weight vectors a distance B/(eps * sqrt{m}) will give a linearized finite-width NTK which is (sqrt(eps) + B/sqrt(eps * m))^2-close to both the target function f, and also the shallow network which this NTK linearized. The constant B can be independent of eps --- particular cases studied here include f having good Fourier transform or RKHS norm --- though in the worse case it scales roughly as 1/eps^d for general continuous functions. The method of proof is to rewrite f with equality as an infinite-width linearized network whose weights are a transport mapping applied to random initialization, and to then sample from this transport mapping. This proof therefore provides another perspective on the scaling behavior of the NTK: redundancy in the weights due to resampling allows weights to be scaled down. Since the approximation rates match those in the literature for shallow networks, this work implies that universal approximation is not reliant upon any behavior outside the NTK regime.

研究の動機と目的

  • 有限幅・線形化された状態におけるニューラルトランジットカーネル(NTK)の普遍的近似の定量的レートを確立すること。
  • 近似誤差がターゲット関数の複雑さ、ネットワーク幅 m、望ましい精度 eps にどのように依存するかを理解すること。
  • NTK領域における普遍的近似が線形化カーネルを超える動的挙動を必要としないこと、浅いネットワークの性能と一致することを示すこと。
  • 再サンプリングと輸送写像を用いて重みの冗長性を解釈することで、NTKスケーリングの新しい視点を提供すること。

提案手法

  • ターゲット関数 f を、ランダムな初期重みベクトルに輸送写像を適用して得られる重みを持つ無限幅線形化ネットワークとして再定式化する。
  • そのような輸送写像を定義し、結果として得られる無限幅ネットワークが f を正確に表現できるようにすることで、ターゲット関数の正確な分解を可能にする。
  • 輸送写像からのサンプリングにより、有限幅のNTK近似を構築し、高確率での近似保証を得る。
  • 有限幅NTKと f および対応する浅いネットワークとの間の近似誤差を、(sqrt(eps) + B/sqrt(eps * m))^2 の式を用いてバウンディングする。
  • 関数の性質(フーリエ変換の挙動やRKHSノルムなど)に基づいて定数 B を分析し、望ましい状況では eps に依存しない可能性があることを示す。
  • 一般の連続関数に対しては、B が概ね 1/eps^d のオーダーで増大することが示され、ターゲット関数の複雑さを反映しているが、構造的条件下ではより良いスケーリングが得られる。

実験結果

リサーチクエスチョン

  • RQ1有限幅・線形化された状態におけるNTKが、与えられたターゲット関数 f をどの程度の定量的レートで近似できるか。
  • RQ2普遍的近似を達成するために、ネットワーク幅 m と望ましい精度 eps に応じて初期重みの摂動はどのようにスケーリングされるか。
  • RQ3NTK領域における近似誤差は、既知の浅いネットワークのレートと一致するか。その場合、どのような条件下で一致するか。
  • RQ4初期重みの輸送写像は、高確率での普遍的近似を可能にする上で果たす役割は何か。
  • RQ5NTK領域における普遍的近似は、線形化カーネルを超える非線形ダイナミクスに依存するのか、それともNTK自体に内在する性質なのか。

主な発見

  • 有限幅NTKは、高い確率でターゲット関数 f および対応する浅いネットワークの両方に対して (sqrt(eps) + B/sqrt(eps * m))^2 の近似誤差を達成する。
  • f が良好な性質(良好なフーリエ変換や有界なRKHSノルム)を持つ場合、定数 B は eps に依存しないことがある。
  • 最悪ケースでは、一般の連続関数に対して B は概ね 1/eps^d のオーダーで増大し、ターゲット関数の複雑さを反映している。
  • 本手法は、NTKスケーリングの新しい解釈を提供する:再サンプリングによる冗長性のおかげで、表現能力を失うことなく重みを小さくスケーリングできる。
  • 近似レートは、既知の浅いネットワークのレートと一致しており、NTK領域における普遍的近似が線形化カーネルを超える非線形挙動に依存しないことを示唆している。
  • 本研究は、普遍的近似がNTKフレームワークに本質的に内在しており、線形化された領域を超えるダイナミクスを必要としないことを確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。