[論文レビュー] Fast Neural Kernel Embeddings for General Activations
本稿では、切り捨てられたエルミート展開を用いて、任意の滑らかな活性化関数に対してニューラルネットワークガウス過程(NNGP)およびニューラルタングェントカーネル(NTK)行列を高速に一般化して計算する手法を提案する。活性化関数の級数展開を用い、スケッチ技術を適用することで、正確な計算と比較して最大106倍の高速化を達成しながら高い精度を維持し、ReLUを超える多様なアーキテクチャおよびデータセットにおけるスケーラブルなカーネルベースの解析を可能にする。
Infinite width limit has shed light on generalization and optimization aspects of deep learning by establishing connections between neural networks and kernel methods. Despite their importance, the utility of these kernel methods was limited in large-scale learning settings due to their (super-)quadratic runtime and memory complexities. Moreover, most prior works on neural kernels have focused on the ReLU activation, mainly due to its popularity but also due to the difficulty of computing such kernels for general activations. In this work, we overcome such difficulties by providing methods to work with general activations. First, we compile and expand the list of activation functions admitting exact dual activation expressions to compute neural kernels. When the exact computation is unknown, we present methods to effectively approximate them. We propose a fast sketching method that approximates any multi-layered Neural Network Gaussian Process (NNGP) kernel and Neural Tangent Kernel (NTK) matrices for a wide range of activation functions, going beyond the commonly analyzed ReLU activation. This is done by showing how to approximate the neural kernels using the truncated Hermite expansion of any desired activation functions. While most prior works require data points on the unit sphere, our methods do not suffer from such limitations and are applicable to any dataset of points in $\mathbb{R}^d$. Furthermore, we provide a subspace embedding for NNGP and NTK matrices with near input-sparsity runtime and near-optimal target dimension which applies to any \emph{homogeneous} dual activation functions with rapidly convergent Taylor expansion. Empirically, with respect to exact convolutional NTK (CNTK) computation, our method achieves $106 imes$ speedup for approximate CNTK of a 5-layer Myrtle network on CIFAR-10 dataset.
研究の動機と目的
- 一般の活性化関数における正確なNNGPおよびNTK計算の計算ボトルネックを克服すること。これは、カーネル表現が扱いにくいため、ReLUやその他の少数の関数に限定されている。
- ReLUを超えた無限幅カーネル理論を拡張し、任意の滑らかな活性化関数に対して正確かつ近似的にニューラルカーネルを計算可能にする。
- 入力スパarsityに近い実行時間と、近似的に最適な次元を達成するスケッチベースの手法を設計し、一般の同次双対活性化関数に対してNNGPおよびNTK行列を効率的に計算する。
- 実世界のデータセットを用いた実験的検証を行い、カーネルにインスパイラードされた活性化関数が有限幅ネットワークの性能向上に寄与することを示す。
提案手法
- 任意の滑らかな活性化関数を切り捨てられたエルミート級数に表現することで、展開の係数を用いて双対カーネルの正確な計算が可能になる。
- 超幾何関数および特殊関数の恒等式を用いて、単項式、ガボール、ELU活性化関数の双対カーネルに対して閉形式の表現を導出する。
- 正確な双対カーネルが不明な一般の活性化関数に対しては、エルミート展開を用いて誤差を制御可能な近似を実現する。
- 入力スパarsityに近い実行時間と、近似的に最適な次元を達成するスケッチアルゴリズムを提案し、完全なNNGPおよびNTK行列を近似する。
- データが単位球面上にある必要がないため、R^d上に存在する任意のデータセットに適用可能である。
- エルミート多項式が単項式カーネルのランダム特徴量として機能することを活用し、効率的なカーネル計算を実現する。
実験結果
リサーチクエスチョン
- RQ1GELU、正弦波、ELUなどの非ReLU活性化関数の広いクラスに対して、正確なNNGPおよびNTKカーネルを計算できるか?
- RQ2モンテカルロサンプルや正確な再帰的計算に依存せずに、一般の活性化関数に対してニューラルカーネルを効率的に近似できるか?
- RQ3入力スパarsityに近い実行時間と、近似的に最適な次元を達成するスケッチベースのアルゴリズムを、多様な活性化関数に対して設計できるか?
- RQ4既知のカーネル形から導出されたカーネルにインスパイラードされた活性化関数は、有限幅ネットワークにおける一般化性能をどの程度向上させるか?
主な発見
- 本手法は、CIFAR-10における5層Myrtleネットワークに対して、正確な畳み込みNTK(CNTK)計算と比較して106倍の高速化を達成し、精度損失は最小限に抑えられた。
- エルミート級数および特殊関数の恒等式を用いて、単項式、ガボール、ELU活性化関数の双対カーネルを正確に計算可能である。
- 逆設計により正規化されたガウスカーネルから導出された新しい活性化関数ABReLUは、5層Myrtle-5ネットワークにおいてReLU、GELU、Erf、PReLUと比較して最高のテスト精度(94.8%)を達成した。
- スケッチアルゴリズムは、収束が速いテイラー展開を有する一般の同次双対活性化関数に対して、NNGPおよびNTK行列の部分空間埋め込みを提供し、入力スパarsityに近い実行時間と近似的に最適な次元を達成する。
- 本手法はR^d上に存在する任意のデータセットに適用可能であり、先行研究とは異なり、データを単位球面に正規化する必要がない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。