[論文レビュー] Learning sparse features can lead to overfitting in neural networks
この論文は、過パラメータ化されたニューラルネットワークにおける特徴抽出が、スパースな表現の出現によって滑らかさが低下し一般化性能が劣化する原因となる可能性があることを示している。一方、NTKを介したラージトレーニング(lazy training)は、滑らかでより頑健な予測子を生成し、画像変形などの滑らかな入力変換に対して不変性を要するタスクにおいて特に優れている。
It is widely believed that the success of deep networks lies in their ability to learn a meaningful representation of the features of the data. Yet, understanding when and how this feature learning improves performance remains a challenge: for example, it is beneficial for modern architectures trained to classify images, whereas it is detrimental for fully-connected networks trained for the same task on the same data. Here we propose an explanation for this puzzle, by showing that feature learning can perform worse than lazy training (via random feature kernel or the NTK) as the former can lead to a sparser neural representation. Although sparsity is known to be essential for learning anisotropic data, it is detrimental when the target function is constant or smooth along certain directions of input space. We illustrate this phenomenon in two settings: (i) regression of Gaussian random functions on the d-dimensional unit sphere and (ii) classification of benchmark datasets of images. For (i), we compute the scaling of the generalization error with number of training points, and show that methods that do not learn features generalize better, even when the dimension of the input space is large. For (ii), we show empirically that learning features can indeed lead to sparse and thereby less smooth representations of the image predictors. This fact is plausibly responsible for deteriorating the performance, which is known to be correlated with smoothness along diffeomorphisms.
研究の動機と目的
- 特徴抽出が画像分類タスクでは性能を劣化させる場合がある理由を理解すること。
- 特に高次元入力空間において、一般化誤差に与える表現スパarsityの役割を調査すること。
- 特徴抽出が単純な回帰タスクでは成功する一方で、画像データセットでは失敗するというパラドックスを説明すること。
- 滑らかさと入力変換に対する不変性の観点から、特徴抽出とラージトレーニングの内蔵バイアスを明確にすること。
- 神経表現におけるスパarsityが微分同相変換や滑らかな変形に対して頑健性を低下させ、一般化性能を悪化させることを実証すること。
提案手法
- 無限幅の全結合ネットワークを用いて、d次元単位球面上のランダムな滑らかな関数の回帰を、ラージトレーニング(NTK)と特徴抽出(平均場)の両レジームで研究する。
- NTK極限をラージトレーニングのモデルとし、平均場極限を特徴抽出のモデルとし、両者を解析的および数値的に分析する。
- 解のサポート構造を分析し、特徴抽出が少数の活性化ニューロンを持つアトミック(スパース)表現をもたらすことを示す。
- 平均場極限をシミュレートするためのαトリックを用い、明示的な正則化なしに訓練済みネットワークにおけるスパarsityを実証的に検証する。
- 微分同相変換や平行移動に対する感受性を指標として予測子の滑らかさを定量化し、ラージトレーニングと特徴抽出レジームを比較する。
- 実際の画像変形を模倣するための微分同相変換の最大エントロピーモデルを用い、予測子の頑健性を評価する。
実験結果
リサーチクエスチョン
- RQ1なぜ特徴抽出は、単純な回帰タスクでは有益である一方で、画像分類タスクでは性能を劣化させるのか?
- RQ2ニューラル表現におけるスパarsityが予測子の滑らかさと一般化に与える影響は何か?
- RQ3高次元入力空間において、ラージトレーニング(NTK)レジームが特徴抽出レジームよりもどれほど滑らかな予測子を生成するのか?
- RQ4異なるトレーニングレジームは、画像変形や平行移動などの滑らかな入力変換に対して、どのように感受性を示すか?
- RQ5特徴抽出とラージトレーニングの性能差は、無関係な入力摂動に対する不変性の違いによって説明可能か?
主な発見
- 特徴抽出は、明示的な正則化がなくても、訓練後にわずかに少数のニューロンしか活性化しないようなスパースな表現をもたらす。
- NTK(ラージトレーニング)レジームは、特に滑らかなターゲット関数に対して、球面上の回帰タスクで特徴抽出レジームよりも一般化性能が優れている。
- 一般化誤差はNTKレジームでより好ましいスケーリングを示すが、特徴抽出レジームでは入力次元が増加するにつれてスケーリングが悪化する。
- 特徴抽出は滑らかでない予測子を生成し、微分同相変換や滑らかな変形に対して感受性が高くなる。これは性能劣化と相関している。
- 実証的に、特徴抽出は境界ピクセルの破損などの無関係な入力変化に対して不変性が低く、一方ラージトレーニングはより良い不変性を維持する。
- 特徴抽出とラージトレーニングの性能差は、境界ノイズへの感受性ではなく、画像分類タスクにおいてより関連性の高い微分同相変換への感受性の違いによって説明される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。