Skip to main content
QUICK REVIEW

[論文レビュー] Learning from Randomly Initialized Neural Network Features

Ehsan Amid, Rohan Anil|arXiv (Cornell University)|Feb 13, 2022
Neural Networks and Applications被引用数 7
ひとこと要約

本論文は、ランダムに初期化されたニューラルネットワークの期待ログitから導出される理論的裏付けのある無限次元カーネル、Neural Network Prior Kernel (NNPK) を導入する。NNPK の有限サンプル近似である Neural Random Features (NRF) が意味のあるデータ構造を捉え、学習なしに線形分類器が優れた性能を示すことを示している——例として ImageNet-1K でトップ1正解率10.3%を達成——初期化段階で既にアーキテクチャのインダクティブバイアスが存在していることが明らかになった。

ABSTRACT

We present the surprising result that randomly initialized neural networks are good feature extractors in expectation. These random features correspond to finite-sample realizations of what we call Neural Network Prior Kernel (NNPK), which is inherently infinite-dimensional. We conduct ablations across multiple architectures of varying sizes as well as initializations and activation functions. Our analysis suggests that certain structures that manifest in a trained model are already present at initialization. Therefore, NNPK may provide further insight into why neural networks are so effective in learning such structures.

研究の動機と目的

  • ランダムに初期化されたニューラルネットワークが、何らトレーニングを経ずに効果的な特徴抽出器として機能するかどうかを調査すること。
  • ランダムに初期化されたネットワークのログitの内積の期待値に基づいて、新たなカーネル、Neural Network Prior Kernel (NNPK) を形式化すること。
  • アーキテクチャの選択、重み初期化、活性化関数が NRF を通じて抽出される特徴の質に与える影響を分析すること。
  • 完全にトレーニングされたモデルで観察される構造的性質が、初期化段階のランダム特徴表現にも既に存在するかどうかを調査すること。

提案手法

  • 事前分布 π(θ) に従って重みの実現を複数生成した際のログitの内積の期待値として、Neural Network Prior Kernel (NNPK) を定義する。
  • 複数のランダムに初期化されたニューラルネットワークを用いて、入力例を高次元空間に埋め込む、NNPK の有限サンプル近似である Neural Random Features (NRF) を構築する。
  • 下流の分類タスクにおける性能を評価するために、NRF表現上で線形分類器をトレーニングする。
  • TriMap可視化とコサイン類似度解析を用いて、NRF、元の入力、完全にトレーニングされたモデルにおけるデータの幾何的構造を比較する。
  • モデルアーキテクチャ、初期化手法、活性化関数、正規化層を系統的にアブレーションし、それらが NRF の質に与える影響を調査する。
  • ImageNet-1K を含む大規模データセットに NRF を適用し、スケーラビリティと性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1ランダムに初期化されたニューラルネットワークは、何らトレーニングを経ずに、意味のあるデータ構造を反映する特徴を抽出するのか?
  • RQ2Neural Network Prior Kernel (NNPK) は、深層ネットワークのインダクティブバイアスを理解する理論的基盤として機能できるか?
  • RQ3スキップ接続や正規化層などのアーキテクチャ的要素が、NRF を通じて抽出される特徴の質にどの程度影響を与えるのか?
  • RQ4NRF 上での線形分類器の性能と、同じデータセット上で完全にトレーニングされたモデルの最終正解率との間に相関があるか?

主な発見

  • ランダムに初期化された ResNet-18 モデルから得た 4096 個の Neural Random Features (NRF) を用いてトレーニングした線形分類器が、ImageNet-1K でトップ1正解率 10.3% を達成した。これは、元の入力特徴(150K次元)を用いた線形分類器の 3.4% より顕著に優れていた。
  • 31,568 個の NRF 特徴を用いてトレーニングした2層のMLPが、ImageNet-1K でトップ1正解率 15.2% を達成した。これは、NRF 上の単純なモデルが入力特徴を上回ることを示している。
  • TriMap可視化では、完全にトレーニングされた ResNet-18 モデルで観察されるクラスタ構造やクラスの近接性パターンが、NRF 表現にも既に存在していることが示された。これは、初期化段階でデータ構造がすでに反映されていることを示している。
  • 異なるアーキテクチャや初期化手法において、NRF 上での線形分類器の性能と完全にトレーニングされたモデルの最終正解率の間に強い相関が観察された。これは、NRF がモデルのトレーニング可能性を予測できる可能性を示唆している。
  • スキップ接続と ReLU 活性化関数は NRF の質を向上させるが、最終的なトレーニング済みモデルの性能が常に同じトレンドに従うとは限らない。これは、NNPK がすべての状況で一般化を完全に予測できないことを示している。
  • BatchNorm は NNPK に影響しないが、LayerNorm や InstanceNorm などの他の正規化技術の影響は未調査のままである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。