Skip to main content
QUICK REVIEW

[論文レビュー] PHEW: Constructing Sparse Networks that Learn Fast and Generalize Well without Training Data

Shreyas Malakarjun Patil, Constantine Dovrolis|arXiv (Cornell University)|Oct 22, 2020
Machine Learning and ELM被引用数 4
ひとこと要約

本稿では、初期重みに基づくバイアス付きランダムウォークを用いて入力出力パスを選択することで、学習データなしで高速収束と優れた一般化性能を達成するデータに依存しないスパースニューラルネットワーク構築手法PHEWを提案する。PHEWは、学習データを一切使用せず、幅広い層を維持しながらも高いパスカーネルトレースを保ち、SynFlow-L2やその他の初期化時プルーニング手法を凌駉する最先端の性能を達成する。

ABSTRACT

Methods that sparsify a network at initialization are important in practice because they greatly improve the efficiency of both learning and inference. Our work is based on a recently proposed decomposition of the Neural Tangent Kernel (NTK) that has decoupled the dynamics of the training process into a data-dependent component and an architecture-dependent kernel - the latter referred to as Path Kernel. That work has shown how to design sparse neural networks for faster convergence, without any training data, using the Synflow-L2 algorithm. We first show that even though Synflow-L2 is optimal in terms of convergence, for a given network density, it results in sub-networks with "bottleneck" (narrow) layers - leading to poor performance as compared to other data-agnostic methods that use the same number of parameters. Then we propose a new method to construct sparse networks, without any training data, referred to as Paths with Higher-Edge Weights (PHEW). PHEW is a probabilistic network formation method based on biased random walks that only depends on the initial weights. It has similar path kernel properties as Synflow-L2 but it generates much wider layers, resulting in better generalization and performance. PHEW achieves significant improvements over the data-independent SynFlow and SynFlow-L2 methods at a wide range of network densities.

研究の動機と目的

  • 高い収束速度を示すが、ボトルネック層が狭くなることが一般的なデータに依存しないプルーニング手法の一般化性能の低さを是正すること。
  • 高速な学習を実現するパスカーネルトレースを最大化すると同時に、良好に分布した広い層幅を維持する手法の開発。
  • 学習データを一切使用せず、初期ネットワーク重みと確率的パス選択に依存するスパースネットワーク構築の実現。
  • 層の収縮や非最適なアーキテクチャ構造を回避しながら、SynFlow-L2を凌駉する。
  • 重みにバイアスをかけたランダムウォークによるパスベースのスパース化が、多様なアーキテクチャと重み初期化において優れた性能を発揮することの検証。

提案手法

  • PHEWは、初期重みの大きさに基づいて入力出力パスを選択することでスパースネットワークを構築し、個々の接続やユニットのプルーニングを避ける。
  • 各層で高い重みを持つエッジを優先するバイアス付きランダムウォークを用い、高速な収束を実現する高いパスカーネルトレースを確保する。
  • 個々のニューロンやエッジではなく、完全なパスを保存することで、層ごとの幅を維持し、ボトルネック層の発生を防ぐ。
  • 勾配計算やデータアクセスを一切行わず、学習前の初期化済みネットワークにのみ、初期重み値に基づいてスパース化を実施する。
  • アルゴリズムは確率的である:各層で、次に進むパスのホップは、流入重みの大きさに比例した確率で選択される。
  • Kaiming、Xavier、Normalなど異なる重み初期化法に対してもPHEWは実証的に安定しており、VGG19およびResNet20で確認されている。

実験結果

リサーチクエスチョン

  • RQ1ボトルネック層を回避することで、SynFlow-L2よりも収束速度が速く一般化性能が優れたデータに依存しないプルーニング手法が可能か。
  • RQ2初期重みに基づくバイアス付きランダムウォークによるパス選択が、一様または逆重みバイアス付きランダムウォークと比較して、より高いパスカーネルトレースと優れた性能をもたらすか。
  • RQ3同じアーキテクチャで異なる重み初期化を使用した場合、PHEWの性能はランダムプルーニングや再初期化されたスパースネットワークと比較してどうなるか。
  • RQ4PHEWが生成するスパースアーキテクチャは初期重みから分離可能か。つまり、重みを再初期化しても性能が低下しないか。
  • RQ5学習データを一切使用せず、高いパスカーネルトレースと広い層を有するスパースネットワークを構築することは可能か。

主な発見

  • CIFAR-10、CIFAR-100、VGG19、ResNet20の複数のアーキテクチャとネットワーク密度において、PHEWはSynFlow-L2や他のデータに依存しないプルーニング手法を顕著に上回る性能を達成する。
  • PHEWは高い層幅を維持しており、SynFlow-L2で見られるようなボトルネック層を回避する。これは、類似したパスカーネルトレースでも一般化性能が著しく優れていることを示している。
  • PHEWのパスカーネルトレースはSynFlow-L2に近く、収束速度は同等であるが、一般化性能は顕著に優れている。
  • PHEWの性能はKaiming、Xavier、Normalなど異なる重み初期化法に対しても安定しており、初期化分布に依存しないことが示された。
  • 再初期化されたPHEWネットワーク(同じアーキテクチャで新しい重みを使用)は、元のPHEWと同等の性能を達成しており、性能の鍵は初期重みではなくアーキテクチャそのものであることが確認された。
  • PHEWは、アンビエイドや逆重みバイアス付きランダムウォークの変種を上回っており、それらは低いパスカーネルトレースと遅い初期収束を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。