[論文レビュー] NASI: Label- and Data-agnostic Neural Architecture Search at Initialization
NASIは、初期化時のニューラルトランジットカーネル(NTK)トレースノルム近似を用いることで、モデルの学習を完全に回避するラベルおよびデータに依存しないニューラルアーキテクチャサーチ(NAS)手法を提案する。この手法は、CIFAR-10/100およびImageNetにおいて、競争力ある汎化性能を示しながら、最先端の探索効率を達成し、ランダムラベルやランダムデータに対しても転送性を示す。
Recent years have witnessed a surging interest in Neural Architecture Search (NAS). Various algorithms have been proposed to improve the search efficiency and effectiveness of NAS, i.e., to reduce the search cost and improve the generalization performance of the selected architectures, respectively. However, the search efficiency of these algorithms is severely limited by the need for model training during the search process. To overcome this limitation, we propose a novel NAS algorithm called NAS at Initialization (NASI) that exploits the capability of a Neural Tangent Kernel in being able to characterize the converged performance of candidate architectures at initialization, hence allowing model training to be completely avoided to boost the search efficiency. Besides the improved search efficiency, NASI also achieves competitive search effectiveness on various datasets like CIFAR-10/100 and ImageNet. Further, NASI is shown to be label- and data-agnostic under mild conditions, which guarantees the transferability of architectures selected by our NASI over different datasets.
研究の動機と目的
- ニューラルアーキテクチャサーチ(NAS)中にモデル学習を完全に排除することで、探索効率を著しく向上させること。
- ニューラルトランジットカーネル(NTK)を用いて、初期化段階でのニューラルアーキテクチャの性能を推定する手法を開発すること。
- 選択されたアーキテクチャが、異なるデータセット、ラベル、データ分布に対して良好に汎化されることを保証すること。
- やや厳しい条件下でもラベルおよびデータに依存しないNASを実現し、探索されたアーキテクチャの転送性を確保すること。
- 高効率的で微分可能かつスケーラブルなNASフレームワークを提供し、高コストな学習を回避しながらも、競争力のある性能を維持すること。
提案手法
- 無限に広いDNNの初期化時における性能を特徴付けるために、ニューラルトランジットカーネル(NTK)を用い、トレーニングを不要とする性能推定を可能にする。
- 勾配フローにインspiredされた定式化を用いて、NTKのトレースノルムを近似し、具体的にはサンプル勾配ノルムの和およびミニバッチ勾配ノルムの和を用いる。
- Gumbel-Softmaxリラクゼーションを用いて離散的なアーキテクチャ選択を緩和することで、NASを連続的かつ微分可能な最適化問題に再定式化する。
- 勾配ベースの最適化アルゴリズムを用いて、いかなるモデル学習を伴わずとも、高性能なアーキテクチャを探索する。
- アーキテクチャの複雑さと最適化性能のバランスを取るために、制約νおよびペナルティ係数μの固定決定法を導入する。
- 複数の探索空間において、正確なNTK値とのピアソン相関分析を通じて、NTKトレースノルム近似の妥当性を検証する。
実験結果
リサーチクエスチョン
- RQ1初期化段階でのモデル学習を一切行わず、ニューラルアーキテクチャサーチを実行することは可能か?
- RQ2ニューラルトランジットカーネル(NTK)トレースノルムを用いて、初期化段階でのニューラルアーキテクチャの性能を正確に予測できるか?
- RQ3NASIはラベルおよびデータに依存しない探索を達成し、異なるデータセットやデータ分布間で転送性を示すか?
- RQ4NTKトレースノルムの近似は、探索の効率性および有効性にどのように影響を与えるか?
- RQ5ハイパーパrameter νおよびμは、最終的に探索されたアーキテクチャの汎化性能にどのような影響を及えるか?
主な発見
- NASIは、CIFAR-10/100およびImageNetにおいて、比較されたすべてのNASアルゴリズムの中で最も低い探索コストを達成しながら、競争力ある性能を維持している。
- NAS-Bench-1Shot1の3つの探索空間すべてにおいて、提案されたNTKトレースノルム近似と正確なNTKトレースノルムとのピアソン相関係数が0.85を超える。
- サンプル勾配ノルムの和が最も優れた近似を示し、S1では0.88、S2では0.92、S3では0.87の相関を示した。
- バッチサイズ(b=8からb=128)の変化に対しても探索結果が安定しており、すべての設定でテスト誤差が±0.3の範囲内に収まることから、近似の頑健性が確認された。
- 最適な制約ν=100が最も低いテスト誤差を達成し、他のν値を上回った。μは最終的な性能に及ぼす影響がνほど顕著ではなかった。
- NASIは、CIFAR-10においても、ランダムに生成されたラベルやデータに対しても、良好な性能を持つアーキテクチャを探索でき、ラベルおよびデータに依存しない性質と強力な転送性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。