[論文レビュー] Stronger NAS with Weaker Predictors
この論文では、単一の強力な予測器に代えて、段階的に改善される弱い予測器の系列を用いることで、サンプル効率を向上させる、新しいニューラルアーキテクチャサーチ(NAS)フレームワークであるWeakNASを提案する。繰り返し、以前の予測器が示した有望な部分空間からアーキテクチャをサンプリングすることで、WeakNASは、NAS-Bench-101でグローバル最適解を発見するのに、従来手法と比較して少なくとも7.5倍少ないサンプルで最先端の性能を達成し、MobileNetの探索空間を用いてImageNetで81.3%のトップ-1精度を達成する。
Neural Architecture Search (NAS) often trains and evaluates a large number of architectures. Recent predictor-based NAS approaches attempt to alleviate such heavy computation costs with two key steps: sampling some architecture-performance pairs and fitting a proxy accuracy predictor. Given limited samples, these predictors, however, are far from accurate to locate top architectures due to the difficulty of fitting the huge search space. This paper reflects on a simple yet crucial question: if our final goal is to find the best architecture, do we really need to model the whole space well?. We propose a paradigm shift from fitting the whole architecture space using one strong predictor, to progressively fitting a search path towards the high-performance sub-space through a set of weaker predictors. As a key property of the weak predictors, their probabilities of sampling better architectures keep increasing. Hence we only sample a few well-performed architectures guided by the previously learned predictor and estimate a new better weak predictor. This embarrassingly easy framework, dubbed WeakNAS, produces coarse-to-fine iteration to gradually refine the ranking of sampling space. Extensive experiments demonstrate that WeakNAS costs fewer samples to find top-performance architectures on NAS-Bench-101 and NAS-Bench-201. Compared to state-of-the-art (SOTA) predictor-based NAS methods, WeakNAS outperforms all with notable margins, e.g., requiring at least 7.5x less samples to find global optimal on NAS-Bench-101. WeakNAS can also absorb their ideas to boost performance more. Further, WeakNAS strikes the new SOTA result of 81.3% in the ImageNet MobileNet Search Space. The code is available at https://github.com/VITA-Group/WeakNAS.
研究の動機と目的
- 限られたサンプル数で複雑なアーキテクチャ空間全体をモデル化する単一の強い予測器に依存する従来の予測器ベースのNAS手法の非効率性を解消すること。
- グローバルモデリングから弱い予測器による段階的改善へのシフトにより、計算コストとばらつきを低減すること。
- さまざまなアーキテクチャ表現および予測器アーキテクチャにおいて、サンプル効率とロバスト性を向上させること。
- 標準的なNASベンチマークおよび実世界の探索空間(例:ImageNet)で最先端の性能を達成すること。
提案手法
- WeakNASは反復的なフレームワークを採用しており、各反復で、小さな限定されたアーキテクチャサブセット上で訓練された弱い予測器を用いて、より高い性能を示す部分空間へのサンプリングをガイドする。
- 各ステップで、現在の弱い予測器によって上位-N位にランク付けされたアーキテクチャからサンプリングを行い、段階的に探索空間を絞り込み、高品質な領域に注目する。
- 探索と活用のバランスを保つために、サンプリング比 ε = M/N を動的に調整し、各反復でより高い性能を示すアーキテクチャのサンプリング確率を高める。
- 各新しい弱い予測器は、直前の反復で得られた最新の高品質なサンプルにのみ特化して訓練されるため、探索パスの段階的改善が可能になる。
- このフレームワークはアーキテクチャエンコーディングや予測器タイプに対して無関係であり、さまざまな組み合わせの埋め込みとモデル(例:MLP、ランダムフォレスト、勾配ブースティング)をサポートする。
- WeakNASは、半教師あり学習(例:Semi-NAS)などの他の手法と組み合わせることで、トレーニング中に偽ラベルを活用することで、さらなる性能向上が可能になる。
実験結果
リサーチクエスチョン
- RQ1段階的に探索空間を改善する弱い予測器の系列は、サンプル効率の面で単一の強い予測器を上回ることができるか?
- RQ2高性能な部分空間への段階的改善は、NASにおけるばらつきを低減し、ロバスト性を向上させるか?
- RQ3アーキテクチャの再設計なしに、さまざまなアーキテクチャエンコーディングおよび予測器アーキテクチャに一般化可能か?
- RQ4標準的なNASベンチマークで最適なアーキテクチャを発見するために必要なクエリ数を、WeakNASはどの程度削減できるか?
- RQ5WeakNASは、最小限のクエリ予算で、ImageNetのような大規模な探索空間で最先端の性能を達成できるか?
主な発見
- WeakNASはNAS-Bench-101で最先端の性能を達成し、グローバル最適アーキテクチャを発見するのに、従来の最先端手法と比較して少なくとも7.5倍少ないクエリを必要とする。
- NAS-Bench-201では、特にサンプル予算が低い状況下でも、強い予測器ベースラインと比較して著しく低いばらつきと高速な収束を示す。
- ImageNetのMobileNet探索空間において、WeakNASはたった1,000のクエリで81.3%のトップ-1精度を達成し、類似のクエリ制約下でLaNAS(80.8%)やOFA(80.0%)を上回る。
- Semi-NASと組み合わせることで、WeakNASはさらなる性能向上を示し、既存の半教師ありNAS技術と高い相性と相乗効果を発揮することが確認された。
- NASに必要なGPUデイ数を数百から0.2未満にまで削減し、計算コストとエネルギー消費を顕著に低減した。
- さまざまなアーキテクチャエンコーディングおよび予測器タイプにおいても、強い性能を維持しており、高い汎化性と柔軟性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。