[論文レビュー] Weak NAS Predictors Are All You Need.
この論文では、反復的な弱い予測子を用いた粗いから細かい方向へのNASフレームワークを提案する。これらの予測子は、段階的に性能の高いアーキテクチャに近づくように探索空間を洗練していく。単純で精度が低い予測子の系列を訓練し、その能力が向上することでより良いアーキテクチャをサンプリングする能力を高めることで、従来の手法よりもはるかに少ないサンプル数で、NAS-Bench-101、NAS-Bench-201、およびImageNetにおいて最先端の性能を達成する。
Neural Architecture Search (NAS) finds the best network architecture by exploring the architecture-to-performance manifold. It often trains and evaluates a large number of architectures, causing tremendous computation costs. Recent predictor-based NAS approaches attempt to solve this problem with two key steps: sampling some architecture-performance pairs and fitting a proxy accuracy predictor. Given limited samples, these predictors, however, are far from accurate to locate top architectures. In this paper, we shift the paradigm from finding a complicated predictor that covers the whole architecture space to a set of weaker predictors that progressively move towards the high-performance sub-space. It is based on the key property of the proposed weak predictors that their probabilities of sampling better architectures keep increasing. We thus only sample a few well-performed architectures guided by the previously learned predictor and estimate a new better weak predictor. By this coarse-to-fine iteration, the ranking of sampling space is refined gradually, which helps find the optimal architectures eventually. Experiments demonstrate that our method costs fewer samples to find the top-performance architectures on NAS-Bench-101 and NAS-Bench-201, and it achieves the state-of-the-art ImageNet performance on the NASNet search space. The code is available at this https URL
研究の動機と目的
- 複雑でグローバルな予測子を置き換えることで、ニューラルアーキテクチャ探索(NAS)の計算コストを低減すること。
- 限られたトレーニングサンプルで性能が低い単一の予測子モデルが、性能の高いアーキテクチャを特定する能力に欠ける問題に対処すること。
- 弱い予測子に従って粗いから細かい方向へのサンプリングで段階的に探索空間を洗練するプログレッシブな探索戦略を開発すること。
- 最小限のサンプル効率で、ベンチマークNASデータセットおよび実世界のImageNet探索空間で最先端の性能を達成すること。
提案手法
- 本手法は、少量のサンプルされたアーキテクチャ-性能ペアに基づいて訓練される弱い予測子の系列を用いる。各予測子は、段階的に性能の高い部分空間に焦点を当てる。
- 各イテレーションで、現在の弱い予測子を用いて、より高い性能を持つアーキテクチャの新しいバッチをサンプリングし、それを次のイテレーション用の洗練された予測子を訓練するためのデータとして使用する。
- 主なイノベーションは、時間の経過とともにより良いアーキテクチャをサンプリングする確率が上昇する弱い予測子の設計にあり、これにより探索空間が粗いから細かい方向へ段階的に洗練される。
- 代わりに、グローバルな1つの予測子を訓練するのではなく、各イテレーションで改善される局所的で低複雑性のモデルの鎖を維持することで、フレームワークは単一のグローバル予測子の訓練を回避する。
- 本手法は、アーキテクチャ-性能多様体に着目し、予測精度が高い領域に集中することで、網羅的な評価の必要性を低減する。
- 反復的なプロセスは収束するか、事前に定義されたサンプル予算に達するまで継続され、性能の高いアーキテクチャの効率的な探索が保証される。
実験結果
リサーチクエスチョン
- RQ1限られた個々の精度しか持たない弱い予測子の系列が、複雑な単一の予測子を上回る性能を発揮できるか?
- RQ2弱い予測子を用いた反復的洗練は、アーキテクチャ探索の効率性と正確性をどのように向上させるか?
- RQ3弱い予測子に従った段階的サンプリング戦略は、標準的なNASベンチマークでより良い性能をもたらすか?
- RQ4このアプローチは、サンプル数を最小限に抑えて大規模なデータセット(例:ImageNet)でも最先端の結果を達成できるか?
- RQ5順次的探索フレームワークにおいて、予測子の品質とより良いアーキテクチャをサンプリングする確率の関係は何か?
主な発見
- 提案手法は、従来の手法よりもはるかに少ないアーキテクチャ評価回数で、NAS-Bench-101およびNAS-Bench-201で最先端の性能を達成する。
- 弱い予測子による反復的洗練を活用することで、トップパフォーマンスのアーキテクチャを発見するための必要なサンプル数を削減する。
- ImageNetの探索空間において、本手法は極めて少ないトレーニング実行回数で最先端の精度を達成し、スケーラビリティを示している。
- 弱い予測子はイテレーションを経るごとに、より良いアーキテクチャをサンプリングする能力が単調に向上しており、コアな設計原則が妥当であることが裏付けられた。
- 標準ベンチマークにおいて、本手法はサンプル効率および最終的なアーキテクチャ性能の両面で、既存の予測子ベースのNAS手法を上回っている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。