Skip to main content
QUICK REVIEW

[論文レビュー] Few-shot Neural Architecture Search

Yiyang Zhao, Linnan Wang|arXiv (Cornell University)|Jun 11, 2020
Advanced Neural Network Applications参考文献 59被引用数 9
ひとこと要約

本論文は、1つのスーパーネットに依存するワンショットNASにおける共適応を軽減し、性能予測の正確性を向上させる、少数ショットニューラルアーキテクチャサーチ(NAS)を提案する。同時に、評価コストを低く保ちつつ、1ショットNASを凌駉する性能を達成している。本手法は、わずか7つのサブスーパーネットで600 MFLOPSの計算コストでImageNetで80.5%のトップ1精度を達成し、最先端の結果を記録した。

ABSTRACT

Efficient evaluation of a network architecture drawn from a large search space remains a key challenge in Neural Architecture Search (NAS). Vanilla NAS evaluates each architecture by training from scratch, which gives the true performance but is extremely time-consuming. Recently, one-shot NAS substantially reduces the computation cost by training only one supernetwork, a.k.a. supernet, to approximate the performance of every architecture in the search space via weight-sharing. However, the performance estimation can be very inaccurate due to the co-adaption among operations. In this paper, we propose few-shot NAS that uses multiple supernetworks, called sub-supernet, each covering different regions of the search space to alleviate the undesired co-adaption. Compared to one-shot NAS, few-shot NAS improves the accuracy of architecture evaluation with a small increase of evaluation cost. With only up to 7 sub-supernets, few-shot NAS establishes new SoTAs: on ImageNet, it finds models that reach 80.5% top-1 accuracy at 600 MB FLOPS and 77.5% top-1 accuracy at 238 MFLOPS; on CIFAR10, it reaches 98.72% top-1 accuracy without using extra data or transfer learning. In Auto-GAN, few-shot NAS outperforms the previously published results by up to 20%. Extensive experiments show that few-shot NAS significantly improves various one-shot methods, including 4 gradient-based and 6 search-based methods on 3 different tasks in NasBench-201 and NasBench1-shot-1.

研究の動機と目的

  • 1つのスーパーネット内で発生する演算の共適応によって生じるワンショットNASの性能予測の不正確さを是正する。
  • 各アーキテクチャを再び訓練から行う必要がある、従来のNASの計算コストを低減する。
  • スーパーネットが予測する性能と実際のアーキテクチャ性能の相関を高め、探索の効率性と正確性を向上させる。
  • 勾配ベースおよび探索ベースのNAS手法と統合可能なスケーラブルで汎用性の高いフレームワークを開発する。
  • 追加データや事前学習に依存せずに、ImageNet、CIFAR-10、Auto-GANを含む多様なベンチマークで顕著な性能向上を示す。

提案手法

  • 複合エッジに基づく再帰的分割を用いて、アーキテクチャ探索空間全体を互いに排他的な部分領域に分割する。
  • 各領域に対して個別のサブスーパーネットを訓練し、共適応を軽減した局所的なアーキテクチャ性能をモデル化する。
  • トランスファーラーニングの段階的適用:共有されたルートスーパーネットからサブスーパーネットを初期化し、個別にファインチューニングする。
  • サブスーパーネット間で重み共有を適用し、対応するサブスーパーネットを選択して不要な演算をマスクすることで、任意のアーキテクチャを高速に評価可能にする。
  • 階層的分割を活用してモデル容量を維持し、多様なアーキテクチャタイプ間の干渉を低減する。
  • 既存のNASパイプラインに少数ショット評価器を統合し、勾配ベースおよび探索ベースの最適化戦略の両方をサポートする。

実験結果

リサーチクエスチョン

  • RQ11つのスーパーネットと比較して、複数のサブスーパーネットを用いることで共適応が軽減され、性能予測の正確性が向上するか?
  • RQ2性能予測の正確性を著しく向上させるために必要なサブスーパーネットの数はどの程度か?計算コストの増加は最小限に抑えることができるか?
  • RQ3少数ショットNASは、多様なベンチマークやタスクにおいて、既存のワンショットNAS手法の性能を向上させるか?
  • RQ4追加データや事前学習に依存せずに、ImageNet や CIFAR-10 といった標準ベンチマークで、少数ショットNASが最先端のNAS手法を凌駒するか?
  • RQ5パスドロップや角度ベース正則化といった他のスーパーネット改善手法と比較して、少数ショットNASはどのように差をつけるか?

主な発見

  • 少数ショットNASは、わずか7つのサブスーパーネットを用いて、600 MFLOPSの計算コストでImageNetで80.5%のトップ1精度を達成し、効率的なモデルにおける新記録を樹立した。
  • CIFAR-10では、追加データやImageNetの事前学習に依存せず、98.72%のトップ1精度に到達し、先行手法を上回った。
  • Auto-GANでは、FIDスコアを12.42から10.73に改善し、元のワンショット手法と比較して20%の相対的改善を示した。
  • わずか5つのサブスーパーネットで、NasBench-201およびNasBench1-shot-1の4つの勾配ベースおよび6つの探索ベースNAS手法の性能が顕著に向上した。
  • ワンショットNASと比較して、予測された性能と実際の性能のケンダールタイの相関係数が最大0.15向上し、順位付けの正確性が向上した。
  • Penn Treebankでは、探索コストを1.56 GPU日まで低減し、テストパープレキシティ54.89を達成した。これは、DARTsの55.7よりも優れており、時間は半分未満であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。