Skip to main content
QUICK REVIEW

[論文レビュー] Single-Path NAS: Device-Aware Efficient ConvNet Design

Dimitrios Stamoulis, Ruizhou Ding|arXiv (Cornell University)|May 10, 2019
Advanced Neural Network Applications参考文献 24被引用数 12
ひとこと要約

Single-Path NAS は、各層ごとに過剰にパラメータ化された 'スーパーKernel' からの重み部分集合の選択としてアーキテクチャ探索を定式化する、新しい微分可能NAS手法を提案する。これにより、複数パスのスーパーネット学習の必要がなくなり、NASの探索コストをたった8エポック(TPUv2で3.75時間)にまで低減した。Pixel 1で79.48msの遅延を達成し、ImageNetで74.96%のトップ1精度を記録し、同程度の遅延制約下でのハードウェア効率の良いConvNetsにおいて、新たな最先端の性能を達成した。

ABSTRACT

Can we automatically design a Convolutional Network (ConvNet) with the highest image classification accuracy under the latency constraint of a mobile device? Neural Architecture Search (NAS) for ConvNet design is a challenging problem due to the combinatorially large design space and search time (at least 200 GPU-hours). To alleviate this complexity, we propose Single-Path NAS, a novel differentiable NAS method for designing device-efficient ConvNets in less than 4 hours. 1. Novel NAS formulation: our method introduces a single-path, over-parameterized ConvNet to encode all architectural decisions with shared convolutional kernel parameters. 2. NAS efficiency: Our method decreases the NAS search cost down to 8 epochs (30 TPU-hours), i.e., up to 5,000x faster compared to prior work. 3. On-device image classification: Single-Path NAS achieves 74.96% top-1 accuracy on ImageNet with 79ms inference latency on a Pixel 1 phone, which is state-of-the-art accuracy compared to NAS methods with similar latency (<80ms).

研究の動機と目的

  • モバイル最適化ConvNetsのためのニューラルアーキテクチャ探索(NAS)における、かつてないほど高い計算コスト(従来は200時間以上のGPU時間が必要)を低減すること。
  • Pixel 1などのモバイルプラットフォームにおけるデバイス内推論遅延を直接最適化できる、ハードウェアに配慮したNAS手法の設計。
  • 複数パスのスーパーネットアーキテクチャの非効率性を解消するため、NAS探索空間を1パスの重み部分集合選択問題として再考すること。
  • モバイルデバイス上で厳密な遅延制約(≤80ms)の下でImageNetにおける画像分類精度を最先端水準に達するよう最適化すること。
  • 複雑な複数パストレーニングに代わって、コンactな微分可能スーパーKernel定式化を導入することで、高速かつ再現可能なNASを実現すること。

提案手法

  • 各ConvNet層ごとに、すべての候補演算(例:3×3および5×5畳み込み)を共有重みの部分集合としてエンコードする、1パスの過剰にパラメータ化された 'スーパーKernel' を導入する。
  • アーキテクチャ意思決定は、シグモイド関数によるインジケータ関数の微分可能緩和を用いて、スーパーKernel重みのどの部分集合を有効化するかの選択として定式化する。
  • 探索空間は、各層が変動するカーネルサイズと拡張比を持つモバイルインバーテッドボトルネック(MBConv)を特徴とする、MobileNetV2に類似したマクロアーキテクチャに基づく。
  • デバイスに配慮した実行時モデルを、デバイス内プロファイリングを用いて訓練し、カーネルサイズと拡張比の意思決定を学習されたしきい値を介して、各層の遅延を予測する。
  • NASの目的関数は、精度と遅延の両方を組み合わせており、遅延モデルをトレーニング中に微分可能制約として用い、アーキテクチャ探索をガイドする。
  • 最終的なアーキテクチャは、学習済みスーパーKernelから非活性な重み部分集合をプルーニングすることで得られ、コンパクトで効率的なモデルとなる。

実験結果

リサーチクエスチョン

  • RQ1モバイルConvNetsのNASを4時間未満に加速させつつ、精度を維持または向上させることは可能か?
  • RQ2複数パスのスーパーネットトレーニングを置き換える1パスのスーパーKernelベースの定式化は、メモリおよび計算のオーバーヘッドを低減できるか?
  • RQ3微分可能で重み部分集合選択に基づくアプローチは、厳密なデバイス内遅延制約下でも最先端の精度を達成できるか?
  • RQ4MnasNet、ProxylessNAS、FBNetなどの先行NAS手法と比較して、提案手法の探索コストとパフォーマンスはどのように異なるか?
  • RQ5デバイス固有の遅延モデルは、正確に訓練され、NASの目的関数に統合可能で、効率的なアーキテクチャ探索をガイドできるか?

主な発見

  • Single-Path NAS は、Pixel 1で同程度のデバイス内遅延(≤80ms)を満たすNAS手法の中で、ImageNetで74.96%のトップ1精度を達成し、新たな最先端の性能を記録した。
  • この手法により、NASの探索コストがたった8エポック(TPUv2で3.75時間)にまで低減され、MnasNetと比較して5,000倍、ProxylessNASと比較して25倍の高速化が達成された。
  • 遅延予測モデルは、平均誤差1.76%(RMS誤差1.32ms)の高い精度を達成し、探索中に正確で微分可能な遅延制約を可能にした。
  • 同程度の遅延条件下で、MobileNetV2より+1.37%、MnasNetより+0.35%、FBNet-Bより+0.86%のトップ1精度で優れている。
  • FBNetより11倍、ProxylessNASより25倍高速であり、合計で30 TPU時間の探索コストに留め、効率的でハードウェアに配慮したモデル設計の障壁を顕著に低減した。
  • 本手法は完全にオープンソース化されており、完全なドキュメンテーションを備え、将来的に電力、メモリ、通信などの他のハードウェア制約への応用が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。