[論文レビュー] S3NAS: Fast NPU-aware Neural Architecture Search Methodology
S3NASは、可変段階深度と混合カーネルサイズブロックを用いてスーパーネット構造を拡張し、遅延制約付きのシングルパスNASとコン pound スケーリングを活用することで、NPUに最適化された高速なニューラルアーキテクチャサーチ手法を提案する。TPUv3上で11.66msの遅延でImageNetのトップ-1精度82.72%を達成し、わずか3時間で実行され、既存のモデルやランダムサーチのベースラインを上回る性能を発揮する。
As the application area of convolutional neural networks (CNN) is growing in embedded devices, it becomes popular to use a hardware CNN accelerator, called neural processing unit (NPU), to achieve higher performance per watt than CPUs or GPUs. Recently, automated neural architecture search (NAS) emerges as the default technique to find a state-of-the-art CNN architecture with higher accuracy than manually-designed architectures for image classification. In this paper, we present a fast NPU-aware NAS methodology, called S3NAS, to find a CNN architecture with higher accuracy than the existing ones under a given latency constraint. It consists of three steps: supernet design, Single-Path NAS for fast architecture exploration, and scaling. To widen the search space of the supernet structure that consists of stages, we allow stages to have a different number of blocks and blocks to have parallel layers of different kernel sizes. For a fast neural architecture search, we apply a modified Single-Path NAS technique to the proposed supernet structure. In this step, we assume a shorter latency constraint than the required to reduce the search space and the search time. The last step is to scale up the network maximally within the latency constraint. For accurate latency estimation, an analytical latency estimator is devised, based on a cycle-level NPU simulator that runs an entire CNN considering the memory access overhead accurately. With the proposed methodology, we are able to find a network in 3 hours using TPUv3, which shows 82.72% top-1 accuracy on ImageNet with 11.66 ms latency. Code are released at https://github.com/cap-lab/S3NAS
研究の動機と目的
- NPUハードウェア上で厳密な遅延制約の下で高精度なCNNアーキテクチャを探索する課題に対処すること。
- ハードウェアに最適化された遅延推定と効率的なサーチ戦略を活用して、NPUプラットフォームにおけるNASのサーチ時間とサーチスペースを削減すること。
- スーパーネットアーキテクチャの拡張とサーチ後のコンパundスケーリングを適用することで、精度-遅延トレードオフを改善すること。
- スーパーネット設計と遅延意識的なサーチが、単なるサーチ戦略よりもはるかに大きな影響を持つことを実証すること。
提案手法
- 段階ごとのブロック数を可変可能とし、異なるカーネルサイズの並列層(混合depthwise畳み込み)を追加することで、スーパーネット構造を拡張し、サーチスペースを広げる。
- ターゲット遅延よりもきつい遅延制約を適用した修正版シングルパスNASを用い、サーチスペースを縮小し、アーキテクチャ探索を高速化する。
- マシンオペレーションカウント(MAC)ではなく、プラットフォーム固有のパフォーマンスを反映するため、サイクルレベルのNPUシミュレータを用いて正確な遅延推定を行う。
- 見つかったベースラインアーキテクチャに対してコンパundスケーリングを適用し、ターゲット遅延予算内に収まるようにより大きなモデルを生成する。
- 精度向上のための後処理強化として、squeeze-and-excitation(SE)ブロックやh-swish活性化関数を導入する。
- 微分可能でワンショットNASアプローチを採用し、1つのスーパーネットを学習するだけで、学習可能な重みを介してアーキテクチャの性能を導出する。
実験結果
リサーチクエスチョン
- RQ1可変段階深度と混合カーネルサイズブロックを用いたスーパーネット構造の拡張は、NPUプラットフォーム向けNASにおける精度-遅延トレードオフを顕著に改善できるか?
- RQ2シングルパスNASサーチにおいて、ターゲットよりきつい遅延制約を適用することで、サーチ時間を短縮しつつも高精度なアーキテクチャを生成できるか?
- RQ3NPUハードウェア上で緩い遅延制約の下でベースラインアーキテクチャをスケーリングする際、直接的サーチと比較してコンパundスケーリングはどの程度効果的か?
- RQ4SEブロックやh-swish活性化関数といったアーキテクチャ的要素は、NPU最適化モデルにおける精度向上にどの程度寄与するか?
主な発見
- S3NASは、ターゲットNPU上で11.66msの遅延でImageNetのトップ-1精度82.72%を達成し、同様の遅延制約下での既存モデルを上回る性能を発揮した。
- 本手法はTPUv3上でわずか3時間でアーキテクチャサーチを完了させ、高い効率性を示した。
- ランダムサーチやランダム選択手法は、競合する性能を示したが、最高で79.19%のトップ-1精度にとどまり、提案手法の優位性を裏付けた。
- SEブロックとh-swish活性化関数の組み合わせは、ReLUオンリーベースラインと比較して約1%の精度向上を達成した。
- 大規模ネットワークの直接的サーチにはTPUv3で10時間かかったが、コンパundスケーリングはより効率的に同等の結果を達成したことが確認され、その有効性が裏付けられた。
- 本研究では、スーパーネットアーキテクチャ設計が最終的な精度に与える影響が、サーチ戦略よりも顕著であることが確認された。提案手法とランダム手法の間には一貫した性能差が観察された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。