Skip to main content
QUICK REVIEW

[論文レビュー] Fine-Grained Stochastic Architecture Search

Shraman Ray Chaudhuri, Elad Eban|arXiv (Cornell University)|Jun 17, 2020
Advanced Neural Network Applications参考文献 41被引用数 4
ひとこと要約

FiGSは、ロジスティックシグモイド分布を用いて構造的スパarsity正則化を適用することで、演算子と特徴マップを同時に選択・変更可能な微分可能で細分化されたニューラルアーキテクチャ探索手法を導入し、従来の微分可能NAS手法よりもはるかに広大なアーキテクチャ空間の探索を可能にした。FiGSはImageNetで75.4%(トップ1、260万パラメータ)の最先端の精度を達成し、SSDLiteを用いたCOCOオブジェクト検出ではmAPを+4向上させ、MobileNetV3やMnasNetを上回った。

ABSTRACT

State-of-the-art deep networks are often too large to deploy on mobile devices and embedded systems. Mobile neural architecture search (NAS) methods automate the design of small models but state-of-the-art NAS methods are expensive to run. Differentiable neural architecture search (DNAS) methods reduce the search cost but explore a limited subspace of candidate architectures. In this paper, we introduce Fine-Grained Stochastic Architecture Search (FiGS), a differentiable search method that searches over a much larger set of candidate architectures. FiGS simultaneously selects and modifies operators in the search space by applying a structured sparse regularization penalty based on the Logistic-Sigmoid distribution. We show results across 3 existing search spaces, matching or outperforming the original search algorithms and producing state-of-the-art parameter-efficient models on ImageNet (e.g., 75.4% top-1 with 2.6M params). Using our architectures as backbones for object detection with SSDLite, we achieve significantly higher mAP on COCO (e.g., 25.8 with 3.0M params) than MobileNetV3 and MnasNet.

研究の動機と目的

  • 固定された演算子集合による制限により、従来の微分可能NAS手法がアーキテクチャの狭い部分空間しか探索できないという問題に対処すること。
  • 演算子選択とアーキテクチャ的変更(例:チャネルプルーニング)を同時に探索可能にすることで、より表現力の高い探索を実現すること。
  • さまざまなリソース制約下でもモデル効率性と精度を維持または向上させつつ、探索コストを低減すること。
  • 既存の探索空間を再設計することなく、任意の既存の探索空間に適用可能なプラグアンドプレイな手法を提供すること。
  • モデルサイズとFLOPs/レイテンシの両方においてPareto効率的モデルを発見できることで、モバイルおよびエッジデバイスへの広範な展開を支援すること。

提案手法

  • FiGSは、各出力チャネルまたはニューロンにベルヌーイマスクを割り当て、それをロジスティックシグモイド分布で緩和することで微分可能学習を可能にする確率的マスク機構を導入する。
  • ロジスティックシグモイド分布に基づく構造的スパース正則化ペナルティを適用し、勾配降下法を用いて最適なマスク確率を学習する。
  • マスクは各レイヤーおよび演算の後に適用され、中間特徴量と演算子出力の両方に対して細分化された制御を可能にする。
  • 最終的なアーキテクチャは、推論時に学習済みマスク分布からサンプリングすることでエクスポートされる。
  • 本手法は任意の既存のDNAS探索空間と互換性があり、各レイヤーの後にマスクレイヤーを挿入するだけで実装可能である。
  • FiGSは最小限の精度損失で早期停止を可能にし、全訓練と比較して最大5倍の探索時間短縮を実現しながら高い性能を維持できる。

実験結果

リサーチクエスチョン

  • RQ1最適化中に演算子選択に加えて特徴マップの次元を変更することで、微分可能NAS手法がはるかに広大なアーキテクチャ空間を探索可能かどうか。
  • RQ2One-ShotやMnasNetなどの既存の探索空間に適用した場合、FiGSの性能は元の探索アルゴリズムと比べてどの程度か。
  • RQ3FiGSがモデルサイズとFLOPs/レイテンシの両方においてPareto効率的モデルをどの程度発見できるか。また、これらのトレードオフは異なる探索空間でどのように変化するか。
  • RQ4FiGSはImageNetでスクラッチから訓練した場合、最先端の小型モデルを生成できるか。また、オブジェクト検出などの下流タスクでの性能はいかがなっているか。
  • RQ5FiGSは精度の著しい低下を伴わずに、早期停止により探索コストを顕著に削減できるか。

主な発見

  • FiGSは260万パラメータでImageNetで75.4%のトップ1精度を達成し、パラメータ効率性に優れたモデルにおいて新たな最先端水準を樹立した。
  • SSDLiteを用いたCOCOオブジェクト検出において、FiGS-One-Shot-Largeは302万パラメータで25.8 mAPを達成し、MobileNetV3-Large(21.8 mAP)やMnasNet-A1(23.0 mAP)を上回ったが、パラメータ数は少なくても優れた性能を示した。
  • One-Shot探索空間に適用した場合、FiGSは元の探索アルゴリズムと同等またはそれを上回る性能を示し、さまざまな探索空間にわたる優れた一般化性能を実証した。
  • FiGSは40エポックで早期停止が可能で、全訓練と比較して精度が0.3–0.6%低下するにとどまり、探索時間を2.5倍短縮できた。
  • ResNetモデルに適用した場合、標準的なプルーニングベースラインを上回る性能を示し、構造的アーキテクチャ探索における優れた性能を示した。
  • 本手法は、既存の探索空間に内在するバイアスを明らかにした:一部の探索空間はモデルサイズ効率性を重視し、他の探索空間はFLOPs/レイテンシ効率性を重視しており、探索空間設計のトレードオフをより深く理解する手がかりが得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。