[論文レビュー] BS-NAS: Broadening-and-Shrinking One-Shot NAS with Searchable Numbers of Channels
本稿では、スプリングブロックを介してスーパーネット学習中に可 searchable なチャネル数を実現する新規 One-Shot Neural Architecture Search フレームワーク BS-NAS を提案する。その後、性能が低い演算子を段階的に削除する戦略を採用することで、性能が著しく向上した。本手法は、探索空間の表現を向上させるとともにランク相関を強化し、ImageNet でトップ-1 精度 76.3% の最先端性能を達成した。
One-Shot methods have evolved into one of the most popular methods in Neural Architecture Search (NAS) due to weight sharing and single training of a supernet. However, existing methods generally suffer from two issues: predetermined number of channels in each layer which is suboptimal; and model averaging effects and poor ranking correlation caused by weight coupling and continuously expanding search space. To explicitly address these issues, in this paper, a Broadening-and-Shrinking One-Shot NAS (BS-NAS) framework is proposed, in which `broadening' refers to broadening the search space with a spring block enabling search for numbers of channels during training of the supernet; while `shrinking' refers to a novel shrinking strategy gradually turning off those underperforming operations. The above innovations broaden the search space for wider representation and then shrink it by gradually removing underperforming operations, followed by an evolutionary algorithm to efficiently search for the optimal architecture. Extensive experiments on ImageNet illustrate the effectiveness of the proposed BS-NAS as well as the state-of-the-art performance.
研究の動機と目的
- 既存の One-Shot NAS 手法で固定かつ手動で定義されたチャネル数による性能の劣化を是正すること。
- スーパーネット学習における重み結合と探索空間の拡大により生じるモデル平均化効果と劣化したランク相関を軽減すること。
- スーパーネット学習中に動的チャネル数探索を可能にすることで、探索空間の表現を豊かにすること。
- 新規の縮小戦略により、段階的に性能が低い演算子を除去することで、One-Shot アーキテクチャランクの信頼性を向上させること。
- 広げ・縮小・進化的探索を統合したエンドツーエンドフレームワークにより、ImageNet で最先端の性能を達成すること。
提案手法
- 深度分離型とポイントワイド型畳み込みを分離するスプリングブロックを導入し、ネットワークの安定性を損なわず、柔軟な出力チャネル数を可能にする。
- 出力チャネル数を学習可能で微分可能なハイパーパrameterとして扱い、スーパーネットがトレーニング中に最適なチャネル数を探索できるようにする。
- 訓練ステップごとに検証精度に基づいて層ごとに演算子をソートし、性能が低いものを段階的に削除するステップワイズ縮小戦略を提案する。
- 縮小された探索空間上で進化的アルゴリズムを適用し、再トレーニングを最小限に抑えて最適なアーキテクチャを素早く同定する。
- 一貫して高い性能を示す演算子のみが縮小段階を通過するプログレッシブな除去プロセスを採用し、冗長性を低減するとともにランクの正確性を向上させる。
- モジュラで拡張可能なコンponents を設計することで、MobileNetV2 に限らず多様なニューラルアーキテクチャと互換性を保つ。
実験結果
リサーチクエスチョン
- RQ1スーパーネット学習中にチャネル数の動的探索が、One-Shot NAS における探索空間の表現能力を向上させ得るか?
- RQ2段階的かつ層ごとの縮小戦略は、モデル平均化効果を効果的に低減し、One-Shot モデルとスタンドアロンモデルのランク相関を向上させるか?
- RQ3固定チャネル数の One-Shot メソッドと比較して、提案フレームワークは探索効率と最終的なアーキテクチャ性能をどの程度向上させるか?
- RQ4スプリングブロックは、異なるアーキテクチャにわたって柔軟なチャネル数適応を可能にしつつ、性能の安定性を維持できるか?
- RQ5広げと縮小戦略の組み合わせが、ImageNet における探索モデルの最終的精度と頑健性にどのような影響を与えるか?
主な発見
- 提案された BS-NAS フレームワークは、ImageNet データセットでトップ-1 精度 76.3% の最先端性能を達成し、既存の One-Shot NAS 手法を上回った。
- ステップワイズ縮小戦略は、One-Shot モデルの精度分布を顕著に改善し、最終的な縮小済み探索空間から得られるモデルは、縮小なしでトレーニングしたモデルでさえも上回った(たとえエポック数が少ない状態でも)。
- 最終的な縮小済み探索空間(残存演算子が 10%)からスクラッチでトレーニングしたモデルは、トップ-1 精度 75.1% を達成した。これは残存演算子の質の高さを示している。
- One-Shot モデルのランクとそれに対応するスタンドアロンモデルの精度との相関が顕著に向上した。これは重み結合の影響が軽減され、予測の正確性が向上したことを示している。
- One-Shot モデルとスタンドアロンモデルの精度差は約 14% であり、これはチャネル数探索の複雑性の増加に起因すると考えられ、探索空間の縮小が収束性とランク精度の向上に不可欠であることを示している。
- スプリングブロックは、トレーニングの安定性を損なわず、効果的なチャネル数探索を可能にした。また、本フレームワークは MobileNetV2 を超えて他のニューラルアーキテクチャへも拡張可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。