[論文レビュー] Prior-Guided One-shot Neural Architecture Search
本論文は、滑らかな活性化関数、Sandwichルールに基づくバランスの取れたサンプリング戦略、およびFLOPsとZen-Scoreを用いた事前知識に基づく正則化を用いることで、ワンショットニューラルアーキテクチャサーチにおける順位の整合性を向上させるPrior-Guided One-shot NAS (PGONAS)を提案する。本手法は、CVPR 2022 NASチャレンジのスーパーネットトラックで83.20のピアソン積率間隔相関係数を達成し、3位となった。
Neural architecture search methods seek optimal candidates with efficient weight-sharing supernet training. However, recent studies indicate poor ranking consistency about the performance between stand-alone architectures and shared-weight networks. In this paper, we present Prior-Guided One-shot NAS (PGONAS) to strengthen the ranking correlation of supernets. Specifically, we first explore the effect of activation functions and propose a balanced sampling strategy based on the Sandwich Rule to alleviate weight coupling in the supernet. Then, FLOPs and Zen-Score are adopted to guide the training of supernet with ranking correlation loss. Our PGONAS ranks 3rd place in the supernet Track Track of CVPR2022 Second lightweight NAS challenge. Code is available in https://github.com/pprp/CVPR2022-NAS?competition-Track1-3th-solution.
研究の動機と目的
- ワンショットNASにおけるスーパーネットとスタンドアロンアーキテクチャの間の弱い順位相関を是正すること。これは、性能推定の正確性を阻害する要因である。
- より良いサンプリングと活性化関数設計により、重みの結合を軽減することで、スーパーネット学習の安定性を向上させること。
- FLOPs や Zen-Score といったトレーニング不要のメトリクスを損失関数内の事前知識として組み込むことで、性能予測の正確性を向上させること。
- 追加の再訓練や追加の監視信号を必要とせずに、ワンショットNASにおける最先端の順位整合性を達成すること。
提案手法
- チャネル単位の情報伝達と順位予測可能性を向上させるために、ReLUに代えて滑らかな活性化関数(Mish や PReLU)を採用する。
- 最大、中央、最小のアーキテクチャをサンプリングするSandwichルールに基づくバランスの取れたサンプリング戦略を提案する。これにより、学習の安定性が向上し、干渉が低減される。
- スーパーネットの性能順位が、FLOPs や Zen-Score といったトレーニング不要の代理メトリクスと一致するように正則化する順位損失を導入する。
- 正則化の強度を段階的に増加させるために、損失係数のウォームアップスケジューラを採用し、学習の不安定性を回避する。
- アーキテクチャの距離と損失重み付けを用いて、多様なアーキテクチャにわたる一般化性能を向上させるために正則化効果を微調整する。
- 事前知識に基づく正則化とスーパーネット学習を統合することで、スーパーネットの予測と実際のスタンドアロンモデルの精度との相関を強化する。
実験結果
リサーチクエスチョン
- RQ1異なる活性化関数は、重み共有スーパーネットにおけるサブネットの順位整合性にどのように影響するか?
- RQ2Sandwichルールに基づくバランスの取れたサンプリング戦略は、スーパーネット学習の安定性を向上させ、重みの結合を低減できるか?
- RQ3FLOPs や Zen-Score といったトレーニング不要のメトリクスは、スーパーネット学習をガイドし、性能順位を向上させる有効な事前知識として機能するか、その程度はいかほどか?
- RQ4事前知識に基づくスーパーネット学習における正則化損失係数の最適なスケジューリングは何か?
- RQ5FLOPs や Zen-Score といった複数の事前知識を組み合わせることで、単一の事前知識を使用する場合よりも、より優れた順位整合性が得られるか?
主な発見
- Mish活性化関数を用いることで、81.56の最高の順位相関が達成され、ReLU(78.20)を顕著に上回った。これは滑らかな非線形性の利点を示している。
- Sandwichルールに基づくバランスの取れたサンプリング戦略により、ピアソン相関係数が81.63に達し、一様サンプリング(72.49)や段階的縮小戦略(69.03)を上回った。
- 損失係数のウォームアップスケジューラを採用した場合、相関係数が83.20に達し、定数、コサイン、マルチステージスケジューラーを上回った。
- FLOPsを指標とする順位損失は83.20の相関を達成し、Zen-Scoreを指標とする損失(83.00)をわずかに上回った。FLOPsがより効果的な事前知識であると示唆された。
- 事前知識なしでは最高で80.65の相関だったが、FLOPsまたはZen-Scoreの事前知識を導入すると、それぞれ83.20および83.00に向上した。これにより、事前知識に基づく正則化の有効性が裏付けられた。
- 可視化の結果、FLOPsとZen-Scoreは高い相関(95.97)を示したが、分布のパターンは異なり、Zen-Scoreはリボン状の濃度集中を示しており、一般化性能に制限を及える可能性があることが分かった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。