[論文レビュー] Progressive DARTS: Bridging the Optimization Gap for NAS in the Wild
本稿では、探索段階におけるスーパーネットの段階的深度増加により、探索と評価の間の最適化ギャップを埋める、新しい微分可能ニューラルアーキテクチャ探索手法であるProgressive DARTS (P-DARTS) を提案する。探索空間の近似と正則化を導入することで、訓練の安定性を向上させ、計算コストを低減した。P-DARTSは、CIFAR-10で2.50%のテスト誤差を達成し、ImageNet、COCO検出、ReIDベンチマークにおいても優れた転移性能を示した。また、単一GPUで7時間の探索時間で実現した。
With the rapid development of neural architecture search (NAS), researchers found powerful network architectures for a wide range of vision tasks. However, it remains unclear if the searched architecture can transfer across different types of tasks as manually designed ones did. This paper puts forward this problem, referred to as NAS in the wild, which explores the possibility of finding the optimal architecture in a proxy dataset and then deploying it to mostly unseen scenarios. We instantiate this setting using a currently popular algorithm named differentiable architecture search (DARTS), which often suffers unsatisfying performance while being transferred across different tasks. We argue that the accuracy drop originates from the formulation that uses a super-network for search but a sub-network for re-training. The different properties of these stages have resulted in a significant optimization gap, and consequently, the architectural parameters "over-fit" the super-network. To alleviate the gap, we present a progressive method that gradually increases the network depth during the search stage, which leads to the Progressive DARTS (P-DARTS) algorithm. With a reduced search cost (7 hours on a single GPU), P-DARTS achieves improved performance on both the proxy dataset (CIFAR10) and a few target problems (ImageNet classification, COCO detection and three ReID benchmarks). Our code is available at \url{https://github.com/chenxin061/pdarts}.
研究の動機と目的
- プロキシデータセットから未学習のタスクへのアーキテクチャの転移において生じる不安定性と性能低下を解消すること、これは「ナス・イン・ザ・ワイルド」として知られる問題である。
- スーパーネットの探索段階とサブネットワークの評価段階の間の最適化ギャップが、転送性の低さの根本的原因であることを特定すること。
- 探索段階において、スーパーネットの性質を最終的なサブネットワークと段階的に一致させるために、深さを段階的に増加させる手法を設計すること。
- 探索空間の近似と正則化技術を導入することで、探索コストを低減し、安定性を向上させること。
- 画像分類、オブジェクト検出、人物再識別といった多様なビジョンタスクにおいて、探索されたアーキテクチャの優れた転送性を実証すること。
提案手法
- 最終的なサブネットワークのインダクティブバイアスとよりよく一致させるために、複数の探索段階にわたりスーパーネットの深さを段階的に増加させる。
- ネットワークの深さが増加するに従い、候補演算の数を減らすことで探索空間の近似を実施し、計算コストを制御する。
- 訓練中にスイップコネクト演算の優位性を軽減し、勾配不安定性を防ぐために、演算レベルのドロップアウトを導入する。
- 最終的なアーキテクチャ選定プロセスに正則化を適用し、スイップコネクトへの過剰な依存を回避し、一般化性能を向上させる。
- 2段階の訓練プロトコルを採用する:まず段階的に深くなるスーパーネットを訓練し、その後、最終的なサブネットワークをターゲットタスク上でプルーニングおよび再訓練する。
- 微分可能アーキテクチャ探索(DARTS)をベースフレームワークとし、進捗的深さスケーリングを可能にするために探索ダイナミクスのみを変更する。
実験結果
リサーチクエスチョン
- RQ1スーパーネットにおける段階的深さスケーリングは、NASにおける探索と評価の間の最適化ギャップを低減できるか?
- RQ2近似による探索空間の複雑さの低減は、計算コストの低減を伴いながら性能を維持または向上できるか?
- RQ3正則化技術は、深すぎるスーパーネットにおけるスイップコネクトの勾配優位性に起因する不安定性を緩和できるか?
- RQ4CIFAR-10などのプロキシデータセットで探索されたアーキテクチャは、ImageNet分類、COCO検出、ReIDといった多様な下流タスクにどの程度一般化できるか?
- RQ5探索データセットとターゲットデータセットのドメインギャップは、探索されたアーキテクチャの転送性にどのように影響するか?
主な発見
- P-DARTSは、340万パラメータでCIFAR-10で2.50%のSOTAテスト誤差を達成し、既存手法を上回った。
- 探索コストは単一GPUで7時間にまで低減され、探索空間の近似を適用した場合、0.3 GPU日まで低下し、ENASを上回る効率性を示した。
- ImageNet分類では、CIFAR-10で探索されたP-DARTS-SSDのバックボーンを用いた場合、COCO検出で29.9%のAPを達成し、より重いバックボーンを搭載したモデルを上回った。
- 512入力サイズのオブジェクト検出では、P-DARTS-SSDは14倍のFLOPs削減で34.1%のAPを達成し、ResNet-101ベースのSSDを上回った。
- ReIDベンチマーク(Market-1501、DukeMTMC-reID、MSMT17)において、CIFAR-10で探索されたP-DARTSバックボーンは、FLOPsと特徴次元数が少ないにもかかわらず、ResNet-50やDARTSバックボーンを上回った。
- 探索とターゲットタスク間のドメインギャップは転送性に影響を与える:CIFAR-10で探索されたアーキテクチャは、画像品質と解像度が類似しているReIDタスクに、より良い一般化性能を示したのに対し、ImageNetで探索されたモデルはReIDタスクで性能を発揮しなかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。