[論文レビュー] StacNAS: Towards Stable and Consistent Differentiable Neural Architecture Search
StacNAS は、演算子の相関関係と最適化の複雑さのギャップを解消することで、微分可能ニューラルアーキテクチャ探索における安定性と一貫性を向上させる階層的探索アルゴリズムを提案する。類似した演算子をクラスタリングし、プロキシと最終トレーニングの複雑さを一致させることで、CIFAR-10、CIFAR-100、ImageNetの5つのセルベース探索空間において、最先端の精度を達成する。
Recently, the efficiency of automatic neural architecture design has been significantly improved by gradient-based search methods such as DARTS. However, recent literature has brought doubt to the generalization ability of DARTS, arguing that DARTS performs poorly when the search space is changed, i.e, when different set of candidate operators are used. Regularization techniques such as early stopping have been proposed to partially solve this problem. In this paper, we tackle this problem from a different perspective by identifying two contributing factors to the collapse of DARTS when the search space changes: (1) the correlation of similar operators incurs unfavorable competition among them and makes their relative importance score unreliable and (2) the optimization complexity gap between the proxy search stage and the final training. Based on these findings, we propose a new hierarchical search algorithm. With its operator clustering and optimization complexity match, the algorithm can consistently find high-performance architecture across various search spaces. For all the five variants of the popular cell-based search spaces, the proposed algorithm always obtains state-of-the-art architecture with best accuracy on the CIFAR-10, CIFAR-100 and ImageNet over other well-established DARTS-alike algorithms. Code is available at this https URL.
研究の動機と目的
- 探索空間の構成が変化する際の DARTS の不安定さと一般化性能の低さを解消すること。
- 相関する演算子が重要度スコアの信頼性を損ない、アーキテクチャ探索を妨げることを特定すること。
- プロキシ探索段階と最終トレーニング段階の間の最適化の複雑さのギャップを軽減すること。
- 多様な探索空間において一貫して高性能なアーキテクチャを発見する手法を開発すること。
- ヒューリスティックな正則化に依存せずに、標準ベンチマークで最先端の性能を達成すること。
提案手法
- 類似した演算子をグループ化する演算子クラスタリングを導入し、探索中に有害な競合を低減する。
- クラスタ化された演算子を探索プロセスにおける原子的単位として扱う階層的探索空間を設計する。
- プロキシタスクの最適化の複雑さを、最終トレーニングのものと一致させるために、層数とチャネル数を調整する。
- 学習可能なアーキテクチャパラメータを備えた微分可能探索フレームワークを用いるが、安定性を向上させるために探索空間構造を変更する。
- 最終モデルの深さと幅と一致させるように、プロキシデータセットでアーキテクチャをトレーニングすることで、分布シフトを低減する。
- 再パrameter化された演算子を用いた勾配ベースの探索により、アーキテクチャのエンドツーエンド最適化を可能にする。
実験結果
リサーチクエスチョン
- RQ1なぜ DARTS は、探索空間が変更され、特に異なる候補演算子が含まれる場合に一般化に失敗するのか?
- RQ2演算子の相関関係は、微分可能 NAS におけるアーキテクチャ重要度スコアの信頼性にどのように影響するのか?
- RQ3プロキシ段階と最終トレーニング段階の間の最適化の複雑さのギャップが、探索性能をどの程度悪化させるのか?
- RQ4階層的演算子クラスタリングは、多様な探索空間において微分可能 NAS の安定性と一貫性を向上させ得るか?
- RQ5プロキシと最終トレーニングの最適化の複雑さを一致させることで、一般化性能が向上し、より高い精度が得られるか?
主な発見
- StacNAS は、CIFAR-10、CIFAR-100、ImageNet におけるすべての5つのセルベース探索空間のバリエーションで、一貫して最先端の精度を達成する。
- 提案手法は、すべてのベンチマークで well-established な DARTS アルゴリズムを上回り、異なる探索空間構成下でも優れた一般化性能を示す。
- 演算子クラスタリングにより、相関する演算子の悪影響が軽減され、より信頼性の高いアーキテクチャ探索のダイナミクスが実現される。
- プロキシと最終トレーニングの最適化の複雑さを一致させることで、探索段階と評価段階の整合性が顕著に向上する。
- 早期停止などのヒューリスティック技術に依存せずに安定した性能を達成しており、本質的な頑健性を示している。
- コードは公開されており、安定した微分可能 NAS における再現性とさらなる研究を可能にする。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。