[論文レビュー] Cyclic Differentiable Architecture Search
本稿では、自己内省的 distillation を通じて探索ネットワークと評価ネットワークを統一する、循環的微分可能アーキテクチャ探索フレームワーク CDARTS を提案する。交互学習により共同最適化が可能となり、より深い評価ネットワークからのフィードバックを繰り返し用いてアーキテクチャ重みを改善することで、CIFAR-10 で 97.52% のトップ1正答率、ImageNet で 76.3% を達成し、SOTA の性能を実現。探索コストは DARTS と同等に低く保たれている。
Differentiable ARchiTecture Search, i.e., DARTS, has drawn great attention in neural architecture search. It tries to find the optimal architecture in a shallow search network and then measures its performance in a deep evaluation network. The independent optimization of the search and evaluation networks, however, leaves room for potential improvement by allowing interaction between the two networks. To address the problematic optimization issue, we propose new joint optimization objectives and a novel Cyclic Differentiable ARchiTecture Search framework, dubbed CDARTS. Considering the structure difference, CDARTS builds a cyclic feedback mechanism between the search and evaluation networks with introspective distillation. First, the search network generates an initial architecture for evaluation, and the weights of the evaluation network are optimized. Second, the architecture weights in the search network are further optimized by the label supervision in classification, as well as the regularization from the evaluation network through feature distillation. Repeating the above cycle results in joint optimization of the search and evaluation networks and thus enables the evolution of the architecture to fit the final evaluation network. The experiments and analysis on CIFAR, ImageNet and NAS-Bench-201 demonstrate the effectiveness of the proposed approach over the state-of-the-art ones. Specifically, in the DARTS search space, we achieve 97.52% top-1 accuracy on CIFAR10 and 76.3% top-1 accuracy on ImageNet. In the chain-structured search space, we achieve 78.2% top-1 accuracy on ImageNet, which is 1.1% higher than EfficientNet-B0. Our code and models are publicly available at https://github.com/microsoft/Cream.
研究の動機と目的
- DARTS における探索ネットワークと評価ネットワークの性能ギャップを解消し、独立した最適化がアーキテクチャの汎化性能を制限するのを防ぐ。
- 最適化が不適切な場合に発生する DARTS の問題、すなわちスキップ接続に支配されるアーキテクチャに陥る問題を克服する。
- 探索ネットワークと評価ネットワークの共同最適化を可能にし、最終評価モデルへのアーキテクチャの転送性を向上させる。
- 外部の教師モデルに依存せず、評価ネットワーク自体からの自己内省的 distillation を用いて、統一されたフレームワークを構築する。
- 循環的フィードバックによって性能を向上させつつ、探索コストを低く保つ。
提案手法
- 探索ネットワークがアーキテクチャを生成し、評価ネットワークの性能がフィードバックを提供する、循環的なトレーニングループを導入する。
- 外部教師モデルを用いずに、より深い評価ネットワークから探索ネットワークへ知識を転移するための自己内省的 distillation を使用する。
- ラベルの監督信号と、評価ネットワークからの特徴レベルの正則化を併用して、探索ネットワークのアーキテクチャ重みを最適化する。
- 計算コストを低く保つために、DARTS と同様に 1 階微分近似を適用する。
- 探索ネットワークと評価ネットワークを交互にトレーニングすることで、アーキテクチャ探索を最終評価の目的に一致させる統一されたフレームワークを構築する。
- 重み共有と軽量な評価ネットワークを活用し、循環的最適化プロセス中のトレーニングオーバーヘッドを低減する。
実験結果
リサーチクエスチョン
- RQ1探索ネットワークと評価ネットワークの循環的共同最適化は、独立した探索と評価を上回るアーキテクチャの汎化性能を実現できるか?
- RQ2外部教師モデルを一切使用せず、評価ネットワークからの自己内省的 distillation がアーキテクチャ探索の性能向上に寄与するか?
- RQ3CDARTS は、DARTS でスレッド接続に支配されるアーキテクチャに陥る「劣化問題(degeneracy problem)」を緩和できるか?
- RQ4循環的フィードバック機構は、標準ベンチマークにおける最終アーキテクチャの正答率と頑健性にどのように影響を与えるか?
- RQ5CDARTS の計算コストは標準的な DARTS と比べてどの程度か?また、高速な探索速度を維持できるか?
主な発見
- CIFAR-10 において CDARTS は 97.52% のトップ1正答率を達成し、DARTS の探索空間内での既存 SOTA 手法を上回った。
- ImageNet では 76.3% のトップ1正答率を達成し、大規模データセットでも強力な転送性と性能を示した。
- チェーン構造の探索空間において、CDARTS は ImageNet で 78.2% のトップ1正答率を達成し、EfficientNet-B0 を 1.1 パcent 上回った。
- Cityscapes では推論テクニックを一切使用せず 78.1% の mIoU を達成し、FasterSeg より 5.0 パーセントポイント、SegFormer より 1.9 パーセントポイント上回ったが、FLOPs は少なく抑えられた。
- ADE20K ではたった 5.9G FLOPs で 40.4% の mIoU を達成し、SegFormer を 3.0 パーセントポイント上回ったが、モデルははるかに小型であった。
- CDARTS の計算コストは DARTS の約 1.3 倍であり、評価ネットワークの追加コストは探索ネットワークの約 1/3 から 1/2 にとどまり、8 グラフィックス・ユニットを用いて ImageNet で約 5 時間で高速な探索が可能となった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。