[論文レビュー] Balanced One-shot Neural Architecture Optimization
本稿では、スーパーネット学習中にアーキテクチャをモデルサイズに比例してサンプリングすることにより、サイズの異なるアーキテクチャ間での最適化をバランスさせる、バランス型ワンショットニューラルアーキテクチャ最適化(Balanced NAO)を提案する。これにより、ワンショット学習とフルトレーニングの間の順位相関が著しく向上し、より正確で安定したアーキテクチャ探索が可能になる。CIFAR-10では2.60%のテスト誤差、モバイル設定下のImageNetでは74.4%のトップ1精度を達成した。
The ability to rank candidate architectures is the key to the performance of neural architecture search~(NAS). One-shot NAS is proposed to reduce the expense but shows inferior performance against conventional NAS and is not adequately stable. We investigate into this and find that the ranking correlation between architectures under one-shot training and the ones under stand-alone full training is poor, which misleads the algorithm to discover better architectures. Further, we show that the training of architectures of different sizes under the current one-shot method is imbalanced, which causes the evaluated performances of the architectures to be less predictable of their ground-truth performances and affects the ranking correlation heavily. Consequently, we propose Balanced NAO where we introduce balanced training of the supernet during the search procedure to encourage more updates for large architectures than small architectures by sampling architectures in proportion to their model sizes. Comprehensive experiments verify that our proposed method is effective and robust which leads to a more stable search. The final discovered architecture shows significant improvements against baselines with a test error rate of 2.60\% on CIFAR-10 and top-1 accuracy of 74.4% on ImageNet under the mobile setting. Code and model checkpoints will be publicly available. The code is available at github.com/renqianluo/NAO_pytorch.
研究の動機と目的
- 従来のNASと比較して、既存のワンショットNAS手法の性能の低さと不安定性を解消すること。
- ワンショットNASがワンショット評価とフルトレーニング評価の間で順位相関を維持できない理由を解明すること。
- 小さなアーキテクチャが大きなアーキテクチャに対して過剰に最適化されるという、トレーニングのアンバランスさが順位の忠実性を損なうことを同定すること。
- アーキテクチャのモデルサイズに比例してサンプリングすることで、順位相関と探索の安定性を向上させるバランス型トレーニング戦略を提案すること。
- バランス型サンプリングが、CIFAR-10 や ImageNet といったベンチマークデータセットにおける一般化性能と性能を向上させることを実証すること。
提案手法
- スーパーネット学習中に、アーキテクチャの選択確率をそのモデルサイズに比例させる比例サンプリングを導入する。
- 大きなアーキテクチャがそのサイズに応じてより多くのトレーニング更新を受けるように、ワンショットNASのトレーニング手順を変更し、最適化のアンバランスを軽減する。
- すべての候補アーキテクチャに共通の重み共有を採用する、標準的なスーパーネットアーキテクチャを維持する。
- サンプリング戦略を除き、ベースラインのワンショットNAS手法と同一の探索および評価プロトコルを用いる。
- 固定ステップ数でスーパーネットを学習し、ワンショット性能を用いて候補アーキテクチャを順位付け・選択する。
- 最終的に発見されたアーキテクチャを、DARTSと同一のトレーニングプロトコルでImageNetに移行して公平な比較を実施する。
実験結果
リサーチクエスチョン
- RQ1なぜ既存のワンショットNAS手法はトレーニングコストを削減したにもかかわらず、高性能なアーキテクチャを発見できないのか?
- RQ2異なるサイズのアーキテクチャ間での最適化のアンバランスさが、ワンショットとフルトレーニング評価の間の順位相関をどの程度悪化させるのか?
- RQ3モデルサイズに比例したサンプリングが、ワンショットNASにおける順位相関と探索の安定性を向上させうるか?
- RQ4バランス型サンプリングで発見されたアーキテクチャの性能は、従来のNASおよび他のワンショットNAS手法と比較して、CIFAR-10およびImageNetでどの程度の水準にあるか?
- RQ5提案手法は、ImageNetのような大規模データセットに移行した際にも強力な一般化性能を維持できるか?
主な発見
- 比例サンプリングでは、ワンショットとフルトレーニングの性能間の順位相関が著しく向上し、一対比較の正確性が均一サンプリングと比較して10ポイント以上向上した。
- 提案されたBalanced NAOは、CIFAR-10で2.60%のテスト誤差を達成し、ベースラインのワンショットNAS手法を上回り、従来のNAS手法と同等の性能を示した。
- モバイル設定下のImageNetでは、発見されたアーキテクチャがトップ1精度74.4%を達成し、人為設計モデルを上回り、最先端のNAS手法と同等の水準に達した。
- 本手法は優れた安定性を示しており、5つの独立して探索されたアーキテクチャの平均テスト誤差は2.67%にとどまり、分散が小さく、一貫性のある性能を示した。
- 性能向上の要因はバランス型最適化に起因し、比例サンプリングにより小さなアーキテクチャの過学習が軽減され、ワンショット評価の代表性が向上した。
- 従来のNASに比べて著しく低い探索コストで競争力のある結果を達成しており、他のワンショットNASアプローチと同等またはそれを上回る性能を発揮した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。