[論文レビュー] Understanding and Improving One-shot Neural Architecture Optimization.
本稿では、1ショットニューラルアーキテクチャサーチ手法NAO-V2を提案する。個々のアーキテクチャの更新回数を増やし、モデルサイズに比例してアーキテクチャをサンプリングすることでランクの安定性を向上させるとともに、各イテレーションにおけるスーパーネット学習を分離することで、性能を向上させた。CIFAR-10では2.60%のテスト誤差、モバイル設定下のImageNetでは74.4%のトップ-1精度を達成し、最先端の性能を実現した。
The ability of accurately ranking candidate architectures is the key to the performance of neural architecture search~(NAS). One-shot NAS is proposed to cut the expense but shows inferior performance against conventional NAS and is not adequately stable. We find that the ranking correlation between architectures under one-shot training and the ones under stand-alone training is poor, which misleads the algorithm to discover better architectures. We conjecture that this is owing to the gaps between one-shot training and stand-alone complete training. In this work, we empirically investigate several main factors that lead to the gaps and so weak ranking correlation. We then propose NAO-V2 to alleviate such gaps where we: (1) Increase the average updates for individual architecture to a relatively adequate extent. (2) Encourage more updates for large and complex architectures than small and simple architectures to balance them by sampling architectures in proportion to their model sizes. (3) Make the one-shot training of the supernet independent at each iteration. Comprehensive experiments verify that our proposed method is effective and robust. It leads to a more stable search that all the top architectures perform well enough compared to baseline methods. The final discovered architecture shows significant improvements against baselines with a test error rate of 2.60% on CIFAR-10 and top-1 accuracy of 74.4% on ImageNet under the mobile setting. Code and model checkpoints are publicly available at https://github.com/renqianluo/NAO_pytorch.
研究の動機と目的
- ニューラルアーキテクチャサーチ(NAS)における1ショット学習とスタンドアロン学習の間のランク相関の悪さを是正すること。
- 1ショット学習とフルトレーニングの間の性能ギャップの根本的要因を解明すること。
- アーキテクチャランクの乖離を低減することで、1ショットNASの信頼性と安定性を向上させること。
- 複数のベンチマークで一貫して高性能なアーキテクチャを発見できる手法を開発すること。
- モバイル制約下でのCIFAR-10およびImageNetで最先端の精度を達成すること。
提案手法
- 収束性とランク忠実性を向上させるために、個々のアーキテクチャの平均パラメータ更新回数をより適切な水準に引き上げること。
- モデルサイズに応じてアーキテクチャをサンプリングすることで、更新頻度をアーキテクチャ間でバランスさせ、より大きく複雑なモデルを優遇すること。
- 各イテレーションにおけるスーパーネット学習を分離することで、勾配干渉を防止し、学習の独立性を向上させること。
- 共有重みを用いてすべての候補アーキテクチャを一度のスーパーネットで共同学習するが、制御されたバランスの取れたスケジュールで更新すること。
- 重み共有を用いた微分可能探索空間を採用するが、1ショット学習とフルトレーニングの間の分布シフトを低減するための学習ダイナミクスを変更すること。
- より大きなアーキテクチャがその複雑さに応じて十分な学習更新を受けるように、サンプリングプロセスで再重み付け戦略を適用すること。
実験結果
リサーチクエスチョン
- RQ1NASにおける1ショット学習とスタンドアロン学習の間のランク相関が悪い要因として何が挙げられるか?
- RQ2学習ダイナミクスの違いや更新頻度の差が、アーキテクチャランクの安定性にどのように影響するか?
- RQ3モデルサイズに応じて更新頻度を調整することで、アーキテクチャ性能ランクの一貫性が向上するか?
- RQ4各イテレーションごとにスーパーネット学習を分離することで、勾配干渉が低減され、ランク忠実性が向上するか?
- RQ51ショットNASにおける改善された学習ダイナミクスは、フルトレーニングの性能に達するか、あるいはそれを上回るか、どの程度まで達成できるか?
主な発見
- NAO-V2はCIFAR-10で2.60%のテスト誤差を達成し、先行する1ショットNAS手法を著しく上回った。
- モバイル設定下のImageNetでは、NAO-V2はトップ-1精度74.4%を達成し、優れた一般化性能と効率性を示した。
- 提案手法はアーキテクチャ探索の安定性を高め、全イテレーションで上位アーキテクチャが一貫して高い性能を発揮した。
- 更新頻度の増加とモデルサイズに比例したサンプリングは、フルトレーニングとのランク相関を顕著に向上させた。
- イテレーションごとの学習分離により、勾配干渉が低減され、アーキテクチャ性能推定の信頼性が向上した。
- 本手法は複数のベンチマークおよび設定で堅牢であり、再現可能性を確保するため、公開されたコードとモデルチェックポイントを提供した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。