[論文レビュー] Efficient Neural Architecture Search via Proximal Iterations
NASPは、離散的アーキテクチャを直接最適化するために近接反復を用いる、画期的な微分可能ニューラルアーキテクチャ探索手法を提案する。スーパーネットや2次近似の必要性を排除し、10倍以上の高速化と、DARTSなどの最先端手法を上回る性能を達成する。離散正則化子を用いた制約付き最適化フレームワークにより、アーキテクチャの整合性とモデルの複雑さの制御を維持する。
Neural architecture search (NAS) recently attracts much research attention because of its ability to identify better architectures than handcrafted ones. However, many NAS methods, which optimize the search process in a discrete search space, need many GPU days for convergence. Recently, DARTS, which constructs a differentiable search space and then optimizes it by gradient descent, can obtain high-performance architecture and reduces the search time to several days. However, DARTS is still slow as it updates an ensemble of all operations and keeps only one after convergence. Besides, DARTS can converge to inferior architectures due to the strong correlation among operations. In this paper, we propose a new differentiable Neural Architecture Search method based on Proximal gradient descent (denoted as NASP). Different from DARTS, NASP reformulates the search process as an optimization problem with a constraint that only one operation is allowed to be updated during forward and backward propagation. Since the constraint is hard to deal with, we propose a new algorithm inspired by proximal iterations to solve it. Experiments on various tasks demonstrate that NASP can obtain high-performance architectures with 10 times of speedup on the computational time than DARTS.
研究の動機と目的
- 既存の微分可能NAS手法における高い計算コストと性能の低下を解消すること。特に、高価なスーパーネット学習と2次近似に依存する手法を対象とする。
- ニューラルアーキテクチャ探索を、微分可能であると同時に、訓練中に離散的アーキテクチャ選択を強制する制約付き最適化問題に再定式化すること。
- 各レイヤーあたり1つのアクティブな演算子に直接かつ安定して更新できる近接反復に基づく効率的な最適化アルゴリズムを開発すること。これにより、相関する演算子の更新を回避する。
- モデルの複雑さを制御し、より良い一般化性と探索効率を実現する正則化子を導入すること。
- 特に大規模な探索空間において、DARTSなどの最先端手法を上回る高速な収束性と高い性能を達成すること。
提案手法
- NASPは、演算子に対する離散的制約と、モデルの複雑さに対する正則化子を備えた制約付き最適化問題としてアーキテクチャ探索を定式化する。
- 非凸かつ非滑らかである最適化問題を解くために、近接反復を用い、安定的かつ効率的な更新を可能にする。
- 近接ステップは閉形式解を備えており、1レイヤーあたり1つの演算子のみがアクティブになるように強制する。これにより、2次近似の必要性が排除される。
- スーパーネットの学習を避けるために、選択された演算子のみを直接更新する。これにより、フォワードパスとバックワードパスのコストが著しく削減される。
- アーキテクチャパラメータを[0,1]に維持するためのラージ・アップデート戦略を採用し、標準の近接アルゴリズムよりも収束性と安定性が向上する。
- 訓練中に演算子を分離することで、干渉を低減し、より大きな探索空間における効果的な探索を可能にする。
実験結果
リサーチクエスチョン
- RQ1スーパーネットの学習を回避することで、計算コストを大幅に削減できる微分可能探索手法は、高い性能を達成できるか?
- RQ2近接反復を適切に変更することで、微分可能性と最適化効率を保ちながら、離散的アーキテクチャ選択を効果的に強制できるか?
- RQ3アーキテクチャ探索から2次近似を排除することで、収束が速くなり、性能が向上するか?
- RQ4モデルの複雑さに対する正則化子は、NASにおける一般化性と探索安定性を向上させられるか?
- RQ5DARTSやGDAS、BayesNASといった同時期の手法と比較して、NASPは速度と精度の両面で優れているか?
主な発見
- CIFAR-10では、NASPはDARTS比で10倍以上の高速化を達成し、検証精度70.4%、テスト精度69.5%を記録した。
- ImageNetでは、3300万パラメータでトップ1精度71.2%を達成し、DARTS(71.2%の精度だがパラメータ数がより多い)を上回り、収束が速い。
- NASPのアーキテクチャパラメータ($\bar{\mathbf{A}}$)は、訓練エポックに伴う演算子選択の変化から、DARTSよりも著しく安定していることが示された。
- GDAS や BayesNAS といった同時期の手法と比較して、NASPは探索効率と性能の両面で優れており、PTBでは0.1 GPU日で探索が完了した(GDASは0.4 GPU日)。
- アブレーションスタディの結果、直接的な近接更新では離散的制約のため性能が低下することが判明。また、ラージ・アップデート戦略は性能向上に不可欠であり、標準の近接アルゴリズムを上回った。
- 離散的アーキテクチャ更新がアーキテクチャパラメータの動的安定性を高めるため、2次近似の必要性が完全に排除され、このような近似は不要となった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。