[論文レビュー] Multi-objective Architecture Search for CNNs.
本稿では、CNNにおける効率的で多目的なニューラルアーキテクチャサーチのためのNASHおよびPareto-NASHを提案する。NASHはネットワークモーフィズムと攻撃的な学習率スケジューリングを用いて訓練コストを低減し、CIFAR10で3日間で4%未満の誤差を達成する。Pareto-NASHは、正確性とパrameter数の両面でパレート最適なアーキテクチャを一度の実行で発見可能にし、400万パラメータで3.5%の誤差、または100万パラメータ未満で4.6%の誤差を達成するモデルを56GPU日で発見する。
Architecture search aims at automatically finding neural architectures that are competitive with architectures designed by human experts. While recent approaches have come close to matching the predictive performance of manually designed architectures for image recognition, these approaches are problematic under constrained resources for two reasons: first, the architecture search itself requires vast computational resources for most proposed methods. Secondly, the found neural architectures are solely optimized for high predictive performance without penalizing excessive resource consumption. We address the first shortcoming by proposing NASH, an architecture search which considerable reduces the computational resources required for training novel architectures by applying network morphisms and aggressive learning rate schedules. On CIFAR10, NASH finds architectures with errors below 4% in only 3 days. We address the second shortcoming by proposing Pareto-NASH, a method for multi-objective architecture search that allows approximating the Pareto-front of architectures under multiple objective, such as predictive performance and number of parameters, in a single run of the method. Within 56 GPU days of architecture search, Pareto-NASH finds a model with 4M parameters and test error of 3.5%, as well as a model with less than 1M parameters and test error of 4.6%.
研究の動機と目的
- CNNのニューラルアーキテクチャサーチ(NAS)における高い計算コストを低減すること。
- 精度とモデルサイズの両方を最適化することで、NASにおける効率性の欠如を是正すること。
- 予測性能とパrameter数の両方をバランスさせるアーキテクチャを同時に発見できること。
- リソース制約下でもスケーラブルに動作する手法を開発すること。
提案手法
- NASHは、親ネットワークから効率的に新しいアーキテクチャを生成・訓練するため、ネットワークモーフィズムを用いる。
- アーキテクチャサーチ中の収束を加速するために、攻撃的な学習率スケジュールを用いる。
- Pareto-NASHは、正確性とパrameter数の両面で多目的最適化を可能にするために、NASHを拡張し、正確性とパrameter数の両面で多様なアーキテクチャを維持する。
- 性能とモデルサイズのトレードオフを近似するため、一度のサーチランでパレートフロントを近似する。
- 微分可能サーチ戦略を用いて、複数の目的に基づきアーキテクチャを評価・更新する。
- モーフィズムに基づくパラメータ共有により、アーキテクチャ間で特徴量と勾配を再利用することで、サーチ効率を向上させる。
実験結果
リサーチクエスチョン
- RQ1性能を損なわせることなく、アーキテクチャサーチを著しく効率化できるか?
- RQ2一度のサーチランで、正確性とモデルサイズのトレードオフを表す多様なアーキテクチャを特定できるか?
- RQ3NASにおいて、競争力のある正確性を維持しつつ、計算コストをどの程度低減できるか?
- RQ4攻撃的な学習率スケジューリングは、アーキテクチャサーチにおける収束速度を向上させられるか?
- RQ5多目的NASアプローチを用いることで、モデルの正確性とパrameter数の間に達成可能なトレードオフは何か?
主な発見
- NASHはCIFAR10で3日間のトレーニングで4%未満のテスト誤差を達成し、サーチ時間の大幅な短縮を実現した。
- Pareto-NASHは、56GPU日で400万パラメータで3.5%のテスト誤差を達成するモデルを発見した。
- Pareto-NASHを用いて、100万パラメータ未満で4.6%のテスト誤差を達成する小型モデルも発見された。
- 従来のNASアプローチと比較して、顕著に低い計算コストで競争力のある性能を達成した。
- パレートフロントの近似には、複数の高性能で効率的なアーキテクチャが含まれており、効果的なトレードオフの発見が示された。
- ネットワークモーフィズムと攻撃的な学習率スケジューリングの活用により、サーチ中の収束が高速化され、リソース使用量も低減された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。