[論文レビュー] Multinomial Distribution Learning for Effective Neural Architecture Search
本論文は、MdeNASと呼ばれるニューラルアーキテクチャ探索(NAS)手法を提案する。この手法は、アーキテクチャ探索を多項分布学習として定式化し、ノード間の演算子を期待性能が高くなるように学習された分布からサンプリングする。性能順位仮説を活用して訓練の早期停止を可能にしたことで、CIFAR-10(2.55%のテスト誤差)およびImageNet(トップ1正答率75.2%)で最先端の精度を達成した。それぞれ4 GPU時間および2 GPU日で実行され、従来手法と比較して計算コストを顕著に削減した。
Architectures obtained by Neural Architecture Search (NAS) have achieved highly competitive performance in various computer vision tasks. However, the prohibitive computation demand of forward-backward propagation in deep neural networks and searching algorithms makes it difficult to apply NAS in practice. In this paper, we propose a Multinomial Distribution Learning for extremely effective NAS,which considers the search space as a joint multinomial distribution, i.e., the operation between two nodes is sampled from this distribution, and the optimal network structure is obtained by the operations with the most likely probability in this distribution. Therefore, NAS can be transformed to a multinomial distribution learning problem, i.e., the distribution is optimized to have a high expectation of the performance. Besides, a hypothesis that the performance ranking is consistent in every training epoch is proposed and demonstrated to further accelerate the learning process. Experiments on CIFAR10 and ImageNet demonstrate the effectiveness of our method. On CIFAR-10, the structure searched by our method achieves 2.55% test error, while being 6.0x (only 4 GPU hours on GTX1080Ti) faster compared with state-of-the-art NAS algorithms. On ImageNet, our model achieves 75.2% top1 accuracy under MobileNet settings (MobileNet V1/V2), while being 1.2x faster with measured GPU latency. Test code with pre-trained models are available at https://github.com/tanglang96/MDENAS
研究の動機と目的
- 各候補アーキテクチャの探索に膨大な訓練・検証を要する従来のNAS手法の高い計算コストを低減すること。
- 性能評価を完全収束まで待つ必要がある従来のNASの非効率性を克服すること。
- 大規模データセット(例:ImageNet)向けに、メモリおよび計算リソースのオーバーヘッドを最小限に抑えた高速かつ高精度なアーキテクチャ探索手法の開発。
- アーキテクチャ間の性能順位が訓練エポックの途中でも一貫しており、早期評価が可能であるという新しい仮説の検証。
- 演算子の多項分布を直接学習することで、効率的に高性能なアーキテクチャを発見する探索アルゴリズムの設計。
提案手法
- ノード間の演算子の集合を、演算子がこの分布からサンプリングされるような連合多項分布としてNASの探索空間を定式化する。
- 初期訓練エポックからの性能フィードバックを用いて、分布パラメータを最適化し、劣悪な演算子から優れた演算子へ確率質量を移動させる。
- 性能順位仮説の導入:任意の訓練エポックでアーキテクチャAがBを上回る場合、完全収束後にも同様の順位を維持する可能性が高く、早期停止が可能となる。
- 勾配ベースの更新を用いて多項分布パラメータを学習し、サンプリングされたアーキテクチャの期待性能を最大化する。
- 学習済み分布を用いて、探索中に完全な訓練を実施せずに最終アーキテクチャを直接サンプリングする。
- CIFAR-10で探索を行い、最良のセルをImageNetに転移し、MobileNetスタイルの制約を設けて公平な比較を実施。
実験結果
リサーチクエスチョン
- RQ1初期訓練エポックからの性能順位が信頼性を持って予測可能であるか。これによりNASにおける早期停止が可能になるか。
- RQ2NASを計算コストを低減する多項分布学習問題として効果的に再定式化できるか。
- RQ3演算子の分布を学習することで、強化学習や微分可能NASに比べて優れたアーキテクチャ発見が可能になるか。
- RQ4CIFAR-10で探索したモデルが、競争力のある性能と低レイテンシを維持したままImageNetに適切に転移可能か。
- RQ5提案手法が、従来手法と比較して顕著に少ないGPU時間およびメモリ消費量でImageNetにおける最先端の精度を達成できるか。
主な発見
- CIFAR-10では、単一のGTX1080Tiで4 GPU時間の計算時間で2.55%のテスト誤差を達成し、最先端のNAS手法と比較して6.0倍の高速化を実現した。
- MobileNet設定下のImageNetでは、75.2%のトップ1正答率を達成し、ProxylessNAS(74.8%)およびShuffleNetV2(72.6%)を上回った。また、測定されたGPUレイテンシでは1.2倍速くなった。
- ImageNetにおける探索時間は2 GPU日まで短縮されたが、ProxylessNASは4 GPU日を要した。さらに、メモリ消費量も顕著に低減された。
- 複数のネットワークおよび複数の訓練エポックにわたり、性能順位仮説が成り立つことが確認され、アーキテクチャ比較における早期評価の有効性が裏付けられた。
- 同じ探索空間内でランダムサーチを実施した場合のベースライン誤差率は3.49%であった。これは、MdeNASの優れた性能が探索空間の質に起因するのではなく、効率的な探索機構によるものであることを示している。
- 本手法により、計算コストが非常に高いことから従来のNAS手法では実行不可能であったImageNet上での直接探索が可能となった。これは、スケーラビリティおよび実用性の優位性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。