Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting the Train Loss: an Efficient Performance Estimator for Neural Architecture Search

Binxin Ru, Clare Lyle|arXiv (Cornell University)|May 4, 2021
Machine Learning and Data Classification参考文献 50被引用数 11
ひとこと要約

この論文は、訓練損失の和を用いて最終的なテスト性能を予測する、シンプルで効率的かつモデルフリーな推定器を提案する。周辺尤度と確率的勾配降下法の知見を活用することで、50エポック以内でNAS-Bench201においてテスト精度と0.95のランク相関を達成し、ハイパーパramータチューニングやサーヴィレート学習を必要とせずに、既存のベースラインを上回る性能を発揮する。

ABSTRACT

Reliable yet efficient evaluation of generalisation performance of a proposed architecture is crucial to the success of neural architecture search (NAS). Traditional approaches face a variety of limitations: training each architecture to completion is prohibitively expensive, early stopping estimates may correlate poorly with fully trained performance, and model-based estimators require large training sets. Instead, motivated by recent results linking training speed and generalisation with stochastic gradient descent, we propose to estimate the final test performance based on the sum of training losses. Our estimator is inspired by the marginal likelihood, which is used for Bayesian model selection. Our model-free estimator is simple, efficient, and cheap to implement, and does not require hyperparameter-tuning or surrogate training before deployment. We demonstrate empirically that our estimator consistently outperforms other baselines under various settings and can achieve a rank correlation of 0.95 with final test accuracy on the NAS-Bench201 dataset within 50 epochs.

研究の動機と目的

  • ニューラルアーキテクチャサーチ(NAS)における各アーキテクチャを収束まで訓練する高コストな問題に対処すること。
  • 最終一般化性能との相関が低い早期停止による推定の課題を克服すること。
  • ハイパーパramータチューニングやサーヴィレート学習を必要としない、モデルフリーで効率的な推定器を開発すること。
  • 訓練損失のダイナミクスを活用することで、アーキテクチャ評価の信頼性と速度を向上させること。

提案手法

  • 本手法は、エポックごとの訓練損失の和を一般化性能の代理指標として用いる。
  • ベイジアンモデル選択における周辺尤度にインspiredされ、訓練損失とモデル品質の関連を確立する。
  • 推定器はモデルフリーであり、別個のサーヴィレートモデルの学習やハイパーパramータのチューニングを必要としない。
  • 各アーキテクチャの訓練軌道に直接作用するため、軽量かつスケーラブルである。
  • 確率的勾配降下法下での訓練速度と一般化性能の間の経験的相関を活用する。
  • 完全な訓練を経ずに損失値を集約することで、早期の性能推定を可能にする。

実験結果

リサーチクエスチョン

  • RQ1訓練損失の和は、ニューラルアーキテクチャサーチにおける最終テスト精度の信頼できる代理指標として機能するか?
  • RQ2この損失ベースの推定器は、早期停止法やモデルベースのサーヴィレート手法と比較して、最終性能との相関においてどの程度優れているか?
  • RQ350エポック以内という最小限の訓練時間で、この推定器はどの程度高い精度を達成できるか?
  • RQ4この手法は、NAS-Bench201のような異なる探索空間やデータセットに一般化可能か?
  • RQ5ハイパーパramータチューニングや事前サーヴィレート学習なしに、この推定器をデプロイ可能か?

主な発見

  • 提案手法は、NAS-Bench201データセットにおいてわずか50エポックで最終テスト精度と0.95のランク相関を達成した。
  • さまざまな探索設定において、早期停止法やモデルベース推定器を含むベースライン手法を一貫して上回った。
  • 本手法は計算的に効率的であり、ハイパーパramータチューニングやサーヴィレートモデルの学習を必要としない。
  • 少数のエポックで学習した場合でも、推定器は頑健で効果的であり、優れた早期予測能力を示した。
  • 本手法はモデルフリーであり、アーキテクチャや訓練プロトコルの変更なしに、既存のNASパイプラインに容易に統合可能である。
  • 結果は、累積訓練損失と最終一般化性能との間の強い経験的相関を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。