Skip to main content
QUICK REVIEW

[論文レビュー] Inductive Transfer for Neural Architecture Optimization

Martin Wistuba, Tejaswini Pedapati|arXiv (Cornell University)|Mar 8, 2019
Neural Networks and Applications参考文献 41被引用数 6
ひとこと要約

本論文は、ニューラルアーキテクチャサーチ(NAS)を高速化する2つのインダクティブな転移学習ベースの手法を提案する:先行データセットからの転送知識を用いて高速なアーキテクチャ選択を実現するIT-NAS、および複数のデータセット間で知識を転送することで学習曲線の外挿を向上させるIT-LCE。本手法はCIFAR-10およびCIFAR-100で8時間未塔の探索時間で最先端の性能を達成し、早期停止により16倍の高速化と約350 GPU時間の削減を実現した。

ABSTRACT

The recent advent of automated neural network architecture search led to several methods that outperform state-of-the-art human-designed architectures. However, these approaches are computationally expensive, in extreme cases consuming GPU years. We propose two novel methods which aim to expedite this optimization problem by transferring knowledge acquired from previous tasks to new ones. First, we propose a novel neural architecture selection method which employs this knowledge to identify strong and weak characteristics of neural architectures across datasets. Thus, these characteristics do not need to be rediscovered in every search, a strong weakness of current state-of-the-art searches. Second, we propose a method for learning curve extrapolation to determine if a training process can be terminated early. In contrast to existing work, we propose to learn from learning curves of architectures trained on other datasets to improve the prediction accuracy for novel datasets. On five different image classification benchmarks, we empirically demonstrate that both of our orthogonal contributions independently lead to an acceleration, without any significant loss in accuracy.

研究の動機と目的

  • 現在数千時間にのぼるGPU時間を要するニューラルアーキテクチャサーチの計算コストを低減すること。
  • 新しいデータセットごとに再びアーキテクチャ的特徴を再発見するという、従来手法の非効率性に対処すること。
  • 過去のデータセットからの知識転送により、学習曲線の外挿精度を向上させ、大量のトレーニングデータに依存するのを減らすこと。
  • メタ知識の転送と早期停止を組み合わせることで、より高速かつ効率的なアーキテクチャサーチを可能にすること。
  • インダクティブな転移学習が、性能を犠牲にすることなく自動化されたニューラルアーキテクチャ最適化を顕著に高速化できることを示すこと。

提案手法

  • アーキテクチャのトポロジーと学習曲線などの事前メタ知識から潜在表現を抽出する予測的ベイジアンモデルを用いて、ニューラルアーキテクチャ選択を転送学習問題として定式化する。
  • 学習された潜在表現を用いて、新しいデータセットにおけるアーキテクチャ選択をガイドし、重複する探索を回避する。
  • 複数のソースデータセットの学習曲線を活用して、新しいデータセットにおける性能を最小限の観測エポック数で予測する、ベイジアン転送学習に基づく学習曲線外挿法(IT-LCE)を提案する。
  • 外挿された性能に基づいて、ネットワークのトレーニングを早期に終了するかどうかを予測することで、トレーニング時間を短縮する。
  • 早期停止の判断を避けるために、固定されたアーキテクチャ評価順序を採用し、最小30エポックまではトレーニングを継続する制約を設ける。
  • アーキテクチャ選択のための知識転送と、早期停止のための転送強化型学習曲線予測を統合した包括的なフレームワーク(IT-NAS)を構築する。

実験結果

リサーチクエスチョン

  • RQ1インダクティブな転移学習を用いて、過去のデータセットからの知識を再利用することで、ニューラルアーキテクチャサーチを高速化できるか?
  • RQ2同じデータセットからのデータに依存するのではなく、複数のデータセット間で知識を転送することで、学習曲線の外挿を改善できるか?
  • RQ3アーキテクチャ選択におけるインダクティブな転移学習と、転送強化型学習曲線予測を組み合わせることで、最小限の精度損失で収束を高速化できるか?
  • RQ4転送された学習曲線に基づく早期停止は、最終モデルの性能を劣化させることなく、トレーニング時間を顕著に短縮できるか?
  • RQ5提案手法は、精度と探索効率の面で、最先端のNAS手法と同等か、それ以上に優れているか?

主な発見

  • 提案されたIT-NAS手法は、CIFAR-10およびCIFAR-100で8時間未塔の探索時間で最先端の精度を達成し、ENASや他のベースラインを上回った。
  • IT-LCEは、学習曲線の外挿にインダクティブな転移学習を用いる最初の手法であり、新しいデータセットで数エポックの観測のみで正確な予測が可能になった。
  • 5つの画像分類ベンチマークにおいて、IT-NASとIT-LCEによる早期停止の組み合わせにより、合計の探索時間が16倍短縮され、平均で350 GPU時間の削減が達成された。
  • 早期停止なしのランダムサーチと比較して、精度の損失は無視できるほど小さく、全データセットで顕著な性能低下は認められなかった。
  • 候補アーキテクチャ空間が小さい場合でも、メタ知識の転送が空間サイズの減少を補うため、本手法は頑健であることが示された。
  • メタ知識の作成にかかる計算コスト(1,866 GPU時間)は一回限りの投資であり、長期的な節約に貢献するだけでなく、研究者やAutoMLサービス間で共有可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。