Skip to main content
QUICK REVIEW

[論文レビュー] TAPAS: Train-less Accuracy Predictor for Architecture Search

Roxana Istrate, Florian Scheidegger|arXiv (Cornell University)|Jun 1, 2018
Advanced Neural Network Applications参考文献 21被引用数 9
ひとこと要約

TAPAS は、以前の実験からの継続的経験とデータセットの難易度特徴化を活用することで、未学習のデータセットにおける CNN アーキテクチャのピーク検証精度を、数秒未塔で予測するトレーニング不要の深層学習精度予測モデルである。1つの GPU で 10 分未塔のスケールで大規模なアーキテクチャ探索を可能にし、CIFAR-10 で 93.67%、CIFAR-100 で 81.01% の精度を達成するモデルを発見した。これは、探索中に学習を一切行わずしても、最先端の性能を達成または上回る。

ABSTRACT

In recent years an increasing number of researchers and practitioners have been suggesting algorithms for large-scale neural network architecture search: genetic algorithms, reinforcement learning, learning curve extrapolation, and accuracy predictors. None of them, however, demonstrated high-performance without training new experiments in the presence of unseen datasets. We propose a new deep neural network accuracy predictor, that estimates in fractions of a second classification performance for unseen input datasets, without training. In contrast to previously proposed approaches, our prediction is not only calibrated on the topological network information, but also on the characterization of the dataset-difficulty which allows us to re-tune the prediction without any training. Our predictor achieves a performance which exceeds 100 networks per second on a single GPU, thus creating the opportunity to perform large-scale architecture search within a few minutes. We present results of two searches performed in 400 seconds on a single GPU. Our best discovered networks reach 93.67% accuracy for CIFAR-10 and 81.01% for CIFAR-100, verified by training. These networks are performance competitive with other automatically discovered state-of-the-art networks however we only needed a small fraction of the time to solution and computational resources.

研究の動機と目的

  • 訓練ベースのニューラルアーキテクチャ探索(NAS)手法が、数千回の訓練ランを要するという高い計算コストを解消すること。
  • 微調整や再訓練を必要とせず、未学習のデータセットに対しても一般化可能な精度予測モデルの開発。
  • 探索中に学習を排除することで、最小限の計算コストで大規模なアーキテクチャ探索を実現すること。
  • 過去の実験からの継続的経験とデータセットの難易度特徴化を組み込むことで、予測精度の向上。

提案手法

  • TAPAS は、ターゲットデータセットでの学習を一切必要とせず、アーキテクチャのトポロジーとデータセットの難易度に基づいて、CNN のピーク精度を深層ニューラルネットワークで予測する。
  • データセットの複雑さを統計的・構造的特徴を用いて定量化する「データセット難易度特徴化(DDC)モジュール」を導入し、未学習のデータセットへの一般化を可能にする。
  • 類似するデータセット難易度に基づいて関連する過去の実験を事前に選別する「継続的データセット埋め込み(LDE)プレフィルタリング機構」を採用し、予測の信頼性を向上させる。
  • 新しいデータセットに対して、DDC スコアと過去の実験データのみを用いて、予測を動的に再調整できる訓練不要の適応メカニズムを新規に導入。
  • 多様なデータセットをカバーする長期間の実験データベースに基づいてモデルを学習し、新しいデータへの再訓練なしに転移学習と継続的改善を実現。
  • TAPAS は進化的探索パイプラインと統合され、高コストな訓練評価の代わりに高速かつ正確な予測を用いて大規模なアーキテクチャ探索をシミュレートする。

実験結果

リサーチクエスチョン

  • RQ1訓練不要の深層学習精度予測モデルは、ターゲットデータセットでの学習を一切必要とせず、未学習のデータセットに対しても一般化可能か?
  • RQ2データセット難易度特徴化を組み込むことで、多様なデータセット間で予測精度がどのように向上するか?
  • RQ3部分的または完全な訓練を要する従来の手法と比較して、訓練不要の予測モデルはどの程度優れているか?
  • RQ4TAPAS は、計算コストと時間のオーダーを桁違いに削減することで、大規模なアーキテクチャ探索を可能にするか?

主な発見

  • 最良の発見されたネットワークでは、CIFAR-10 で 93.67% のトップ-1 精度、CIFAR-100 で 81.01% の精度を達成し、完全な訓練による検証済み。
  • 1つの GPU で 400 秒間の計算で大規模なアーキテクチャ探索を実施し、最先端の NAS 手法と同等の性能を達成。
  • Peephole や LCE、BNN、ν-SVR といった従来手法と比較して、学習済みおよび未学習のデータセット両方のシナリオで優れた性能を示し、特に一般化性能が求められる状況で顕著に優位。
  • データセット難易度特徴化と LDE プレフィルタリングの導入により、まったく新しいデータセットに対しても予測精度が顕著に向上。
  • TAPAS を用いたシミュレーテッドエボリューション(20,000 の変異を含む)では、1 データセットあたり 2×10¹¹ FLOPs にまで計算量を削減。対照的に、参照研究 [16] では 9×10¹⁹ FLOPs であり、実行時間は 256 時間から 10 分未塔に短縮された。
  • TAPAS は 1 つの GPU で 1 秒間に 100 件以上の予測を実行可能であり、学習なしにリアルタイムで大規模なアーキテクチャ探索を実現可能。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。