Skip to main content
QUICK REVIEW

[論文レビュー] Neural Architecture Search using Deep Neural Networks and Monte Carlo Tree Search

Linnan Wang, Yiyang Zhao|arXiv (Cornell University)|May 18, 2018
Advanced Neural Network Applications参考文献 54被引用数 11
ひとこと要約

この論文は、マルチステージのメタDNNを用いてネットワークの精度を予測し、分散型で転移学習を活用したロールアウト戦略により評価コストを低減するMCTSベースのニューラルアーキテクチャサーチエージェント、AlphaXを提案する。12 GPU日と1,000サンプルで、CIFAR-10では97.84%のトップ-1精度、ImageNetでは75.5%を達成し、両方の精度とサンプル効率においてSOTAのNAS手法を上回った。

ABSTRACT

Neural Architecture Search (NAS) has shown great success in automating the design of neural networks, but the prohibitive amount of computations behind current NAS methods requires further investigations in improving the sample efficiency and the network evaluation cost to get better results in a shorter time. In this paper, we present a novel scalable Monte Carlo Tree Search (MCTS) based NAS agent, named AlphaX, to tackle these two aspects. AlphaX improves the search efficiency by adaptively balancing the exploration and exploitation at the state level, and by a Meta-Deep Neural Network (DNN) to predict network accuracies for biasing the search toward a promising region. To amortize the network evaluation cost, AlphaX accelerates MCTS rollouts with a distributed design and reduces the number of epochs in evaluating a network by transfer learning, which is guided with the tree structure in MCTS. In 12 GPU days and 1000 samples, AlphaX found an architecture that reaches 97.84\% top-1 accuracy on CIFAR-10, and 75.5\% top-1 accuracy on ImageNet, exceeding SOTA NAS methods in both the accuracy and sampling efficiency. Particularly, we also evaluate AlphaX on NASBench-101, a large scale NAS dataset; AlphaX is 3x and 2.8x more sample efficient than Random Search and Regularized Evolution in finding the global optimum. Finally, we show the searched architecture improves a variety of vision applications from Neural Style Transfer, to Image Captioning and Object Detection.

研究の動機と目的

  • 既存のニューラルアーキテクチャサーチ(NAS)手法の高い計算コストと低いサンプル効率を解決すること。
  • MCTSによる適応的探索と活用とオンライン性能モデリングを統合することで、探索効率を向上させること。
  • MCTSツリー構造を基にした転移学習とロールアウトサンプリングを用いて、ネットワーク評価コストを低減すること。
  • 実用的な計算予算内でCIFAR-10およびImageNetで最先端の性能を達成すること。
  • 探索されたアーキテクチャが、スタイル変換、オブジェクト検出、画像キャプションなど多様なビジョンタスクに一般化可能であることを示すこと。

提案手法

  • 探索と活用のバランスを図るために、木構造に適用した上限信頼区間(UCT)を用いたモンテカルロツリー探索(MCTS)を採用する。
  • 既知のアーキテクチャから学習し、未学習のものへ一般化できるマルチステージのメタDNNを導入する。
  • 親ネットワークの重みを初期値として子ネットワークを初期化することで転移学習を実装し、訓練エポック数を70から20に削減しながらも精度を維持する。
  • 複数のGPUで並列化可能な分散型MCTS設計を実装し、複数のGPUを活用して探索を加速する。
  • MCTSツリー構造を基に、有望な探索領域を優先するように、転移学習とロールアウトサンプリングをガイドする。
  • 階層的回帰アプローチを用いてメタDNNを訓練し、異なる精度範囲に特化した専用のMLPと、適切な予測子を選択するゲーティングネットワークを導入する。

実験結果

リサーチクエスチョン

  • RQ1MCTSベースのNASは、ランダムサーチやQ学習、正則化進化といったグリーディな手法よりも高いサンプル効率を達成できるか?
  • RQ2メタDNNはニューラルアーキテクチャの精度予測を顕著に改善し、探索効率を向上させられるか?
  • RQ3転移学習と分散計算を組み合わせることで、NASにおける候補アーキテクチャの訓練コストをどの程度低減できるか?
  • RQ4探索されたアーキテクチャは、標準ベンチマークをはるかに超える多様なビジョンアプリケーションに一般化可能か?
  • RQ5適応的探索と予測モデリングを統合することで、高精度なアーキテクチャへの収束が速くなるか?

主な発見

  • AlphaXは12 GPU日と1,000サンプルで、CIFAR-10で97.84%のトップ-1精度、ImageNetで75.5%を達成し、両方の精度とサンプル効率においてSOTAのNAS手法を上回った。
  • NASBench-101において、AlphaXはランダムサーチの3倍、正則化進化の2.8倍のサンプル効率でグローバル最適解を発見した。
  • マルチステージのメタDNNは、トレーニングセットで0.784の相関を達成し、単一のMLPを上回り、RNNベースのモデルと比較して誤予測を顕著に削減した。
  • 転移学習により、子ネットワークは20エポックで学習を再開した場合と同等の精度に到達でき、評価コストを70%以上削減した。
  • 探索されたアーキテクチャ、AlphaX-1は、下流タスクでの性能を向上させた:COCOでSSDのmAPを20.1%から23.7%に向上させ、画像キャプションのBLEUスコアを最大4.4ポイント向上させた。
  • アルゴリズム比較において、AlphaXはQ学習やランダムサーチよりも2.3倍速くグローバル最適解に到達し、しばしば局所最適に陥る勾配上昇法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。