Skip to main content
QUICK REVIEW

[論文レビュー] A Study of the Learning Progress in Neural Architecture Search Techniques

Prabhant Singh, Tobias Jacobs|arXiv (Cornell University)|Jun 18, 2019
Adversarial Robustness in Machine Learning参考文献 11被引用数 7
ひとこと要約

本研究では、効率的なニューラルアーキテクチャサーチ(ENAS)におけるコントローラーの学習プロセスを、異なる訓練エポックで生成されたアーキテクチャのテスト精度を測定することで評価している。驚くべきことに、時間の経過に伴い性能に顕著な向上が見られなかった—初期に生成されたアーキテクチャと数百エポック経った後で生成されたアーキテクチャの性能に差がなかった—これは、ENASの成功がコントローラーの訓練ではなく、サーチスペースの設計に起因していることを示しており、ワンショット手法が実用的な代替手段であることを裏付けている。

ABSTRACT

In neural architecture search, the structure of the neural network to best model a given dataset is determined by an automated search process. Efficient Neural Architecture Search (ENAS), proposed by Pham et al. (2018), has recently received considerable attention due to its ability to find excellent architectures within a comparably short search time. In this work, which is motivated by the quest to further improve the learning speed of architecture search, we evaluate the learning progress of the controller which generates the architectures in ENAS. We measure the progress by comparing the architectures generated by it at different controller training epochs, where architectures are evaluated after having re-trained them from scratch. As a surprising result, we find that the learning curves are completely flat, i.e., there is no observable progress of the controller in terms of the performance of its generated architectures. This observation is consistent across the CIFAR-10 and CIFAR-100 datasets and two different search spaces. We conclude that the high quality of the models generated by ENAS is a result of the search space design rather than the controller training, and our results indicate that one-shot architecture design is an efficient alternative to architecture search by ENAS.

研究の動機と目的

  • ENASのコントローラーが、高精度なアーキテクチャを生成する能力を時間経過とともに向上させているかどうかを調査すること。
  • ENASにおける学習プロセスが、生成されたアーキテクチャの精度に顕著な向上をもたらすかどうかを評価すること。
  • ENASコントローラーの長期間訓練が、最終的なモデル性能に実質的な利点をもたらすかどうかを特定すること。
  • ワンショットアーキテクチャ生成が、精度を損なわずに、完全なENASサーチプロセスの代替として可能かどうかを評価すること。

提案手法

  • 著者らは、ENASコントローラーを複数エポックにわたり訓練し、訓練のさまざまな段階でアーキテクチャをサンプリングした。
  • 各生成されたアーキテクチャは、完全な訓練セットを用いて、260〜310エポック分、再訓練し、正確なテスト精度を測定した。
  • 最初のエポックで生成されたアーキテクチャの性能と、コントローラーの完全な訓練後で生成されたアーキテクチャの性能を比較した。
  • マクロおよびマイクロサーチスペースを用いて、CIFAR-10およびCIFAR-100で実験を行った。
  • コントローラーのフィードバックとして共有重みを用いた検証精度を用いたが、それが最終テスト精度とどの程度相関するかを評価した。
  • CIFAR-100およびプーリング操作をサポートするために、公式ENAS実装を修正して使用した。

実験結果

リサーチクエスチョン

  • RQ1ENASコントローラーが生成するアーキテクチャの性能は、コントローラー訓練の過程で向上するか?
  • RQ2共有重みを用いた検証精度と、再訓練されたアーキテクチャの最終テスト精度の間に顕著な相関関係があるか?
  • RQ3完全なENAS訓練プロセスを終えることなく、高精度なアーキテクチャを発見できるか?
  • RQ4最終アーキテクチャの品質は、サーチスペース設計とコントローラー最適化のどちらに依存しているか?

主な発見

  • ENASコントローラーが生成するアーキテクチャのテスト精度は、時間の経過に伴い顕著な向上を示さず、明確な学習進捗が観察されなかった。
  • CIFAR-10およびCIFAR-100の両方において、最初の訓練エポックで生成されたアーキテクチャと、150〜310エポックの訓練後で生成されたアーキテクチャの性能に差がなかった。
  • CIFAR-10マクロサーチスペースでは、最終的な精度が95.38%(訓練後)であったのに対し、初期の精度は95.81%であり、わずかな向上にとどまった。
  • CIFAR-100マクロサーチスペースでは、初期精度が80.75%、最終精度が80.47%であり、一貫した向上が見られなかった。
  • 共有重みを用いた検証精度は、再訓練されたモデルの最終テスト精度と正の相関関係を示さなかった。
  • 結果から、ENASが見つけた高品質なモデルは、主にサーチスペースの設計によるものであり、コントローラーの訓練によるものではないと考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。