Skip to main content
QUICK REVIEW

[論文レビュー] Improving Neural Architecture Search Image Classifiers via Ensemble Learning

V. Macko, Charles Weill|arXiv (Cornell University)|Mar 14, 2019
Advanced Neural Network Applications参考文献 17被引用数 9
ひとこと要約

この論文では、適応的知識蒸留と重み付きアンサンブル平均を用いて、逐次的に訓練された小規模なサブネットワークのアンサンブルを構築することで、画像分類器の性能を向上させる自動ニューラルアーキテクチャサーチフレームワークAdaNASを提案する。この手法は、追加のデータ拡張を用いずに、3300万パラメータでCIFAR-100でSOTAの精度(14.58%の誤差)を達成し、単一タワー型アーキテクチャーや従来のNAS手法を上回っている。

ABSTRACT

Finding the best neural network architecture requires significant time, resources, and human expertise. These challenges are partially addressed by neural architecture search (NAS) which is able to find the best convolutional layer or cell that is then used as a building block for the network. However, once a good building block is found, manual design is still required to assemble the final architecture as a combination of multiple blocks under a predefined parameter budget constraint. A common solution is to stack these blocks into a single tower and adjust the width and depth to fill the parameter budget. However, these single tower architectures may not be optimal. Instead, in this paper we present the AdaNAS algorithm, that uses ensemble techniques to compose a neural network as an ensemble of smaller networks automatically. Additionally, we introduce a novel technique based on knowledge distillation to iteratively train the smaller networks using the previous ensemble as a teacher. Our experiments demonstrate that ensembles of networks improve accuracy upon a single neural network while keeping the same number of parameters. Our models achieve comparable results with the state-of-the-art on CIFAR-10 and sets a new state-of-the-art on CIFAR-100.

研究の動機と目的

  • 単一タワーニューラルネットワークアーキテクチャの制限を解決すること。これは、高品質な構築ブロックを有するものの、パrameter予算を十分に活用できないことが一般的である。
  • 同じパrameter数を有する単一の大規模モデルよりも、より小さな独立して訓練されたサブネットワークのアンサンブルが優れた精度を達成できるかどうかを検討すること。
  • 反復的トレーニングと知識蒸留を活用して、最小限の人的専門知識でアンサンブル構成プロセスを自動化すること。
  • 従来のアンサンブルからの知識蒸留を伴う逐次的トレーニングが、独立したトレーニングに比べて最終的なアンサンブル性能を向上させるかどうかを調査すること。
  • 同じ探索空間内でも、異なるデータセットに対して異なる最適アーキテクチャが得られることを示すこと。

提案手法

  • AdaNASは、NASNetの探索空間から小さなアーキテクチャを段階的に選択・訓練することで、動的ジェネレータを用いて反復的にサブネットワークのアンサンブルを構築する。
  • 各反復において、以前のアンサンブル(教師モデルとして機能)から知識を蒸留することで、新しいサブネットワークをトレーニングする。
  • 各新しいサブネットワークへの知識転送を向上させるために、新しい技術である適応的知識蒸留(AKD)を導入する。
  • 最終的なアンサンブルは、各サブネットワークの予測を学習可能な重み付き平均で統合することで、より正確なサブネットワークに高い重要度を割り当てる。
  • 固定されたパラメータ予算の下で、反復ごとに深さと幅を動的に調整し、精度を最大化する。
  • フレームワークはAdaNetに基づき、既存のNASパイプラインと統合可能であり、最小限のハイパーパramータチューニングで運用可能である。

実験結果

リサーチクエスチョン

  • RQ1同じパラメータ数を有する単一の大規模モデルよりも、より小さなサブネットワークのアンサンブルが、より高い精度を達成できるか?
  • RQ2従来のアンサンブルからの知識蒸留を伴う逐次的トレーニングが、独立したトレーニングに比べて最終的な性能を向上させるか?
  • RQ3動的ジェネレータを用いて、最小限の人的干渉でアンサンブル構成プロセスを自動化できるか?
  • RQ4同じ探索空間を用いる場合、CIFAR-10とCIFAR-100における最適アーキテクチャはどのように異なるか?
  • RQ5適応的知識蒸留と学習可能な混合重みが、さらにアンサンブル精度を向上させるか?

主な発見

  • CIFAR-10では、3300万パラメータでテスト誤差2.26%を達成し、AmoebaNet や NAONet などのSOTAモデルと同等の性能を示した。
  • CIFAR-100では、追加のデータ拡張を用いずに、テスト誤差14.58%を記録し、NASNet-A や他の先行手法を上回るSOTAを達成した。
  • アルゴリズムはCIFAR-100に対してCIFAR-10よりも幅広いアーキテクチャを一貫して選択しており、同じ探索空間内でもデータセット固有のアーキテクチャ的好みが存在することを示している。
  • 適応的知識蒸留と学習可能な混合重みの両方を用いることで最高の性能が得られ、反復的知識転送の有効性が裏付けられた。
  • アンサンブルアプローチにより、サブネットワークを独立してトレーニングできるため、並列推論が可能となり、トレーニングからデプロイまでのウォールクロック時間を短縮できる。
  • 単一タワーネットワークのNASNetアーキテクチャーよりも優れた性能を示し、アーキテクチャ設計における人的専門知識の必要性を著しく低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。