Skip to main content
QUICK REVIEW

[論文レビュー] VINNAS: Variational Inference-based Neural Network Architecture Search

Martin Ferianc, Hongxiang Fan|arXiv (Cornell University)|Jul 12, 2020
Advanced Neural Network Applications参考文献 44被引用数 6
ひとこと要約

VINNASは、変分推論と変分ドロップアウトを用い、自動 relevance 判定(ARD)事前分布を導入することで、スーパーグラフ内の不要な演算および接続を自動でプルーニングする微分可能ニューラルアーキテクチャ探索手法を提案する。この手法は、モード崩壊を回避し、多様性のあるスパースなアーキテクチャを促進することで、CIFAR-10で最先端の精度を達成し、非ゼロパラメータ数を最大2倍まで削減する。

ABSTRACT

In recent years, neural architecture search (NAS) has received intensive scientific and industrial interest due to its capability of finding a neural architecture with high accuracy for various artificial intelligence tasks such as image classification or object detection. In particular, gradient-based NAS approaches have become one of the more popular approaches thanks to their computational efficiency during the search. However, these methods often experience a mode collapse, where the quality of the found architectures is poor due to the algorithm resorting to choosing a single operation type for the entire network, or stagnating at a local minima for various datasets or search spaces. To address these defects, we present a differentiable variational inference-based NAS method for searching sparse convolutional neural networks. Our approach finds the optimal neural architecture by dropping out candidate operations in an over-parameterised supergraph using variational dropout with automatic relevance determination prior, which makes the algorithm gradually remove unnecessary operations and connections without risking mode collapse. The evaluation is conducted through searching two types of convolutional cells that shape the neural network for classifying different image datasets. Our method finds diverse network cells, while showing state-of-the-art accuracy with up to almost 2 times fewer non-zero parameters.

研究の動機と目的

  • 勾配ベースのニューラルアーキテクチャ探索(NAS)手法におけるモード崩壊と一般化性能の低さを解消すること。
  • 人為的介入なしに、不要な演算および接続を自動でプルーニングする、微分可能で自動化されたアーキテクチャ探索を可能にすること。
  • 変分推論を用いて演算の重要度を確率的にモデル化することで、探索の効率性と多様性を向上させること。
  • 厳密な正則化を用いることで、モデルパラメータを最小限に抑えつつ、画像分類ベンチマークで最先端の精度を達成すること。
  • 大きさに加えて不確実性推定(対数分散を介して)を用いることで、より頑健な演算選択を可能にすること。

提案手法

  • VINNASは、変分推論フレームワークを用いて、演算の重みとその重要度を学習可能な確率的変数としてモデル化する。
  • ARD事前分布を用いた変分ドロップアウトを適用し、重要度の低い演算および接続の自動プルーニングを促進する。
  • 探索中の探査を促進しつつも、選択された演算に対する高い信頼性を維持するため、カスタムの自己正則化損失を用いる。
  • アーキテクチャのパラメータ(α)はバックプロパゲーションにより学習され、すべての候補演算を含むスーパーグラフ上で探索が実行される。
  • アーキテクチャ探索は、セルベースのCNNで実施され、ノーマルセルとリダクションセルが繰り返し配置されて全ネットワークが構築される。
  • 探索後、標準的なデータオーグメンテーション、ドロップパス、および補助タワーを用いて、再訓練を行い一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1変分推論にARD事前分布を組み合わせることで、勾配ベースNASにおけるモード崩壊を効果的に防止できるか?
  • RQ2演算重みの不確実性を大きさに基づく選択に加えて用いることで、より優れたアーキテクチャ探索が可能になるか?
  • RQ3提案手法が、顕著に少ないパラメータ数で最先端の精度を達成できるか?
  • RQ4MNIST、FashionMNIST、CIFAR-10といった多様なデータセットに、本手法は一般化可能か?
  • RQ5手動でのアーキテクチャバイアスなしに、多様でスパースなアーキテクチャを自動で発見できるか?

主な発見

  • VINNASは、SOTAと比較して非ゼロパラメータ数をほぼ2倍削減しながら、CIFAR-10で最先端のテスト精度を達成した。
  • 本手法はモード崩壊を効果的に回避し、すべてのセルで均一な演算ではなく、多様な演算タイプを含むアーキテクチャを生成した。
  • MNISTでは、一部の接続が低い正のSNRを示しており、これらは安全にプルーニング可能であると特定された。これは、データセットの一般化のしやすさを反映している。
  • CIFAR-10では、すべての演算および接続が高い推定重要度を示しており、豊富で複雑なアーキテクチャが発見されたことを示している。
  • 大きさに加えて不確実性(対数分散)を用いることで、演算選択の性能がわずかに向上した。
  • すべての発見されたアーキテクチャは、標準的な正則化を用いた再訓練後、すべてのデータセットで高いテスト精度を示し、強力な一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。