Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Optimization of Neural Network Structures Using Probabilistic Modeling

Shinichi Shirakawa, Yasushi Iwata|arXiv (Cornell University)|Jan 23, 2018
Advanced Neural Network Applications参考文献 24被引用数 11
ひとこと要約

本稿では、構造的要素(例:接続、活性化関数の種類、層)をパラメトリックな分布(特にベルヌーイ分布)を用いて確率的変数としてモデル化することで、勾配ベース最適化によるニューラルネットワーク構造の動的で微分可能な最適化のための確率的フレームワークを提案する。この手法により、重みと構造パラメータを同時に学習可能となり、パラメータ数を削減しつつも競争力のある性能を達成する。例えば、CIFAR-100でDenseNetの重みを10%削減しても精度に損失が生じない。

ABSTRACT

Deep neural networks (DNNs) are powerful machine learning models and have succeeded in various artificial intelligence tasks. Although various architectures and modules for the DNNs have been proposed, selecting and designing the appropriate network structure for a target problem is a challenging task. In this paper, we propose a method to simultaneously optimize the network structure and weight parameters during neural network training. We consider a probability distribution that generates network structures, and optimize the parameters of the distribution instead of directly optimizing the network structure. The proposed method can apply to the various network structure optimization problems under the same framework. We apply the proposed method to several structure optimization problems such as selection of layers, selection of unit types, and selection of connections using the MNIST, CIFAR-10, and CIFAR-100 datasets. The experimental results show that the proposed method can find the appropriate and competitive network structures.

研究の動機と目的

  • 深層ニューラルネットワーク(DNN)の最適なアーキテクチャ(層の深さ、ユニットの種類、接続性など)を特定する課題に対処すること。これらは通常、手作業で行われ、時間がかかる。
  • 繰り返し複数の構成で訓練を要する静的ハイパーパrameter最適化(例:ベイズ最適化)の非効率性を克服すること。
  • 1つのトレーニングループ内で、ネットワーク重みと構造的要素を同時に学習する動的最適化手法を開発し、計算効率を向上させること。
  • 微分可能構造パラメータを必要とする従来の微分可能アーキテクチャ探索手法の制限を超える柔軟性を提供すること。非微分可能な構造的選択を確率的モデリングにより扱う。
  • 本手法の有効性を、接続のプルーニング、活性化関数の選択、層スキップの最適化など、多様な構造的最適化タスクにおいて実証すること。

提案手法

  • ネットワーク構造パラメータ(例:接続、活性化関数)を、パラメトリック確率分布(特にベルヌーイ分布)を用いて確率的変数としてモデル化し、接続の有無やユニットのドロップアウトなどの二値的決定を表現する。
  • 目的関数は、ネットワーク構造の分布上の期待損失として定義され、ネットワーク重みと分布パラメータの両方を勾配ベース最適化可能にする。
  • 分布パラメータ(例:ベルヌーイ確率)は確率的勾配降下法を用いて最適化され、重みと構造的確率が同時に更新されるエンドツーエンドのトレーニングが可能になる。
  • このフレームワークは、接続、活性化関数、層スキップといった複数の構造的要素を、統一された確率的定式化内で同時に最適化可能である。
  • 再パrameter化技術を用いて、確率的構造パラメータを介した勾配のバックプロpagationを可能にし、構造が非微分可能であっても微分可能トレーニングが可能になる。
  • 本手法は汎用的かつ拡張可能である。本稿ではベルヌーイ分布に焦点を当てているが、より複雑な構造的選択には指数型分布族(例:カテゴリカル分布)への応用も可能である。

実験結果

リサーチクエスチョン

  • RQ1統一された確率的フレームワークは、トレーニング中に接続、活性化関数、層スキップといった複数の種類のニューラルネットワーク構造的要素を同時に動的に最適化できるか?
  • RQ2本手法の性能は、静的最適化手法(例:ベイズ最適化)と比較して、精度およびトレーニング効率の面でどうなるか?
  • RQ3本手法は、精度を損なわずに接続やユニットの自動プルーニングにより、モデルの複雑さ(例:パラメータ数)をどの程度低減できるか?
  • RQ4人間の専門家が容易に設計できないが、効果的な非標準的なネットワークアーキテクチャを本手法は発見できるか?
  • RQ5本手法は、DenseNetなどの異なるデータセットやネットワークタイプにおいて、構造的ハイパーパrameter最適化に一般化できるか?

主な発見

  • 提案手法は、CIFAR-10およびCIFAR-100データセットで、標準的なDenseNetや最先端の静的アーキテクチャ探索手法と同等のテスト誤差率を達成した。
  • CIFAR-100では、接続数を約70削減しながら性能を維持した。その結果、総重みパラメータ数が10%削減された。
  • 接続のための学習済みベルヌーイパラメータは、主に0.0または1.0に近づいており、冗長な接続が高確率でプルーニングされたことが示された。
  • 本手法は計算効率に優れており、最終的な精度が多少低くても、ベイズ最適化などの静的最適化手法を上回るトレーニング時間を達成した。
  • フレームワークは、層スキップ、活性化関数の混合率、接続といった複数の構造的要素を同時に最適化でき、タスク間での柔軟性と一般化能力を示した。
  • サンプリングされた構造を用いた確率的予測は、期待構造を用いた決定的推論をわずかに上回ったが、差は顕著ではなかった。これは、期待構造の堅牢性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。