Skip to main content
QUICK REVIEW

[論文レビュー] Maxout Networks

Ian Goodfellow, David Warde-Farley|arXiv (Cornell University)|Feb 18, 2013
Opportunistic and Delay-Tolerant Networks被引用数 7
ひとこと要約

この論文は、ドロップアウト訓練におけるモデルアンサンブルと最適化を向上させるために、最大値を取る新しい活性化関数「maxout」を用いた深層学習アーキテクチャ、Maxout Networkを紹介する。Maxoutユニットは複数の線形変換の最大値を計算し、より良い勾配の流れとパラメータの有効活用を可能にし、MNIST、CIFAR-10、CIFAR-100、SVHNで最先端の性能を達成する。

ABSTRACT

We consider the problem of designing models to leverage a recently introduced approximate model averaging technique called dropout. We define a simple new model called maxout (so named because its output is the max of a set of inputs, and because it is a natural companion to dropout) designed to both facilitate optimization by dropout and improve the accuracy of dropout's fast approximate model averaging technique. We empirically verify that the model successfully accomplishes both of these tasks. We use maxout and dropout to demonstrate state of the art classification performance on four benchmark datasets: MNIST, CIFAR-10, CIFAR-100, and SVHN.

研究の動機と目的

  • ドロップアウトをモデルアンサンブル手法として効果的に活用できるニューラルネットワークアーキテクチャを設計すること。
  • ReLUユニットがドロップアウト下で示す限界、例えば死滅ニューロンや劣悪な勾配の流れを解消すること。
  • すべてのユニットを一貫して勾配が流れるようにすることで、深層ネットワークにおける最適化ダイナミクスを改善すること。
  • ドロップアウト下でのアンサンブル平均の近似がmaxoutによってどのように向上するかを実験的に検証すること。
  • maxoutとドロップアウトを用いて、複数のベンチマークデータセットで最先端の分類精度を達成すること。

提案手法

  • Maxoutは、入力のk個の線形変換の最大値を計算する新しい活性化関数を導入する:$ h_i(x) = \max_{j \in [1,k]} (x^T W_{ij} + b_{ij}) $。
  • 各ニューロンごとに複数の線形ユニットを共有することで、ネットワークが学習中に重みと活性化関数の両方を同時に学習可能になる。
  • ドロップアウト訓練では、ドロップアウトマスクをmax演算の前に入力することで、どのユニットが無効化されても常に入力と勾配が到達するよう保証する。
  • このアーキテクチャは、全結合層および畳み込み層の両方と互換性があり、特徴マップ(チャネル単位)でのプーリングとしてmaxoutが適用される。
  • 完全なモデルで重みを半分にした場合の出力がアンサンブル平均をより正確に近似できるため、幾何平均モデルアンサンブルの近似が向上する。
  • 設計により、すべてのフィルタが訓練中に積極的に使用され、ReLUネットワークがドロップアウト下でよく見られる飽和やプルーニングの問題を回避する。

実験結果

リサーチクエスチョン

  • RQ1ドロップアウトのモデルアンサンブル特性をより効果的に活用できるニューラルネットワークアーキテクチャを設計できるか?
  • RQ2ReLUやtanhユニットと比較して、maxoutはドロップアウト下での最適化ダイナミクスを改善するか?
  • RQ3ドロップアウト下で深層ネットワークの未使用フィルタ数をどれほど削減できるか?
  • RQ4特に低層部において、maxoutとReLUネットワークのドロップアウトマスクに起因する勾配の分散はどのように異なるか?
  • RQ5maxoutはより深いネットワークの学習を可能にし、標準的な活性化関数よりも優れた一般化性能を達成できるか?

主な発見

  • Maxoutネットワークは、ReLUやtanhを用いた従来手法を上回り、MNIST、CIFAR-10、CIFAR-100、SVHNで最先端の性能を達成した。
  • 同じ訓練環境下で、Maxoutでは2番目の隠れ層で2400個のフィルタのうち99.9%(2個のみ未使用)が使用されたが、ReLUネットワークでは39.2%のフィルタが未使用だった。
  • SGDでは5%未満のユニットがゼロに飽和したが、ドロップアウト下ではReLUネットワークで60%のユニットがゼロに飽和したのに対し、Maxoutユニットは訓練全体を通して活性でかつ学習可能であった。
  • Maxoutでは、ReLUと比較して1層目の重みにおける勾配分散が3.4倍高く、マスク依存の勾配信号のより良い伝搬を示している。
  • 出力重みの勾配分散は、MaxoutがReLUより1.4倍高かったため、より効果的なモデルアンサンブル行動が示唆された。
  • Maxoutユニットは、正負の活性化がほぼ同等の頻度で切り替わったが、ReLUユニットとは異なり、非活性化されやすく、回復が困難で最適化を損なう傾向にあった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。