Skip to main content
QUICK REVIEW

[論文レビュー] Learned-Norm Pooling for Deep Feedforward and Recurrent Neural Networks

Çaǧlar Gülçehre, Kyunghyun Cho|arXiv (Cornell University)|Nov 7, 2013
Domain Adaptation and Few-Shot Learning参考文献 33被引用数 4
ひとこと要約

本稿では、ニューロンの射影における正規化された $L_p$ ノルムを計算することによって、max、平均、RMSプーリングなどのプーリング操作を一般化する学習可能な非線形活性化関数である $L_p$ ユニットを導入する。各ユニットごとに最適な $p$ 値を学習することで、複雑で曲がった意思決定境界を効率的に捉え、MNIST、顔認識、ポリフォニック音楽予測を含む複数のベンチマークデータセットにおいて、フィードフォワードおよび再帰的ニューラルネットワークで最先端の性能を達成する。

ABSTRACT

In this paper we propose and investigate a novel nonlinear unit, called $L_p$ unit, for deep neural networks. The proposed $L_p$ unit receives signals from several projections of a subset of units in the layer below and computes a normalized $L_p$ norm. We notice two interesting interpretations of the $L_p$ unit. First, the proposed unit can be understood as a generalization of a number of conventional pooling operators such as average, root-mean-square and max pooling widely used in, for instance, convolutional neural networks (CNN), HMAX models and neocognitrons. Furthermore, the $L_p$ unit is, to a certain degree, similar to the recently proposed maxout unit (Goodfellow et al., 2013) which achieved the state-of-the-art object recognition results on a number of benchmark datasets. Secondly, we provide a geometrical interpretation of the activation function based on which we argue that the $L_p$ unit is more efficient at representing complex, nonlinear separating boundaries. Each $L_p$ unit defines a superelliptic boundary, with its exact shape defined by the order $p$. We claim that this makes it possible to model arbitrarily shaped, curved boundaries more efficiently by combining a few $L_p$ units of different orders. This insight justifies the need for learning different orders for each unit in the model. We empirically evaluate the proposed $L_p$ units on a number of datasets and show that multilayer perceptrons (MLP) consisting of the $L_p$ units achieve the state-of-the-art results on a number of benchmark datasets. Furthermore, we evaluate the proposed $L_p$ unit on the recently proposed deep recurrent neural networks (RNN).

研究の動機と目的

  • 固定プーリング操作の限界を是正するため、プーリングを非線形活性化関数として学習可能な一般化を提案すること。
  • 固定プーリング法と比較して、$L_p$ ノルムの順序 $p$ を学習することで、モデルの表現力と一般化性能が向上するかを調査すること。
  • $L_p$ ユニットの幾何的性質と、分類境界が非線形的・曲がった形状である場合に、それらの境界をピecewise-linearな代替手法よりも効率的にモデル化できる能力を調査すること。
  • 多様なベンチマークタスクにおける深層フィードフォワードネットワーク(MLP)および深層再帰ネットワーク(RNN)における $L_p$ ユニットの性能を評価すること。
  • 最適な $p$ 値がデータセットやユニットごとに異なることから、$p$ をエンドツーエンドで学習する必要があることを正当化すること。

提案手法

  • 下層の活性化の複数の射影における正規化された $L_p$ ノルムを計算する非線形活性化関数として $L_p$ ユニットを提案:$u_j = \left( \frac{1}{K} \sum_{k=1}^K |z_k|^p \right)^{1/p}$、ここで $z_k$ は入力信号の射影である。
  • プーリング演算子(max、平均、RMS)がそれぞれ $p = \infty$、$p = 1$、$p = 2$ の場合に $L_p$ ユニットの特別なケースとして現れることを示す。
  • バックプロパゲーションとエンドツーエンド学習を可能にするために、$L_p$ ユニットの微分可能形式を導入する。
  • 学習率やスケジューリングなどのハイパーパramータをランダムに探索する確率的勾配降下法を用い、検証セット上でモデル性能を最適化する。
  • 多層パーセプトロン(MLP)および深層再帰ネットワーク(DOT-RNN)の両方において $L_p$ ユニットを適用し、出力層にはマックスアウトを、遷移層には $L_p$ ユニットを用いる。
  • トレーニングには Pylearn2 ライブラリを用い、MNIST、トロント顔データベース、ペントミノ、フォレストカバータイプ、音楽予測タスクでモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1プーリング型活性化関数における $L_p$ ノルムの順序 $p$ を学習することで、固定 $p$ 値と比較して、ディープニューラルネットワークの一般化性能が向上するか?
  • RQ2$L_p$ ユニットの幾何的構造—超楕円的境界を定義すること—が、複雑な非線形意思決定面のモデリングをどのように向上させるか?
  • RQ3フィードフォワードおよび再帰的アーキテクチャの両方において、$L_p$ ユニットが ReLU やシグモイドなどの従来の活性化関数を上回る性能を示すか?
  • RQ4最適な $p$ 値はデータセットおよび層に依存するものか、それともすべてのユニットで一様に収束するか?
  • RQ5$L_p$ ユニットは再帰的ネットワークに効果的に統合可能で、系列モデリング性能を向上させられるか?

主な発見

  • $L_p$ ユニットは、それぞれ $p = \infty$、$p = 1$、$p = 2$ の場合に max、平均、RMS プーリングが特別なケースとして現れ、非負の入力下ではマックスアウトユニットと密接に関連している。
  • 実験的結果から、$L_p$ ユニットはフィードフォワードネットワークにおいて MNIST、トロント顔データベース、ペントミノ、フォレストカバータイプのデータセットで最先端の性能を達成した。
  • ポリフォニック音楽予測タスクでは、$L_p$ ベースの DOT-RNN が、ネガティブ・ログプローブ能力として 2.95(ノッティンガム)、7.92(JSB)、6.59(MuseData)を達成し、シグモイドベースの RNN や既存の最良結果を上回った。
  • ハイパーパramータ探索の結果、推定された $p$ 値はデータセットや層ごとに顕著に異なることが判明し、平均値は 2.00 から 2.02 の範囲にあり、標準偏差は $0.24 \times 10^{-4}$ から $1.50 \times 10^{-4}$ の間で推移しており、$p$ の非自明な学習済み分布が存在することが示された。
  • ReLU や他のピースワイズ線形代替手法と比較して、$L_p$ ユニットは曲がった意思決定境界のモデリングがより効率的であることが実証された。特に、少ないユニット数で非定常な曲率を捉える能力がある。
  • RNN における $L_p$ ユニットとシグモイドユニットの比較で、テストログプローブ能力が低く抑えられたことから、$L_p$ ユニットが系列モデリングタスクにおいて有効であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。