Skip to main content
QUICK REVIEW

[論文レビュー] Projection Based Weight Normalization for Deep Neural Networks

Lei Huang, Xianglong Liu|arXiv (Cornell University)|Oct 6, 2017
Advanced Neural Network Applications参考文献 32被引用数 14
ひとこと要約

この論文では、各ニューロンの入力重みを直交多様体上への射影によって単位ノルムに制約する、射影ベース重み正則化(PBWN)を提案する。これにより、深層ニューラルネットワークにおける最適化の安定性と性能が向上する。PBWNは一般化性能を向上させ、バッチ正則化と良好に統合され、計算コストの増加が最小限であるにもかかわらず、CIFAR-10、CIFAR-100、SVHN、ImageNet、および半教師ありLadderネットワークにおいて、先行手法を上回る性能を発揮する。

ABSTRACT

Optimizing deep neural networks (DNNs) often suffers from the ill-conditioned problem. We observe that the scaling-based weight space symmetry property in rectified nonlinear network will cause this negative effect. Therefore, we propose to constrain the incoming weights of each neuron to be unit-norm, which is formulated as an optimization problem over Oblique manifold. A simple yet efficient method referred to as projection based weight normalization (PBWN) is also developed to solve this problem. PBWN executes standard gradient updates, followed by projecting the updated weight back to Oblique manifold. This proposed method has the property of regularization and collaborates well with the commonly used batch normalization technique. We conduct comprehensive experiments on several widely-used image datasets including CIFAR-10, CIFAR-100, SVHN and ImageNet for supervised learning over the state-of-the-art convolutional neural networks, such as Inception, VGG and residual networks. The results show that our method is able to improve the performance of DNNs with different architectures consistently. We also apply our method to Ladder network for semi-supervised learning on permutation invariant MNIST dataset, and our method outperforms the state-of-the-art methods: we obtain test errors as 2.52%, 1.06%, and 0.91% with only 20, 50, and 100 labeled samples, respectively.

研究の動機と目的

  • スケーリングに基づく重み空間の対称性が原因で生じる、深層ニューラルネットワーク最適化における悪条件問題を解消すること。
  • 入力重みを単位ノルムに制約することで、最適化の安定性と一般化性能を向上させ、ヘッセ行列の条件数を改善すること。
  • バッチ正則化とシームレスに統合できる、データに依存しない効率的な重み正則化手法を開発すること。
  • 教師ありおよび半教師あり学習の両設定において、多様なアーキテクチャとデータセットで一貫した性能向上を示すこと。

提案手法

  • 本手法は、各ニューロンの入力重みベクトルを単位ノルムに制約する直交多様体上での制約付き最適化問題として重み最適化を定式化する。
  • 2段階の更新を採用する:標準的な確率的勾配降下法の実行後、更新された重みを再び直交多様体上に射影する。
  • 射影により、各更新後に入力重みベクトルが常に単位ノルムを維持され、正則化効果が保持される。
  • 本手法は、動的正則化係数を備えた適応的重み減衰の役割を内蔵しており、最適化の安定性を向上させる。
  • バッチ正則化と互換性があり、勾配クリッピングや特別なモーメンタム調整を必要としない。
  • 計算コストが低く、標準的な学習と比較してほとんど追加コストがない。

実験結果

リサーチクエスチョン

  • RQ1ReLUネットワークにおけるスケーリングに基づく重み空間の対称性が原因で生じる悪条件問題を、入力重みを単位ノルムに制約することで軽減できるか?
  • RQ2重み減衰、最大ノルム、バッチ正則化といった既存の正則化手法と比較して、射影ベース重み正則化(PBWN)は、一般化性能および最適化の安定性において優れているか?
  • RQ3アーキテクチャやハイパーパramータの変更なしに、多様な深層学習アーキテクチャでPBWNが性能向上をもたらすか?
  • RQ4特にラベル付きデータが限られた状況において、PBWNは半教師あり学習設定で性能を向上させるか?
  • RQ5PBWNとバッチ正則化の相互作用は何か?また、相乗効果をもたらすか?

主な発見

  • PBWNは、Inception、VGG、残差ネットワークを含む、複数の最先端アーキテクチャにおいて、CIFAR-10、CIFAR-100、SVHN、ImageNetでテスト精度を向上させた。
  • 置換不変MNISTデータセットでは、ラベル付きサンプルがそれぞれ20、50、100個のとき、テスト誤差が2.52%、1.06%、0.91%にまで低下し、最先端の半教師あり手法を上回った。
  • 計算コストの増加がほとんどないため、大規模学習において実用的である。
  • PBWNは、重み減衰と同様に適応的正則化を内蔵しているが、ヘッセ行列の条件数が改善されている。
  • バッチ正則化と良好に統合され、追加のハイパーパramータチューニングや勾配クリッピングを必要としない。
  • 実験的結果から、PBWNは有効性と計算効率の両面で重み正則化を上回っていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。