Skip to main content
QUICK REVIEW

[論文レビュー] Feature Incay for Representation Regularization

Yuhui Yuan, Kuiyuan Yang|arXiv (Cornell University)|May 29, 2017
Advanced Neural Network Applications参考文献 14被引用数 13
ひとこと要約

本稿では、深層ニューラルネットワークの特徴ベクトルのノルムを学習中に増大させるよう促す、特徴ノルムの増大(Feature incay)と呼ばれる新しい正則化手法を提案する。L2ノルムの逆数を最小化する(逆数ノルム損失)ことで、汎化性能が向上し、MNIST、CIFAR10、CIFAR100の各ベンチマークで、標準的なソフトマックスと大マージンソフトマックスを常に上回る精度とより大きな特徴ノルムを達成する。

ABSTRACT

Softmax loss is widely used in deep neural networks for multi-class classification, where each class is represented by a weight vector, a sample is represented as a feature vector, and the feature vector has the largest projection on the weight vector of the correct category when the model correctly classifies a sample. To ensure generalization, weight decay that shrinks the weight norm is often used as regularizer. Different from traditional learning algorithms where features are fixed and only weights are tunable, features are also tunable as representation learning in deep learning. Thus, we propose feature incay to also regularize representation learning, which favors feature vectors with large norm when the samples can be correctly classified. With the feature incay, feature vectors are further pushed away from the origin along the direction of their corresponding weight vectors, which achieves better inter-class separability. In addition, the proposed feature incay encourages intra-class compactness along the directions of weight vectors by increasing the small feature norm faster than the large ones. Empirical results on MNIST, CIFAR10 and CIFAR100 demonstrate feature incay can improve the generalization ability.

研究の動機と目的

  • 標準的なソフトマックス損失では特徴ノルムの最適化が不十分である問題に起因する、特徴ノルムの未利用化を是正すること。
  • 分類器の重みのみでなく、特徴表現自体を明示的に正則化することで、モデルの汎化性能を向上させること。
  • 正しく分類されたサンプルに対して大きな特徴ノルムを好む、新たなインダクティブバイアスを提案すること。
  • 特徴ノルムが表現学習において重要な役割を果たすことを理論的および実験的に裏付けること。
  • 特徴ノルムの増大が、大マージンソフトマックスやセンター損失といった既存手法と相乗効果をもたらすことを示すこと。

提案手法

  • 特徴ベクトルのL2ノルムの逆数を最小化する逆数ノルム損失を導入し、ノルムの増大を促進する。
  • ソフトマックスまたは大マージンソフトマックスと併せて特徴ノルムの増大を正則化として適用し、損失のバランスを調整するハイパーパrameter λ を用いる。
  • ノルムが小さい特徴に対しては、ノルムが大きい特徴よりも速やかにノルムを増大させるため、クラス内compactnessが向上する。
  • 特徴ノルムの増大は、それぞれの重みベクトルの方向に沿って原点から遠ざける働きをし、クラス間マージンを拡大する。
  • 損失関数は微分可能であり、標準的なバックプロパゲーションと互換性があるため、エンドツーエンドの学習が可能である。
  • 本手法は汎用的であり、センター損失や大マージン制約といった他の正則化手法とも組み合わせ可能である。

実験結果

リサーチクエスチョン

  • RQ1なぜ標準的なソフトマックス損失は、正しく分類されたサンプルに対しても特徴ノルムを最適化しないのか?
  • RQ2特徴ノルムを増大させることで、深層ニューラルネットワークにおける汎化性能がどのように向上するのか?
  • RQ3大きな特徴ノルムを促す正則化手法が、同時にクラス間分離性とクラス内compactnessを向上させることができるか?
  • RQ4特徴ノルムの増大は、重み減衰や他の正則化手法と比較して、表現学習においてどのように機能するか?
  • RQ5大マージンソフトマックスと組み合わせた場合の、特徴ノルムの増大の最適なハイパーパrameter設定は何か?

主な発見

  • 特徴ノルムの増大は、テストセットにおける特徴ベクトルの平均L2ノルムを顕著に増大させ、λ=0.1のときRN+SoftmaxはCIFAR10で92.04%のトップ-1精度を達成した。
  • CIFAR100では、RN+L-Softmaxが29.18%の誤差率を示し、L-Softmax(29.53%)を0.37%改善し、一貫した性能向上を示した。
  • テスト損失は、ソフトマックスの0.1498からRN+Softmaxの0.1432に低下し、より良い汎化性能を示している。
  • 小さなλ値でさえも、L-Softmaxの性能を向上させ、ハイパーパrameter選択に対して高いロバストネスを示した。
  • 逆数ノルム損失は、ノルムが小さい特徴に対しては、ノルムが大きい特徴よりも速くノルムを増大させるため、クラス内分散が低減した。
  • 実験的結果から、特徴ノルムの増大は、MNIST、CIFAR10、CIFAR100のすべてのデータセットで汎化性能を向上させることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。