Skip to main content
QUICK REVIEW

[論文レビュー] Regularizing activations in neural networks via distribution matching with the Wasserstein metric

Taejong Joo, Donggu Kang|arXiv (Cornell University)|Feb 13, 2020
Advanced Neural Network Applications参考文献 56被引用数 8
ひとこと要約

本稿では、1- Wasserstein 距離の上界を最小化することで、ニューラルネットワークの活性化を正則化する新規手法である Projected Error Function Regularization (PER) を提案する。活性化をランダムな1次元方向に射影し、Pseudo-Huberに類似した損失関数を適用することで、高次の統計量とユニット間相関を捉え、追加のパラメータやアーキテクチャの変更なしに、訓練の安定性と一般化性能の向上を実現する。

ABSTRACT

Regularization and normalization have become indispensable components in training deep neural networks, resulting in faster training and improved generalization performance. We propose the projected error function regularization loss (PER) that encourages activations to follow the standard normal distribution. PER randomly projects activations onto one-dimensional space and computes the regularization loss in the projected space. PER is similar to the Pseudo-Huber loss in the projected space, thus taking advantage of both $L^1$ and $L^2$ regularization losses. Besides, PER can capture the interaction between hidden units by projection vector drawn from a unit sphere. By doing so, PER minimizes the upper bound of the Wasserstein distance of order one between an empirical distribution of activations and the standard normal distribution. To the best of the authors' knowledge, this is the first work to regularize activations via distribution matching in the probability distribution space. We evaluate the proposed method on the image classification task and the word-level language modeling task.

研究の動機と目的

  • 深層ネットワークの訓練中に生じる活性化分布の不安定性が収束性や一般化性能を妨げることを是正すること。
  • 従来の方法が第一および第二モーメント(平均と分散)にのみ正則化を施すという制限を克服し、高次のモーメントとユニット間相関を捉えること。
  • 理論的に整合性があり、ロバストな距離測度としてのWasserstein距離を用いた、確率分布空間における正則化の可能性を検討すること。
  • 追加パラメータを必要とせず、アーキテクチャに依存しない正則化手法を構築し、多様なタスクにおいて訓練の安定性とモデル性能を向上させること。

提案手法

  • 各層の活性化を、単位球面上から抽出されたランダムな1次元方向に射影し、次元を低くすることで分布解析を可能にする。
  • 射影空間にPseudo-Huber損失を適用し、L1とL2正則化の両方の利点を兼ね備えた滑らかで外れ値に対してロバストな正則化を実現する。
  • 活性化の経験的分布と標準正規分布 N(0, I) 間の1-Wasserstein距離の上界を最小化する。
  • ランダム射影のモンテカルロサンプリングを用いて、スライスド・Wasserstein距離の近似を効率的に推定する。
  • 射影された活性化とそのターゲットとなるガウス分布からの逸脱を関数として定式化した正則化損失を構築する。
  • 学習可能なパラメータを避けて微分可能であることを保ち、標準的な訓練パイプラインと互換性を持つ計算効率の高い手法を実現する。

実験結果

リサーチクエスチョン

  • RQ1平均や分散だけでなく、活性化の全分布を正則化することで、深層ニューラルネットワークにおける訓練の安定性と一般化性能が向上するか。
  • RQ2Wasserstein距離を用いた分布マッチングは、従来の正規化や正則化手法に比べ、性能とロバステネスにおいて優れているか。
  • RQ3明示的な正規化層やバッチ統計量を用いずに、PERは訓練中における活性化分布の安定化をどの程度実現できるか。
  • RQ4ランダム射影とPseudo-Huber損失を用いることで、隠れ表現におけるユニット間相関と高次統計量が効果的に捉えられるか。
  • RQ5アーキテクチャの変更なしに、画像分類や言語モデリングといった多様なタスクにPERを効果的に適用できるか。

主な発見

  • PERは訓練全体を通じて活性化の分布を著しく安定化させ、特に初期訓練段階での平均と分散のずれを防ぐ。
  • PERを用いることで、vanillaモデルやバッチ正規化(BN)のベースラインと比較して、活性化分布と標準正規分布 N(0, I) 間の1-Wasserstein距離が一貫して低くなる。
  • 画像分類(CIFAR-10, CIFAR-100)およびワードレベル言語モデリング(WikiText-2)のタスクにおいて、テスト精度にわずかだが一貫した向上が見られる。
  • 訓練時間はやや増加(1イテレーションあたり0.093秒 vs. vanillaの0.071秒)するが、追加パラメータは一切不要で、標準的な訓練パイプラインと互換性がある。
  • 解析の結果、PERは高次統計量とユニット間相関を効果的に制御しており、分布のずれが低減され、収束が早くなることが裏付けられている。
  • バッチ正規化や明示的なモーメント制御がなくても、PERはN(0, I)に近い活性化分布を維持する点で、BN や VCL を上回る性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。