Skip to main content
QUICK REVIEW

[論文レビュー] Adjusting for Dropout Variance in Batch Normalization and Weight Initialization

Dan Hendrycks, Kevin Gimpel|arXiv (Cornell University)|Jul 8, 2016
Advanced Neural Network Applications参考文献 13被引用数 15
ひとこと要約

本稿では、ドロップアウトに起因する分散のズレを是正するため、ドロップアウト率および非線形関数固有の要因を初期化スケールに組み込むことで、新たな重み初期化手法を提案する。さらに、トレーニング後のバッチ正規化の分散再推定手法を導入している。これらの補正を適用することで、データ拡張なしにCIFAR-10およびCIFAR-100で最先端の精度を達成し、ドロップアウトを適用したネットワークにおける収束性と安定性の向上を示している。

ABSTRACT

We show how to adjust for the variance introduced by dropout with corrections to weight initialization and Batch Normalization, yielding higher accuracy. Though dropout can preserve the expected input to a neuron between train and test, the variance of the input differs. We thus propose a new weight initialization by correcting for the influence of dropout rates and an arbitrary nonlinearity's influence on variance through simple corrective scalars. Since Batch Normalization trained with dropout estimates the variance of a layer's incoming distribution with some inputs dropped, the variance also differs between train and test. After training a network with Batch Normalization and dropout, we simply update Batch Normalization's variance moving averages with dropout off and obtain state of the art on CIFAR-10 and CIFAR-100 without data augmentation.

研究の動機と目的

  • ドロップアウトによって引き起こされる分散の不一致がニューラルネットワークのトレーニングに与える影響、特に重み初期化およびバッチ正規化に及ぼす影響を是正すること。
  • バッチ統計や特別な順方向パスを必要とせず、ドロップアウト率および非線形関数の圧縮性を考慮した、シンプルで効率的な重み初期化手法を開発すること。
  • ドロップアウトを用いてトレーニングした際のバッチ正規化の移動分散推定値と、ドロップアウトなしの推論時の乖離を是正すること。
  • ドロップアウト正則化下での全結合層および畳み込み層のネットワークにおけるトレーニングの安定性とテスト精度の向上を図ること。
  • データ拡張なしに、CIFAR-10やCIFAR-100といった標準ベンチマークで最先端の性能を達成すること。

提案手法

  • 新しい重み初期化スケーリング要因の提案:$ W^{l} / \sqrt{ \mathbb{E}[f(z^{l-1})^2]/p + p\mathbb{E}[f'(z^l)^2] } $、ここで $ p $ はドロップアウトの維持率、$ f $ は活性化関数。
  • ドロップアウト下での入力分布および勾配分布の安定化のため、順方向および逆方向パスの分散補正を導出する。
  • トレーニング後に、ドロップアウトをオフにして訓練データを順方向に通し、ランニング統計を更新することで、バッチ正規化の移動分散を再推定する後処理手順を導入する。
  • 全結合ネットワークおよびDenseNetsにこの手法を適用し、アーキテクチャを問わず一貫した改善を示している。
  • 実証的推定が得られない場合の非線形関数の圧縮性に、デフォルトで0.5の補正係数を用いる。これはXavierおよびHe初期化と関連付ける。
  • バッチ統計や特別な順方向パスを避けるために、単位超球上での重み初期化に補正スケーリングを適用する。

実験結果

リサーチクエスチョン

  • RQ1ドロップアウトはニューロンの入力および勾配の分散にどのように影響するか。また、これは重み初期化で是正可能か。
  • RQ2バッチ統計に依存せず、反復的でないシンプルな重み初期化手法が、ドロップアウト下でもトレーニングを安定化させられるか。
  • RQ3なぜドロップアウトでトレーニングしたバッチ正規化は、一般化性能に欠けるのか。また、その分散推定値はトレーニング後にどのように是正できるか。
  • RQ4トレーニング後のバッチ正規化の移動分散の再推定は、標準的なビジョンベンチマークでのテスト誤差を改善するか。
  • RQ5順方向および逆方向パスの両方の分散を考慮した統一された初期化スキームは、ドロップアウト下で収束性および精度の向上をもたらすか。

主な発見

  • ドロップアウト補正付きの提案初期化により、20層の全結合ネットワークにおいても、さまざまなドロップアウト率下でも層間で安定した入力分散を達成した。
  • ドロップアウトを適用した際、XavierおよびHe初期化を上回る安定性を示し、発散または消失する活性化を防いだ。
  • ドロップアウトをオフにして訓練データを順方向に通し、ランニング統計を更新することで、バッチ正規化の移動分散を再推定した結果、CIFAR-10のテスト誤差が5.62%から5.38%に改善した。
  • CIFAR-100では、データ拡張なしにテスト誤差を23.65%から22.17%に低減し、最先端の性能を達成した。
  • 一部の設定では、精度が2%以上向上した。これは、高正則化状態下でも顕著な向上を示している。
  • この手法は、アーキテクチャの変更や推論時の追加計算を必要とせず、DenseNetsなどさまざまなアーキテクチャに一般化して有効である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。