Skip to main content
QUICK REVIEW

[論文レビュー] Dropout: Explicit Forms and Capacity Control

Raman Arora, Peter L. Bartlett|arXiv (Cornell University)|Mar 6, 2020
Stochastic Gradient Optimization Techniques参考文献 44被引用数 12
ひとこと要約

本稿では、行列補完と2層ReLUネットワークにおけるドロップアウトが誘導する正則化項の明示的形を提示し、ドロップアウトがデータに依存する容量制御メカニズムとして機能することを示している。一般化境界は、行列補完では重み付きトレースノルムに比例し、深層ネットワークでは$α/\sqrt{n}$型の複雑さ測度に比例する。これらの境界は、MovieLens、MNIST、Fashion-MNISTデータセット上で実証的に検証された。

ABSTRACT

We investigate the capacity control provided by dropout in various machine learning problems. First, we study dropout for matrix completion, where it induces a data-dependent regularizer that, in expectation, equals the weighted trace-norm of the product of the factors. In deep learning, we show that the data-dependent regularizer due to dropout directly controls the Rademacher complexity of the underlying class of deep neural networks. These developments enable us to give concrete generalization error bounds for the dropout algorithm in both matrix completion as well as training deep neural networks. We evaluate our theoretical findings on real-world datasets, including MovieLens, MNIST, and Fashion-MNIST.

研究の動機と目的

  • ドロップアウトが行列補完と深層ニューラルネットワークにおいて誘導する明示的正則化項を理解すること。
  • ドロップアウトをデータに依存する容量制御に結びつけることで、理論的一般化境界を確立すること。
  • MovieLens、MNIST、Fashion-MNISTを含む実世界のデータセット上で理論的知見を実証的に検証すること。
  • ドロップアウトが共適応を防ぎ、モデルの複雑さをどのように制御するかのメカニズムを明確にすること。
  • 因子分解モデルおよび深層ネットワークにおけるドロップアウトの明確な、データに依存する一般化境界を提供することで、先行研究を拡張すること。

提案手法

  • 行列補完におけるドロップアウトが誘導する正則化項の明示的形を、因子積のデータに依存する重み付きトレースノルムとして導出する。
  • 2層ReLUネットワークにおいて、ドロップアウトが誘導する正則化項が、Neyshaburら(2015a)の$Ø$-パスノルムに類似したデータに依存する$β$-パスノルムに対応することを示す。
  • ラデマッハ複雑度を用いて、行列補完および深層ネットワークの両方の一般化境界を確立し、境界が$O\left(\sqrt{\frac{\texttt{width} \cdot R(\mathbf{w})}{n}}\right)$に比例することを示す。
  • 対称化と経験的リスク最小化を用いて、実験的に複雑さ測度$\alpha/\sqrt{n}$を導出し、検証する。
  • さまざまなネットワーク幅とドロップアウト率において、導出された複雑さ測度と一般化ギャップの関係を実証的に評価する。
  • 深層畳み込みネットワークに導出された正則化項を適用する際、トップ層の正則化項を$R(\mathbf{w}) = \frac{p}{1-p} \sum_{i=1}^{\texttt{width}} \|\mathbf{u}_i\|^2 a_i^2$としてモデル化する。ここで、$a_i^2 = \mathbb{E}_\mathbf{x}[\texttt{feature}_i(\mathbf{x})^2]$である。

実験結果

リサーチクエスチョン

  • RQ1行列補完問題において、ドロップアウトはどのような明示的正則化項を誘導するか?
  • RQ22層ReLUネットワークにおいて、ドロップアウトはラデマッハ複雑度をどのように制御するか?
  • RQ3データに依存する複雑さ測度を用いて、ドロップアウト正則化モデルの一般化誤差を境界づけることができるか?
  • RQ4導出された正則化項は、広いネットワークにおける一般化ギャップと共適応の両者とどのように相関するか?
  • RQ5実データセット上の実証的結果は、理論的一般化境界をどの程度確認するか?

主な発見

  • 行列補完において、ドロップアウトは期待値において因子積の重み付きトレースノルムと等価なデータに依存する正則化項を誘導し、強い一般化保証を提供する。
  • 2層ReLUネットワークにおいて、ドロップアウトが誘導する正則化項は、データに依存する$\ell_2$-パスノルムとして機能し、正確な一般化境界を可能にする。
  • 一般化誤差の境界は$O\left(\sqrt{\frac{\texttt{width} \cdot R(\mathbf{w})}{n}}\right)$に比例する。ここで$R(\mathbf{w})$はドロップアウト下でのモデルの複雑さを捉えている。
  • MNIST、Fashion-MNIST、MovieLensにおける実証的結果から、複雑さ測度$\alpha/\sqrt{n}$の値が低いほど一般化ギャップが小さくなることが確認された。
  • ドロップアウト率を増加させることで共適応と一般化ギャップが減少し、ドロップアウトで訓練された広いネットワークは、共適応レベルが低い方向に収束することが示された。
  • 導出された正則化項は、トップ層にのみ適用された場合でも深層ネットワークで有効であり、一般化ギャップは複雑さ測度$\sqrt{\frac{\texttt{width} \cdot R(\mathbf{w})}{n}}$と強く相関していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。