Skip to main content
QUICK REVIEW

[论文解读] Dropout: Explicit Forms and Capacity Control

Raman Arora, Peter L. Bartlett|arXiv (Cornell University)|Mar 6, 2020
Stochastic Gradient Optimization Techniques参考文献 44被引用 12
一句话总结

本文推导了在矩阵补全和两层ReLU网络中,dropout所诱导的显式正则化项,表明dropout作为一种数据相关的容量控制机制发挥作用。研究建立了与加权迹范数(矩阵补全)和 $\alpha/\sqrt{n}$ 类型复杂度度量(深度网络)成比例的一般化边界,并在MovieLens、MNIST和Fashion-MNIST数据集上进行了实证验证。

ABSTRACT

We investigate the capacity control provided by dropout in various machine learning problems. First, we study dropout for matrix completion, where it induces a data-dependent regularizer that, in expectation, equals the weighted trace-norm of the product of the factors. In deep learning, we show that the data-dependent regularizer due to dropout directly controls the Rademacher complexity of the underlying class of deep neural networks. These developments enable us to give concrete generalization error bounds for the dropout algorithm in both matrix completion as well as training deep neural networks. We evaluate our theoretical findings on real-world datasets, including MovieLens, MNIST, and Fashion-MNIST.

研究动机与目标

  • 理解dropout在矩阵补全和深度神经网络中所诱导的显式正则化项。
  • 通过将dropout与数据相关的容量控制相联系,建立理论一般化边界。
  • 在包括MovieLens、MNIST和Fashion-MNIST在内的真实世界数据集上,对理论发现进行实证验证。
  • 阐明dropout如何通过防止神经元共适应来控制模型复杂度的机制。
  • 通过为因子化模型和深度网络中的dropout提供精确的数据相关一般化边界,拓展了先前的工作。

提出的方法

  • 推导了在矩阵补全中,dropout所诱导的正则化项的显式形式,其为因子乘积的、与数据相关的加权迹范数。
  • 表明在两层ReLU网络中,dropout所诱导的正则化项对应于一种与数据相关的 $\beta$-路径范数,类似于Neyshabur等人(2015a)提出的 $\emptyset$-路径范数。
  • 利用Rademacher复杂度,为矩阵补全和深度网络建立了泛化边界,边界大小为 $O\left(\sqrt{\frac{\texttt{width} \cdot R(\mathbf{w})}{n}}\right)$。
  • 通过对称化和经验风险最小化,推导并实证验证了复杂度度量 $\alpha/\sqrt{n}$。
  • 在不同网络宽度和dropout率下,实证评估了所推导的复杂度度量与泛化差距之间的关联。
  • 通过将顶层正则化项建模为 $R(\mathbf{w}) = \frac{p}{1-p} \sum_{i=1}^{\texttt{width}} \|\mathbf{u}_i\|^2 a_i^2$,其中 $a_i^2 = \mathbb{E}_\mathbf{x}[\texttt{feature}_i(\mathbf{x})^2]$,将所推导的正则化项应用于深度卷积网络。

实验结果

研究问题

  • RQ1在矩阵补全问题中,dropout诱导出何种显式正则化项?
  • RQ2dropout如何控制两层ReLU网络中的Rademacher复杂度?
  • RQ3能否使用数据相关的复杂度度量来界定dropout正则化模型的泛化误差?
  • RQ4所推导的正则化项与宽网络中泛化差距和共适应之间的相关性如何?
  • RQ5在真实数据集上的实证结果在多大程度上验证了理论一般化边界?

主要发现

  • 在矩阵补全中,dropout诱导出一种在期望下等价于因子乘积加权迹范数的数据相关正则化项,提供了强有力的泛化保证。
  • 对于两层ReLU网络,dropout诱导的正则化项表现为一种数据相关的 $\ell_2$-路径范数,从而实现了精确的泛化边界。
  • 泛化误差边界大小为 $O\left(\sqrt{\frac{\texttt{width} \cdot R(\mathbf{w})}{n}}\right)$,其中 $R(\mathbf{w})$ 捕捉了在dropout下的模型复杂度。
  • 在MNIST、Fashion-MNIST和MovieLens上的实证结果表明,复杂度度量 $\alpha/\sqrt{n}$ 的值越低,泛化差距越小。
  • 提高dropout率可降低共适应和泛化差距,且在dropout下训练的更宽网络会收敛到更低的共适应水平。
  • 即使仅在顶层应用该正则化项,其在深度网络中依然有效,且泛化差距与复杂度度量 $\sqrt{\frac{\texttt{width} \cdot R(\mathbf{w})}{n}}$ 强烈相关。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。