QUICK REVIEW
[论文解读] Over-parametrized deep neural networks do not generalize well
Michael Köhler, Adam Krzyżak|arXiv (Cornell University)|Dec 9, 2019
Sparse and Compressive Sensing Techniques参考文献 21被引用 9
一句话总结
本文证明,即使在达到零训练误差的情况下,具有Sigmoid激活函数的过参数化深度神经网络在非参数回归中仍无法实现良好的泛化性能。研究建立了下界,表明这些网络无法达到平滑回归函数的最优极小极大收敛速率,从而挑战了‘过参数化意味着良好泛化’的普遍假设。
ABSTRACT
Recently it was shown in several papers that backpropagation is able to find the global minimum of the empirical risk on the training data using over-parametrized deep neural networks. In this paper a similar result is shown for deep neural networks with the sigmoidal squasher activation function in a regression setting, and a lower bound is presented which proves that these networks do not generalize well on a new data in the sense that they do not achieve the optimal minimax rate of convergence for estimation of smooth regression functions.
研究动机与目标
- 研究过参数化深度神经网络在非参数回归中是否能实现最优泛化性能。
- 分析在过参数化条件下,最小二乘神经网络估计的泛化误差。
- 建立此类网络收敛速率的理论下界,表明其无法达到极小极大最优速率。
- 挑战当前普遍认为过参数化可确保良好泛化性能的假设,即使训练误差被最小化。
提出的方法
- 研究采用随机设计的回归框架,其中回归函数是平滑的,且误差有界。
- 定义了一个具有L个隐层和Sigmoid压缩激活函数的神经网络架构,权重通过最小二乘法最小化学习。
- 论文构建了一个特定的数据分布,包含n个不同的输入点,每个点的概率相等(1/n),并带有独立同分布的对称噪声(±1)。
- 定义了一个类似最近邻的估计器 $\bar{m}_n$ 作为比较基准,使用观测到的输入点处的经验均值。
- 通过将神经网络估计与 $\bar{m}_n$ 关联并利用集中不等式,推导出期望 $L_2$ 风险的下界。
- 证明利用了每个输入点被观测次数服从二项分布的事实,并通过逆占据计数的期望推导出该下界。
实验结果
研究问题
- RQ1过参数化深度神经网络在非参数回归中是否能实现最优极小极大收敛速率?
- RQ2反向传播能够最小化训练误差,是否意味着此类网络具有良好的泛化性能?
- RQ3在过参数化条件下,最小二乘神经网络估计的泛化误差是否存在根本性的下界?
- RQ4在期望 $L_2$ 风险方面,神经网络估计器与简单经验均值估计器相比表现如何?
- RQ5即使网络能完美拟合训练数据,过参数化网络的泛化性能是否存在理论极限?
主要发现
- 具有Sigmoid激活函数的过参数化深度神经网络无法实现良好泛化,因为它们无法达到平滑回归函数的最优极小极大收敛速率。
- 神经网络估计器的期望 $L_2$ 风险被一个不随n增大而消失的正的常数下界所限制,表明泛化性能差。
- 该下界通过将神经网络估计与基准经验均值估计器 $\bar{m}_n$ 比较得出,表明网络的误差无法显著更小。
- 分析表明,即使网络完美拟合训练数据(零训练误差),由于输入分布和噪声的结构,泛化误差仍与零保持有界距离。
- 该下界被定量证明至少为 $\frac{10}{11} \left(1 - \frac{21}{10e}\right)$(当 $n \geq 10$ 时),该值远离零,从而证明其次优性。
- 即使网络过参数化且能够插值训练数据,该结果依然成立,表明插值并不意味着良好泛化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。