Skip to main content
QUICK REVIEW

[论文解读] On the Generalization Properties of Minimum-norm Solutions for Over-parameterized Neural Network Models.

E Weinan, Chao Ma|arXiv (Cornell University)|Dec 15, 2019
Neural Networks and Applications参考文献 13被引用 12
一句话总结

该论文证明,在过参数化的神经网络模型中——具体为随机特征、两层神经网络和残差网络架构——最小范数解的泛化误差可达到与蒙特卡洛率相当的水平,最多存在对数因子的差异,前提是模型充分过参数化。该结果表明,即使没有显式正则化,仅依靠最小范数的归纳偏置,也能实现优异的泛化性能。

ABSTRACT

We study the generalization properties of minimum-norm solutions for three over-parametrized machine learning models including the random feature model, the two-layer neural network model and the residual network model. We proved that for all three models, the generalization error for the minimum-norm solution is comparable to the Monte Carlo rate, up to some logarithmic terms, as long as the models are sufficiently over-parametrized.

研究动机与目标

  • 理解过参数化机器学习模型中最小范数解的泛化行为。
  • 分析尽管模型容量高,此类解是否能实现有利的泛化误差率。
  • 为三种关键过参数化模型(随机特征、两层神经网络和残差网络)建立泛化性能的理论保证。
  • 证明在充分过参数化条件下,泛化误差的尺度可与蒙特卡洛率相媲美。

提出的方法

  • 分析三种过参数化模型(随机特征、两层神经网络和残差网络)中最小范数解的泛化误差。
  • 利用统计学习理论,以模型的过参数化程度为依据,对泛化误差进行上界估计。
  • 推导出与参数数量倒数成比例的误差界,最多存在对数因子。
  • 应用浓度不等式和随机矩阵理论,控制经验风险与真实风险之间的偏差。
  • 利用过参数化设置下最小范数解的隐式正则化效应。
  • 建立泛化误差的上界,其量级与蒙特卡洛率相当,最多存在对数因子。

实验结果

研究问题

  • RQ1过参数化的神经网络中,最小范数解是否能达到与蒙特卡洛率相当的泛化误差?
  • RQ2过参数化如何影响不同神经网络架构中最小范数解的泛化性能?
  • RQ3在随机特征和残差网络的背景下,最小范数解的隐式正则化能否在理论上得到解释?
  • RQ4过参数化模型中,泛化误差对参数数量的依赖关系如何?
  • RQ5最小范数解的泛化性能在不同过参数化架构中是否具有鲁棒性?

主要发现

  • 在所有三种模型——随机特征、两层神经网络和残差网络中,最小范数解的泛化误差均被一个与蒙特卡洛率相当的项所界定。
  • 泛化误差的尺度为 O(1/√n),最多存在对数因子,其中 n 为训练样本数量。
  • 该界在充分过参数化条件下成立,即参数数量超过样本数量的多项式因子。
  • 该结果无需显式正则化,表明最小范数解隐式控制了泛化误差。
  • 理论分析证实,最小范数解在过参数化设置下实现了近似最优的泛化性能。
  • 误差界中的对数因子在当前分析框架下不可避免,但在高维情形下不会显著降低性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。