[论文解读] Exact Gap between Generalization Error and Uniform Convergence in Random Feature Models
本文提供了对非线性随机特征模型中泛化误差与统一收敛界之间差距的首个精确渐近分析。它推导出经典统一收敛、仅在插值函数上的统一收敛,以及最小范数插值器风险的精确表达式,表明尽管在噪声环境下经典界可能变得无意义,但对插值器的统一收敛仍保持非无意义且能紧密控制测试误差。
Recent work showed that there could be a large gap between the classical uniform convergence bound and the actual test error of zero-training-error predictors (interpolators) such as deep neural networks. To better understand this gap, we study the uniform convergence in the nonlinear random feature model and perform a precise theoretical analysis on how uniform convergence depends on the sample size and the number of parameters. We derive and prove analytical expressions for three quantities in this model: 1) classical uniform convergence over norm balls, 2) uniform convergence over interpolators in the norm ball (recently proposed by Zhou et al. (2020)), and 3) the risk of minimum norm interpolator. We show that, in the setting where the classical uniform convergence bound is vacuous (diverges to $\infty$), uniform convergence over the interpolators still gives a non-trivial bound of the test error of interpolating solutions. We also showcase a different setting where classical uniform convergence bound is non-vacuous, but uniform convergence over interpolators can give an improved sample complexity guarantee. Our result provides a first exact comparison between the test errors and uniform convergence bounds for interpolators beyond simple linear models.
研究动机与目标
- 解决过参数化模型中经典统一收敛界与实际泛化误差之间的差异。
- 分析统一收敛在非线性随机特征模型中插值解上的具体行为。
- 将经典统一收敛在范数球上的结果与仅限制在插值器上的改进版本进行比较。
- 量化高维设置下泛化误差与统一收敛界的确切渐近行为。
- 建立一个精确的理论框架,以理解在线性模型之外的插值区域中的泛化。
提出的方法
- 利用高维随机矩阵理论,推导出在半径为√A的范数球上经典统一收敛的精确渐近表达式。
- 引入并分析仅在相同范数球内插值函数上的改进统一收敛界,该方法由Zhou等人(2020)提出。
- 利用Mei与Montanari(2019)的结果,在高维极限下计算最小范数插值器的风险。
- 使用Gegenbauer多项式和Hermite多项式表示激活函数,并分析随机特征核的谱结构。
- 在n,d→∞且ψ₁=n/d与ψ₂=N/d保持固定的极限下,建立经验量向其渐近对应量的收敛性。
- 在球谐函数空间中应用正交分解,推导出三个关键量𝒰、𝒯和𝒓的精确表达式。
实验结果
研究问题
- RQ1当模型插值训练数据且存在标签噪声时,经典统一收敛行为如何?
- RQ2当经典统一收敛变得无意义时,对插值器的统一收敛是否能提供对泛化误差的非无意义界?
- RQ3最小范数插值器的泛化误差与对插值器的统一收敛界之间的确切关系是什么?
- RQ4经典与插值器受限的统一收敛框架在泛化样本复杂度上有什么不同?
- RQ5在何种参数范围内,对插值器的改进统一收敛界在样本复杂度上优于经典界?
主要发现
- 在噪声环境中(τ² > 0),经典统一收敛𝒰随√ψ₂增长并变得无意义,而对插值器的统一收敛𝒯保持有界并收敛于常数。
- 在噪声环境中,最小范数插值器的泛化误差𝒓随ψ₂⁻¹衰减,而过剩风险𝒓 − τ²也随ψ₂⁻¹衰减。
- 在无噪声环境(τ² = 0)下,泛化误差𝒓随ψ₂⁻²衰减,且过剩风险𝒓 − τ²的衰减速度快于ψ₂⁻¹。
- 在无噪声环境中,经典统一收敛𝒰随ψ₂⁻¹/²衰减,而对插值器的统一收敛𝒯也随ψ₂⁻¹/²衰减,表明其在样本复杂度上优于经典界。
- 在噪声设置下,经典统一收敛与实际泛化误差之间的差距较大,但对插值器的改进界仍保持紧密且非无意义。
- 𝒰、𝒯和𝒓的渐近表达式以ψ₁ = N/d和ψ₂ = n/d表示,并在高维极限下被证明具有集中性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。