[论文解读] On Uniform Convergence and Low-Norm Interpolation Learning
本文研究了统一收敛性论证是否能够解释高维线性回归中低范数插值预测器的泛化性能。研究表明,标准的范数球上统一收敛性无法解释一致性,但提出了一个改进的观念——范数球内零误差预测器的统一收敛性,该观念成功界定了泛化误差,并通过强对偶性和渐近分析解释了最小范数插值器的一致性。
We consider an underdetermined noisy linear regression model where the minimum-norm interpolating predictor is known to be consistent, and ask: can uniform convergence in a norm ball, or at least (following Nagarajan and Kolter) the subset of a norm ball that the algorithm selects on a typical input set, explain this success? We show that uniformly bounding the difference between empirical and population errors cannot show any learning in the norm ball, and cannot show consistency for any set, even one depending on the exact algorithm and distribution. But we argue we can explain the consistency of the minimal-norm interpolator with a slightly weaker, yet standard, notion: uniform convergence of zero-error predictors in a norm ball. We use this to bound the generalization error of low- (but not minimal-) norm interpolating predictors.
研究动机与目标
- 确定在过参数化线性回归中,范数球上的统一收敛性是否能够解释最小范数插值器的一致性。
- 评估标准统一收敛性论证在解释高维设置下插值学习时的局限性。
- 提出并分析一种更弱但有效的统一收敛性观念——范数球内零误差预测器的统一收敛性,以解释插值范式下的泛化性能。
- 利用强对偶性和随机矩阵理论,刻画给定范数下插值预测器的渐近最坏情况泛化差距。
提出的方法
- 分析一个具有 i.i.d. 高斯协变量和独立噪声的高维线性回归模型,其中真实信号仅依赖于部分特征。
- 考虑最小范数插值器(无正则化回归),并在维度和噪声的特定渐近尺度下建立其一致性。
- 提出一种新颖的统一收敛性框架,聚焦于范数球内具有零经验误差的预测器,而非球内所有预测器。
- 利用强对偶性分析刻画最小范数插值器最坏情况泛化差距的非凸优化问题。
- 应用随机矩阵理论和渐近分析,推导在样本量和冗余特征数量联合极限下的期望泛化误差极限。
- 证明尽管在完整范数球上的统一收敛性不成立,但在零误差预测器上的统一收敛性成立,并成功解释了一致性。
实验结果
研究问题
- RQ1标准范数球上的统一收敛性能否解释高维线性回归中最小范数插值器的泛化性能?
- RQ2为何现有统一收敛性论证即使在预测器一致时也无法解释插值学习中的一致性?
- RQ3是否存在一种更弱的统一收敛性观念,能够成功解释低范数插值预测器的泛化性能?
- RQ4在此设定下,给定范数的插值预测器的渐近最坏情况泛化差距是什么?
- RQ5强对偶性是否可用于在非凸优化框架下刻画低范数插值器的泛化误差?
主要发现
- 即使存在算法和分布依赖性,标准范数球上的统一收敛性也无法解释最小范数插值器的学习或一致性。
- 范数球内零误差预测器的统一收敛性足以解释最小范数插值器的一致性,提供了一个更精细的理论框架。
- 通过强对偶性精确刻画了低范数插值器的渐近最坏情况泛化差距,表明低范数和插值特性对泛化均必不可少。
- 最小范数插值器的期望泛化误差在样本量和冗余特征数量的联合极限下收敛至贝叶斯风险,证实了一致性。
- 对于范数被限制为最小范数插值器 α 倍的预测器,最坏情况泛化误差收敛至 α² 倍的贝叶斯风险,建立了紧致界。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。