Skip to main content
QUICK REVIEW

[论文解读] For interpolating kernel machines, minimizing the norm of the ERM solution minimizes stability

Akshay Rangamani, Lorenzo Rosasco|arXiv (Cornell University)|Jun 28, 2020
Sparse and Compressive Sensing Techniques参考文献 25被引用 4
一句话总结

本文证明,对于插值核机器,最小化经验风险最小化(ERM)解的范数可最小化交叉验证稳定性的一个上界,而该上界又控制了泛化误差。关键结果表明,最小范数插值解实现了最优的稳定性与风险上界,将过参数化设置下的条件数(核矩阵的条件数)与数值稳定性联系起来,实现了统计稳定性。

ABSTRACT

We study the average $\mbox{CV}_{loo}$ stability of kernel ridge-less regression and derive corresponding risk bounds. We show that the interpolating solution with minimum norm minimizes a bound on $\mbox{CV}_{loo}$ stability, which in turn is controlled by the condition number of the empirical kernel matrix. The latter can be characterized in the asymptotic regime where both the dimension and cardinality of the data go to infinity. Under the assumption of random kernel matrices, the corresponding test error should be expected to follow a double descent curve.

研究动机与目标

  • 理解在无正则化情况下完美拟合训练数据(即插值)的过参数化核方法中的泛化性能。
  • 通过基于稳定性的方法,刻画核最小二乘法中插值解的稳定性。
  • 证明在所有插值解中,最小范数解最小化了交叉验证稳定性的上界。
  • 建立经验核矩阵的条件数与数值稳定性和统计稳定性之间的联系。

提出的方法

  • 使用留一法交叉验证(CV_loo)稳定性作为度量,分析核最小二乘法中插值解的稳定性。
  • 推导出依赖于经验核矩阵条件数的 CV_loo 稳定性上界。
  • 利用矩阵不等式和随机矩阵理论,分析当样本量 n 和维度 d 同时趋于无穷大时核矩阵的渐近行为。
  • 表明最小范数解最小化了推导出的稳定性上界,意味着具有更优的泛化性能。
  • 将稳定性上界与核矩阵的伪逆联系起来,建立数值稳定性与统计稳定性之间的联系。
  • 证明在线性核设置下,梯度下降收敛于最小范数解,使得结果可适用于优化动力学。

实验结果

研究问题

  • RQ1最小化 ERM 解的范数是否能提升插值核机器中的稳定性与泛化性能?
  • RQ2插值解的稳定性与经验核矩阵的条件数之间有何关系?
  • RQ3基于稳定性的上界能否解释过参数化核模型中观察到的测试误差双下降现象?
  • RQ4核方法中是否存在数值稳定性(条件数)与统计稳定性(CV_loo)之间的联系?
  • RQ5与其它插值解相比,最小范数解在风险与稳定性方面表现如何?

主要发现

  • 最小范数插值解最小化了 CV_loo 稳定性的上界,意味着其在所有插值解中具有最佳的泛化性能。
  • 稳定性上界由经验核矩阵的条件数控制,该条件数同时支配着数值稳定性和统计稳定性。
  • 在 n 和 d 同时趋于无穷大的渐近情形下,核矩阵的条件数呈现出双下降曲线,与经验观察一致。
  • 最小范数解的风险上界依赖于核矩阵的伪逆,建立了数值稳定性与统计稳定性之间的直接联系。
  • 在直线性核设置下,梯度下降收敛于最小范数解,意味着稳定性优势可适用于标准训练过程。
  • 本研究为无正则化的核方法在过参数化情形下的成功提供了理论基础,解释了无需显式正则化即可实现泛化的机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。