[论文解读] Stability revisited: new generalisation bounds for the Leave-one-Out
本文引入了 $L^q$ 稳定性,这是一种假设稳定性的新泛化形式,其弱于一致稳定性,用于推导 Leave-one-Out(LoO)过程的非渐近 PAC 指数泛化界。通过将 $L^q$ 稳定性与矩不等式相结合,作者建立了比以往结果更紧致且适用范围更广的界,且在岭回归上得到验证,理论保证更优,且假设条件更温和。
The present paper provides a new generic strategy leading to non-asymptotic theoretical guarantees on the Leave-one-Out procedure applied to a broad class of learning algorithms. This strategy relies on two main ingredients: the new notion of $L^q$ stability, and the strong use of moment inequalities. $L^q$ stability extends the ongoing notion of hypothesis stability while remaining weaker than the uniform stability. It leads to new PAC exponential generalisation bounds for Leave-one-Out under mild assumptions. In the literature, such bounds are available only for uniform stable algorithms under boundedness for instance. Our generic strategy is applied to the Ridge regression algorithm as a first step.
研究动机与目标
- 为在广泛学习算法类别中分析 Leave-one-Out(LoO)估计器,构建一个通用的理论框架。
- 解决在统一稳定性或有界性等限制性假设之外,LoO 缺乏非渐近泛化界的现状。
- 提出 $L^q$ 稳定性作为假设稳定性的泛化形式,其弱于一致稳定性,但足以推导出强泛化界。
- 将所提框架应用于岭回归,推导出在比以往工作更温和条件下达到最先进水平的泛化界。
- 未来工作将把交叉验证程序的理论分析从 LoO 扩展到其他变体,如 V 折交叉验证。
提出的方法
- 提出 $L^q$ 稳定性作为一种新的稳定性概念,其泛化假设稳定性,同时弱于一致稳定性。
- 利用矩不等式(例如 Boucheron 等,2013 年)在 $L^q$ 稳定性下推导 LoO 估计器的集中界。
- 通过推导 $\Gamma_{\lambda,1}, \Gamma_{\lambda,2}, \Gamma_{\lambda,3}$ 的显式界,将该框架应用于岭回归,这些量量化了算法的 $L^q$ 稳定性。
- 通过命题 4 和推论 1 建立泛化界,使用预测误差的 $L^q$ 范数和基于矩的集中不等式。
- 推导出两个主要结果:一个在 $Y$ 有界条件下(定理 3),另一个在 $Y$ 为次高斯分布条件下(定理 4),两者均给出 $O(1/\sqrt{n})$ 的偏差率。
- 利用矩阵恒等式(如 Henderson-Searle 公式)和算子范数界,控制岭回归对单一样本移除的敏感性。
实验结果
研究问题
- RQ1能否定义一种新的稳定性概念,使其泛化假设稳定性,同时弱于一致稳定性,从而实现更紧致的泛化界?
- RQ2能否有效结合矩不等式与这种新稳定性概念,为 LoO 估计器推导出非渐近、PAC 指数界?
- RQ3所提框架在多大程度上可应用于岭回归?其结果与在一致稳定性下推导的界相比如何?
- RQ4当放松对 $Y$ 的有界性假设,转而假设其为次高斯分布时,泛化界的行为如何?
- RQ5该策略能否扩展到岭回归以外的其他学习算法,以及如 V 折交叉验证等其他交叉验证程序?
主要发现
- 所提出的 $L^q$ 稳定性概念泛化了假设稳定性,且严格弱于一致稳定性,从而具备更广泛的应用潜力。
- 在 $L^q$ 稳定性下,本文推导出 LoO 估计器的 PAC 指数泛化界,其偏差率阶为 $O(1/\sqrt{n})$,与在更强假设下已知结果一致。
- 对于有界 $Y$ 下的岭回归,定理 3 建立了一个泛化界,其常数涉及 $\Gamma_{\lambda,1} + \Gamma_{\lambda,2} + \Gamma_{\lambda,3}$ 和 $B_Y^2$,并实现 $O(1/\sqrt{n})$ 的收敛速度。
- 在次高斯 $Y$ 条件下,定理 4 提供了一个额外包含 $x^{3/2}$ 类型项的界,该界通过 $\|Y\|_q^2 \leq 2(\mathbb{E}[Y])^2 + 4(2e)^2 v q$ 推导得出,且保持了 $O(1/\sqrt{n})$ 的速率。
- 与以往工作相比,这些界在更弱的假设下获得——具体而言,使用 $L^q$ 稳定性而非一致稳定性——同时实现了相当的收敛速率。
- 该框架具有通用性,不限于岭回归,未来工作计划将其扩展至其他算法和交叉验证方案(如 V 折 CV)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。