Skip to main content
QUICK REVIEW

[论文解读] Stability and Deviation Optimal Risk Bounds with Convergence Rate $O(1/n)$

Yegor Klochkov, Nikita Zhivotovskiy|arXiv (Cornell University)|Mar 22, 2021
Risk and Portfolio Optimization被引用 4
一句话总结

本文在伯恩斯坦条件(Bernstein condition)下,为一致稳定的学习算法建立了高概率的过剩风险界,其阶为 $O(\log n / n)$,解决了随机凸优化领域长期存在的开放问题。通过结合一致稳定性和伯恩斯坦条件,消除了现有的 $O(1/\sqrt{n})$ 抽样误差项,使得经验风险最小化和投影梯度下降的收敛率达到最优的 $O(1/n)$,且无需损失函数的光滑性假设。

ABSTRACT

The sharpest known high probability generalization bounds for uniformly stable algorithms (Feldman, Vondr\\'{a}k, 2018, 2019), (Bousquet, Klochkov, Zhivotovskiy, 2020) contain a generally inevitable sampling error term of order $\\Theta(1/\\sqrt{n})$. When applied to excess risk bounds, this leads to suboptimal results in several standard stochastic convex optimization problems. We show that if the so-called Bernstein condition is satisfied, the term $\\Theta(1/\\sqrt{n})$ can be avoided, and high probability excess risk bounds of order up to $O(1/n)$ are possible via uniform stability. Using this result, we show a high probability excess risk bound with the rate $O(\\log n/n)$ for strongly convex and Lipschitz losses valid for \\emph{any} empirical risk minimization method. This resolves a question of Shalev-Shwartz, Shamir, Srebro, and Sridharan (2009). We discuss how $O(\\log n/n)$ high probability excess risk bounds are possible for projected gradient descent in the case of strongly convex and Lipschitz losses without the usual smoothness assumption.

研究动机与目标

  • 弥合一致稳定算法在期望值与高概率泛化界之间的差距。
  • 解决 Shalev-Shwartz 等人(2009 年)提出的开放问题:在强凸且利普希茨连续损失下,能否实现经验风险最小化(ERM)的 $O(\log n/n)$ 高概率过剩风险界。
  • 证明当伯恩斯坦条件成立时,现有界中的 $O(1/\sqrt{n})$ 抽样误差项可被消除。
  • 在不假设损失函数光滑性的前提下,将最优收敛率推广至投影梯度下降。

提出的方法

  • 引入并利用伯恩斯坦条件,以改进一致稳定算法的泛化界。
  • 应用一种改进的对数索博列夫不等式,推导出由稳定性产生的弱自 bounded 随机变量的集中界。
  • 将过剩风险分解为稳定性和抽样误差两部分,当伯恩斯坦条件成立时,后者可被消除。
  • 利用强凸性和利普希茨连续性建立损失函数的统一有界性,从而可应用伯恩斯坦型不等式。
  • 通过一致稳定性和伯恩斯坦条件下过剩风险的自 bounded 性质,推导出高概率的过剩风险界。
  • 将结果应用于经验风险最小化和投影梯度下降,证明在无光滑性假设下可实现 $O(\log n/n)$ 的收敛率。

实验结果

研究问题

  • RQ1一致稳定性是否能实现 $O(1/n)$ 阶的高概率过剩风险界,还是说 $O(1/\sqrt{n})$ 项不可避免?
  • RQ2在强凸性和利普希茨损失下,不假设光滑性时,能否实现经验风险最小化(ERM)的 $O(\log n/n)$ 高概率过剩风险界?
  • RQ3在较弱的结构假设(如伯恩斯坦条件)下,是否可消除现有高概率界中的 $O(1/\sqrt{n})$ 抽样误差项?
  • RQ4若损失函数不具光滑性,是否会导致投影梯度下降无法实现最优的 $O(\log n/n)$ 收敛率?

主要发现

  • 本文在强凸且利普希茨连续损失下,为经验风险最小化建立了高概率过剩风险界,阶为 $O(\log n / n)$,解决了 Shalev-Shwartz 等人(2009 年)提出的开放问题。
  • 在伯恩斯坦条件成立时,现有界中的 $O(1/\sqrt{n})$ 抽样误差项被消除,从而实现高达 $O(1/n)$ 的收敛率。
  • 该结果适用于无光滑性假设下的投影梯度下降,通过一致稳定性实现 $O(\log n / n)$ 的过剩风险界。
  • 在强凸性和利普希茨连续性下,损失函数被证明是统一有界的,从而可应用伯恩斯坦型集中不等式。
  • 证明依赖于改进的对数索博列夫不等式和过剩风险的弱自 bounded 性质,从而实现紧致的集中界。
  • 关键技术创新在于利用伯恩斯坦条件将稳定性和抽样误差解耦,从而实现最优收敛率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。