[论文解读] On Empirical Risk Minimization with Dependent and Heavy-Tailed Data
该论文通过将Mendelson的无集中学习框架推广至严格平稳、指数β-混合过程,将经验风险最小化(ERM)推广至依赖性与重尾数据。通过直接建模噪声与函数评估之间的交互作用,在较弱的矩假设下建立了风险界,推导出在多项式或指数重尾误差下,高维线性回归在平方损失与Huber损失下的收敛速率。
In this work, we establish risk bounds for the Empirical Risk Minimization (ERM) with both dependent and heavy-tailed data-generating processes. We do so by extending the seminal works of Mendelson [Men15, Men18] on the analysis of ERM with heavy-tailed but independent and identically distributed observations, to the strictly stationary exponentially $β$-mixing case. Our analysis is based on explicitly controlling the multiplier process arising from the interaction between the noise and the function evaluations on inputs. It allows for the interaction to be even polynomially heavy-tailed, which covers a significantly large class of heavy-tailed models beyond what is analyzed in the learning theory literature. We illustrate our results by deriving rates of convergence for the high-dimensional linear regression problem with dependent and heavy-tailed data.
研究动机与目标
- 弥合经验风险最小化(ERM)在依赖性与重尾数据生成过程(DGPs)中理论分析的空白,此类过程在实践中普遍存在,但在学习理论中理解不足。
- 将Mendelson的无集中学习框架——原用于i.i.d.重尾数据——扩展至严格平稳、指数β-混合的非i.i.d.情形。
- 在噪声与输入交互作用可能为多项式或指数重尾时,推导凸函数及局部强凸损失函数的风险界。
- 在依赖性与重尾数据条件下,为高维线性回归在平方损失与Huber损失下提供收敛速率。
- 为弱矩条件下处理β-混合随机变量的乘子过程,开发新的集中不等式。
提出的方法
- 通过直接假设噪声与函数评估之间交互作用的矩条件,将Mendelson(2015, 2018)的小球技术推广至β-混合过程。
- 利用[MPR11]中的集中不等式处理指数重尾交互作用,并将[BMdlP20]的结论扩展至β-混合设定下多项式重尾交互作用的新不等式。
- 通过显式控制噪声与输入上函数评估之间的交互项来分析乘子经验过程,避免依赖于一致集中性。
- 将该框架应用于以ℓ1-球与ℓ2-球定义的函数类的高维线性模型,使用复杂度度量如ωQ(F−F,N,ζ1,ζ2)来控制估计误差。
- 通过引理B.2推导泛化误差界,结合尾概率界与在β-混合假设下的复杂度控制。
- 通过精心选择集合A(N),平衡风险界中的三项:快速率项、慢速率项及随N衰减的项,从而建立收敛速率。
实验结果
研究问题
- RQ1当i.i.d.假设不成立时,能否在理论上为依赖性、重尾数据的ERM提供依据?
- RQ2在弱矩假设下,如何将乘子经验过程不等式推广至β-混合过程?
- RQ3在数据依赖且重尾时,高维线性回归在平方损失与Huber损失下可实现何种收敛速率?
- RQ4能否在不依赖一致集中性或有界性假设的前提下,将无集中学习框架适配至非i.i.d.设定?
- RQ5噪声与函数评估乘积中的多项式与指数重尾交互作用对泛化误差有何影响?
主要发现
- 论文在β-混合与重尾数据下建立了ERM的一般风险界,ℓ2估计误差的收敛速率为max(N^{-1/2+ι}, R/√N √log(ed/N))。
- 对于ℓ1-正则化函数类的高维线性模型,当N ≤ c1(Lg)d时,估计误差被控制在O(R/√N √log(ed/N));当N > c1(Lg)d时,估计误差为O(R/√d)。
- 泛化误差界以高概率成立,失败概率以exp(−cN^{η1/(1+η1)})与exp(−(N^{2ι}τ0)^η/M1)的速率衰减,表明强集中性。
- 该方法在弱于经典ERM的矩假设下实现了非渐近风险界,允许噪声与输入之间存在多项式或指数重尾交互作用。
- 分析表明,通过适当选择A(N),风险界中的第三项(源于β-混合依赖性)可随N→∞而趋于零,从而实现快速率。
- 在稀疏线性回归中,对平方损失与Huber损失的上下文验证表明,该方法在依赖性与重尾噪声下具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。