Skip to main content
QUICK REVIEW

[论文解读] Regularization and the small-ball method II: complexity dependent error rates

Guillaume Lecué, Shahar Mendelson|arXiv (Cornell University)|Aug 27, 2016
Sparse and Compressive Sensing Techniques参考文献 37被引用 15
一句话总结

本文提出了一种分析高维学习问题中基于正则化的估计的通用框架,表明误差率取决于真实模型 $F^* = \{f \in F : \Psi(f) \leq \Psi(f^*)\}$ 的复杂度,在弱随机假设(包括小球条件)下成立。该研究为多种正则化函数(包括 $\ell_p$、弱-$\ell_p$、原子范数、最大范数和 SLOPE)建立了尖锐的、与复杂度相关的 $L_2$ 估计误差界,其速率几乎达到 $F^*$ 中的极小极大最优速率。该方法无需事先假设 $X$ 与 $Y$ 之间的关系,适用于一般凸类 $F$。主要贡献在于对估计误差与真实模型内在复杂度之间关系的精细化分析,而非整个类 $F$。结果为非渐近性,且在最小矩和尾部假设下以高概率成立。

ABSTRACT

For a convex class of functions $F$, a regularization functions $Ψ(\cdot)$ and given the random data $(X_i, Y_i)_{i=1}^N$, we study estimation properties of regularization procedures of the form \begin{equation*} \hat f \in { m argmin}_{f\in F}\Big(\frac{1}{N}\sum_{i=1}^N\big(Y_i-f(X_i)\big)^2+λΨ(f)\Big) \end{equation*} for some well chosen regularization parameter $λ$. We obtain bounds on the $L_2$ estimation error rate that depend on the complexity of the "true model" $F^*:=\{f\in F: Ψ(f)\leqΨ(f^*)\}$, where $f^*\in { m argmin}_{f\in F}\mathbb{E}(Y-f(X))^2$ and the $(X_i,Y_i)$'s are independent and distributed as $(X,Y)$. Our estimate holds under weak stochastic assumptions -- one of which being a small-ball condition satisfied by $F$ -- and for rather flexible choices of regularization functions $Ψ(\cdot)$. Moreover, the result holds in the learning theory framework: we do not assume any a-priori connection between the output $Y$ and the input $X$. As a proof of concept, we apply our general estimation bound to various choices of $Ψ$, for example, the $\ell_p$ and $S_p$-norms (for $p\geq1$), weak-$\ell_p$, atomic norms, max-norm and SLOPE. In many cases, the estimation rate almost coincides with the minimax rate in the class $F^*$.

研究动机与目标

  • 开发一种考虑真实模型 $F^*$ 复杂度而非整个函数类 $F$ 的基于正则化的估计的一般理论。
  • 建立依赖于通过正则化函数 $\Psi$ 定义的 $F^*$ 内在复杂度的高概率 $L_2$ 估计误差界。
  • 在最小随机假设下,分析多种正则化函数(包括 $\ell_p$、弱-$\ell_p$、原子范数、最大范数和 SLOPE)的性能。
  • 证明所得误差率在 $F^*$ 内几乎达到极小极大最优,即使不假设 $X$ 与 $Y$ 之间存在参数化或稀疏关系。
  • 将小球方法扩展至正则化设置,实现在设计与噪声的弱矩和尾部条件下控制误差界。

提出的方法

  • 提出正则化经验风险最小化(RERM)过程:$\hat{f} \in \arg\min_{f \in F} \left( \frac{1}{N}\sum_{i=1}^N (Y_i - f(X_i))^2 + \lambda \Psi(f) \right)$,其中 $\lambda$ 根据 $F^*$ 的复杂度选择。
  • 引入对类 $F$ 的小球条件,以控制设计 $X_i$ 的行为,确保估计所需的足够变异性。
  • 使用类似链式的方法,结合 Rademacher 平均和经验过程的矩与尾部估计,利用 $F^*$ 的结构。
  • 应用对称化与通用链式技术控制 $F^*$ 上的经验过程,其界依赖于度量熵与高斯复杂度。
  • 采用两阶段分解:通过阈值 $m \sim p / \log(eN/p)$(其中 $p = t \log d$)将经验过程分解为大系数与小系数部分,以处理重尾与高维设置。
  • 应用集中不等式(如 Bernstein 型与指数尾部界)控制经验误差的 $\ell_2$-范数,使用矩范数 $\|\cdot\|_{L_q}$ 与 $\|\cdot\|_{(2p)}$。

实验结果

研究问题

  • RQ1如何基于真实模型 $F^*$ 的复杂度而非整个类 $F$ 来刻画正则化方法的估计误差率?
  • RQ2小球条件在弱矩假设下对一般凸类 $F$ 的尖锐误差界起何作用?
  • RQ3不同正则化函数(如 $\ell_p$、弱-$\ell_p$、原子范数、最大范数和 SLOPE)在 $F^*$ 内导致的估计率在多大程度上接近极小极大最优?
  • RQ4小球方法能否扩展至正则化设置,实现在不假设稀疏性或参数结构下获得与复杂度相关的误差率?
  • RQ5当 $F^*$ 是 $F$ 的低复杂度子集时,误差率如何随维度 $d$ 和样本量 $N$ 变化?$\Psi(f^*)$ 与 $F^*$ 的有效维度之间有何相互作用?

主要发现

  • RERM 过程的 $L_2$ 估计误差率以高概率满足 $\alpha_N^2 \lesssim u^2 L \|\xi\|_{L_q} \sqrt{N} \sqrt{t \log d} \max_j \|x_j\|_{L_2}$,其中 $t \sim \log d$ 控制 $F^*$ 的复杂度,$L$ 为小球常数。
  • 当 $\Psi(f) = \|f\|_{\ell_p}$ 且 $p \geq 1$ 时,所得误差率几乎达到 $F^*$ 上的极小极大速率,即使不假设稀疏性。
  • 对于弱-$\ell_p$ 和 SLOPE 惩罚,该方法实现了适应 $f^*$ 稀疏结构的误差率,其界依赖于真实函数的 $\ell_p$-范数。
  • 小球条件足以控制 $F^*$ 上的经验过程,从而在不假设设计变量为次高斯或有界的情况下实现误差界。
  • 误差率随 $\sqrt{t \log d}$ 变化,其中 $t$ 与 $F^*$ 的熵相关,表明该方法能自适应真实模型的内在复杂度。
  • 结果在最小假设下成立:仅需小球条件与噪声 $\xi$ 的矩条件,无需 $X$ 与 $Y$ 之间的关联或参数模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。