Skip to main content
QUICK REVIEW

[论文解读] Kernel regression, minimax rates and effective dimensionality: beyond the regular case

Gilles Blanchard, Nicole Mücke|arXiv (Cornell University)|Nov 12, 2016
Numerical methods in inverse problems参考文献 19被引用 4
一句话总结

本文在核协方差算子的特征值衰减较弱的假设下,建立了核回归的极小极大收敛速率,证明即使谱系不呈多项式衰减,最优速率依然可实现。通过引入一种基于特征值衰减的新有效维度度量,作者推导出尖锐的下界,将经典极小极大速率推广至分布无关的设定。

ABSTRACT

We investigate if kernel regularization methods can achieve minimax convergence rates over a source condition regularity assumption for the target function. These questions have been considered in past literature, but only under specific assumptions about the decay, typically polynomial, of the spectrum of the the kernel mapping covariance operator. In the perspective of distribution-free results, we investigate this issue under much weaker assumption on the eigenvalue decay, allowing for more complex behavior that can reflect different structure of the data at different scales.

研究动机与目标

  • 确定核正则化方法是否可在不假设核协方差算子的特征值呈多项式衰减的前提下,实现极小极大收敛速率。
  • 将核回归中的极小极大理论扩展至采样测度不被参考测度支配的分布无关设定。
  • 通过一种基于特征值衰减的新概念,而非固有维度,刻画问题的有效维度。
  • 在一般谱假设下,推导出反映学习问题真实复杂度的估计误差尖锐下界。
  • 弥合经典非参数极小极大理论与高维或非标准空间中现代核方法之间的差距。

提出的方法

  • 基于核协方差算子的特征分解,提出一类新的目标函数正则性类,定义为 $ \Omega(\nu, r, R) = \{ f \in \mathcal{H} : \sum_i \mu_{\nu,i}^r f_i^2 \leq R^2 \} $。
  • 通过函数 $ \mathcal{F}(x) = \# \{ i : \mu_{\nu,i} \geq x \} $ 引入一种广义的有效维度概念,以捕捉非多项式特征值衰减。
  • 采用莱卡姆方法,并利用一组良好分离的分布集合,通过检验论证推导极小极大下界。
  • 构造 $ N_{\varepsilon} $ 个属于正则性类的函数,其 $ \mathcal{H} $-范数受控且在 $ B^s $-范数下保持分离。
  • 利用数据分布之间的 Kullback-Leibler 散度界,控制区分假设的信息论成本。
  • 应用一种带有对数项的 Fano 不等式变体,推导出估计误差的非渐近下界。

实验结果

研究问题

  • RQ1在弱特征值衰减假设下,核岭回归是否可实现极小极大速率,超越标准的多项式衰减情形?
  • RQ2在非正则设定下,学习问题的有效维度如何依赖于核协方差算子的谱结构?
  • RQ3当特征值衰减快于多项式时,核回归的最优收敛速率是什么?其与经典 Sobolev 型速率相比如何?
  • RQ4是否可在不假设采样测度被参考测度支配的前提下,推导出分布无关的极小极大下界?
  • RQ5数据的几何结构(通过核的特征值编码)在多大程度上决定了基于核的学习的根本极限?

主要发现

  • 本文建立了 $ B^s $-范数误差的极小极大下界,阶为 $ \Omega\left( \left( \frac{\sigma^2}{n} \right)^{\frac{r+s}{r+s+1}} \right) $,在温和条件下与已知上界一致。
  • 有效维度由函数 $ \mathcal{F}(x) = \# \{ i : \mu_{\nu,i} \geq x \} $ 刻画,该函数将固有维度的概念推广至非多项式衰减情形。
  • 对任意充分小的 $ \varepsilon > 0 $,存在满足 $ N_{\varepsilon} \to \infty $(当 $ \varepsilon \to 0 $ 时)的 $ N_{\varepsilon} $,使得 $ \log(N_{\varepsilon}) \geq \frac{1}{36} \mathcal{F}(2^{\nu_*} (\varepsilon/R)^{1/(r+s)}) $,表明假设类的丰富性。
  • 数据分布之间的 Kullback-Leibler 散度满足 $ \mathcal{K}(\mathbb{P}_i, \mathbb{P}_j) \leq C_{\nu_*,s} R^2 \sigma^{-2} (\varepsilon/R)^{(2r+1)/(r+s)} $,从而控制了假设的可区分性。
  • 下界在假设 $ \text{Eigen}^>(\nu_*) $ 下成立,该假设允许任意谱衰减,只要其在对数尺度上足够规则。
  • 推导出的极小极大速率是尖锐的,且与已知上界一致,表明当特征值衰减快于多项式时,核方法依然可实现最优速率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。