Skip to main content
QUICK REVIEW

[论文解读] Estimating composite functions by model selection

Yannick Baraud, Lucien Birgé|arXiv (Cornell University)|Feb 14, 2011
Statistical Methods and Inference参考文献 29被引用 11
一句话总结

本文提出了一种模型选择框架,用于在高维 $[-1,1]^k$ 上估计复合函数 $ s = g \circ u $,通过自适应风险界避免维度灾难。通过利用 $ g $ 和 $ u $ 的结构假设,特别是各向异性的光滑性类,该方法在无需事先知晓 $ s $ 的正则性的情况下实现了极小极大最优速率,从而可应用于加法模型、指数模型和神经网络。

ABSTRACT

We consider the problem of estimating a function $s$ on $[-1,1]^{k}$ for large values of $k$ by looking for some best approximation by composite functions of the form $g\\circ u$. Our solution is based on model selection and leads to a very general approach to solve this problem with respect to many different types of functions $g,u$ and statistical frameworks. In particular, we handle the problems of approximating $s$ by additive functions, single and multiple index models, neural networks, mixtures of Gaussian densities (when $s$ is a density) among other examples. We also investigate the situation where $s=g\\circ u$ for functions $g$ and $u$ belonging to possibly anisotropic smoothness classes. In this case, our approach leads to a completely adaptive estimator with respect to the regularity of $s$.

研究动机与目标

  • 为解决在高维 $[-1,1]^k$ 上对非参数函数进行估计时的维度灾难问题,通过利用目标函数的结构假设。
  • 开发一种通用且自适应的估计框架,无需事先知晓复合函数 $ s = g \circ u $ 的光滑性。
  • 通过单一的模型选择方法统一并扩展现有的加法模型、单重/多重指数模型以及神经网络方法。
  • 推导当 $ g $ 和 $ u $ 属于各向异性的 Hölder 或 Sobolev 型光滑性类时,$ s = g \circ u $ 的极小极大最优风险界。
  • 建立估计器性能的理论保证,以 Hellinger 风险衡量,明确其对光滑性参数和维度 $ k $ 的依赖关系。

提出的方法

  • 该方法在一组候选模型 $ S $ 上进行模型选择,每个模型对应一种复合结构 $ g \circ u $,其中 $ g $ 和 $ u $ 被限制在特定的光滑性类中。
  • 提出一种基于惩罚的估计器,根据经验风险和与模型维度 $ \mathcal{D}(S) $ 成比例的复杂度惩罚来选择最优模型 $ S $。
  • 通过链式论证和一个关于凹函数的关键引理推导风险界,确保 $ \mathbb{E}_s[d^2(s,\widehat{s})] \leq C[\inf_{t \in S} d^2(s,t) + \tau \mathcal{D}(S)] $,其中 $ \tau = 1/n $ 用于密度估计。
  • 对于各向异性的光滑性,该方法通过选择满足 $ g \in \mathcal{H}^\alpha $、$ u \in \mathcal{H}^{\beta_i} $ 的模型,自适应地适应 $ s $ 的未知正则性,且复合函数 $ g \circ u $ 继承的光滑性为 $ \theta = \phi(\alpha, \overline{\beta}) $,其中 $ \phi $ 捕获最坏情况下的正则性。
  • 该方法证明,所得估计器的风险界阶为 $ \tau^{2\alpha / (2\alpha + k)} $,该界自适应于 $ k $,且无需要求 $ D \propto \tau^{-k/(2\alpha + k)} $,从而避免了维度灾难。
  • 该方法证明,估计器对 $ s $ 的未知光滑性完全自适应,即使 $ s = g \circ u $ 且 $ g \in \mathcal{H}^\alpha $、$ u \in \mathcal{H}^{\beta_i} $,且 $ \beta_i $ 在各坐标上变化。

实验结果

研究问题

  • RQ1能否通过模型选择方法在高维域 $[-1,1]^k$ 上实现对复合函数 $ s = g \circ u $ 的自适应估计,而无需假设固定的光滑性类?
  • RQ2如何构建一种估计器,通过利用 $ s $ 的结构假设(如其为较简单函数的复合)来避免在非参数估计中的维度灾难?
  • RQ3当 $ g $ 和 $ u $ 属于各向异性的 Hölder 或 Sobolev 型光滑性类时,估计 $ s = g \circ u $ 的最优收敛速率是什么?
  • RQ4所提出的方法能否在单一理论框架下统一并推广现有的加法模型、指数模型和神经网络方法?
  • RQ5 $ g $、$ u $ 的光滑性与复合函数 $ g \circ u $ 的最终光滑性之间的精确关系是什么?这种关系如何影响风险界?

主要发现

  • 所提出的估计器实现了阶为 $ \tau^{2\alpha / (2\alpha + k)} $ 的风险界,该界自适应于复合函数 $ s = g \circ u $ 的未知光滑性 $ \alpha $,且无需事先知晓 $ \alpha $。
  • 该方法避免了维度灾难,因为模型的有效维度不随 $ k $ 增大而增长,这与经典基于光滑性的方法不同,后者要求 $ D \propto \tau^{-k/(2\alpha + k)} $。
  • 对于各向异性的光滑性类,该方法实现了极小极大最优速率 $ \tau^{2\alpha / (2\alpha + k)} $,其中指数依赖于各分量中的最坏情况光滑性。
  • 估计器完全自适应:它能自动适应 $ s $ 的未知正则性,即使 $ s = g \circ u $ 且 $ g \in \mathcal{H}^\alpha $、$ u \in \mathcal{H}^{\beta_i} $,$ \beta_i $ 在各坐标上变化。
  • 该方法适用于广泛模型,包括加法函数、单重和多重指数模型以及高斯混合模型,并具有统一的理论保证。
  • 本文证明,复合函数 $ g \circ u $ 继承的光滑性为 $ \theta = \phi(\alpha, \overline{\beta}) $,其中 $ \phi $ 是一个次可加函数,用于捕捉复合过程中的正则性退化,该关系被用于推导最终的风险界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。