Skip to main content
QUICK REVIEW

[论文解读] Estimating the conditional density by histogram type estimators and model selection

Mathieu Sart|arXiv (Cornell University)|Dec 22, 2015
Statistical Methods and Inference参考文献 32被引用 5
一句话总结

该论文提出了一种基于数据的模型选择程序,用于使用直方图型估计器估计条件密度,通过基于确定性 Hellinger 距离的惩罚准则,该距离考虑了未知的边缘密度行为。主要贡献是建立了一个非渐近的 oracle 不等式,确保在最小假设下对非均匀和各向异性的 Besov 空间实现最优收敛速率的自适应估计。

ABSTRACT

We propose a new estimation procedure of the conditional density for independent and identically distributed data. Our procedure aims at using the data to select a function among arbitrary (at most countable) collections of candidates. By using a deterministic Hellinger distance as loss, we prove that the selected function satisfies a non-asymptotic oracle type inequality under minimal assumptions on the statistical setting. We derive an adaptive piecewise constant estimator on a random partition that achieves the expected rate of convergence over (possibly inhomogeneous and anisotropic) Besov spaces of small regularity. Moreover, we show that this oracle inequality may lead to a general model selection theorem under very mild assumptions on the statistical setting. This theorem guarantees the existence of estimators possessing nice statistical properties under various assumptions on the conditional density (such as smoothness or structural ones).

研究动机与目标

  • 开发一种基于数据的模型选择程序,用于条件密度估计,能够自适应未知目标密度的平滑性和结构。
  • 克服现有方法中要求边缘密度 $ f_X $ 存在下界这一局限性。
  • 建立一个非渐近的 oracle 不等式,用于基于加权测度体现未知边缘密度的确定性 Hellinger 损失。
  • 推导在(可能非均匀和各向异性)Besov 空间上具有小正则性的自适应估计速率。
  • 提供一个在弱假设下适用的一般模型选择定理,从而可构建具有最优统计性质的估计器。

提出的方法

  • 使用基于确定性 Hellinger 距离 $ h^2(f,g) = \frac{1}{2}\int_A (\sqrt{f}-\sqrt{g})^2 f_X(x)\,d\nu(x)\,d\mu(y) $ 的惩罚准则,该准则考虑了未知的边缘密度 $ f_X $。
  • 应用受 Baraud (2011)、Sart (2014) 和 Baraud 等 (2016) 启发的数据驱动惩罚项,针对未知损失结构进行定制。
  • 考虑来自至多可数函数族的候选估计器集合,包括在随机划分上的分段常数函数。
  • 通过函数 $ u = (u_1, \dots, u_l) $ 将数据进行变换,映射 $ A \to [0,1]^l $,从而实现对条件密度结构的灵活建模。
  • 采用包含复杂度惩罚项 $ \Delta_{\mathbb{F}}(F) $ 和 $ \dim F $ 的模型选择框架,以控制过拟合。
  • 通过结合 Hölder 空间和上确界范数空间中的逼近界与经验过程的集中不等式,推导出非渐近的 oracle 不等式。

实验结果

研究问题

  • RQ1能否设计一种用于条件密度估计的模型选择程序,使其能自适应未知的平滑性和结构,且无需对边缘密度施加下界?
  • RQ2在低正则性的非均匀和各向异性 Besov 空间上,直方图型估计器的最优收敛速率是什么?
  • RQ3如何构建一个数据驱动的惩罚项,以确保在依赖于未知边缘密度的确定性 Hellinger 损失下满足 oracle 不等式?
  • RQ4在何种最小假设下,一般模型选择定理对具有最优统计性质的条件密度估计成立?
  • RQ5所提出的方法能否在包括非对称和各向异性平滑性类在内的广泛函数空间类上实现自适应估计?

主要发现

  • 所选估计器在最小假设下满足非渐近的 oracle 不等式,确保其性能相对于候选集合中的最优者达到最优。
  • 该方法在(可能非均匀和各向异性)小正则性 Besov 空间上实现了预期的收敛速率,即使 $ f_X $ 为零亦成立。
  • oracle 不等式导出一个在极弱假设下适用的一般模型选择定理,从而可在多种结构和正则性约束下实现自适应估计。
  • 构造了一个基于随机划分的自适应分段常数估计器,其在所考虑的 Besov 类上实现了最优收敛速率。
  • 惩罚项被显式设计以处理未知边缘密度行为,避免了对 $ f_X $ 存在下界的要求,这是对先前工作的关键改进。
  • 收敛速率被证明在极小化理论意义下是最优的,明确依赖于正则性参数 $ \alpha_j $、维度 $ d_2 $ 和样本大小 $ n $,达到速率 $ \left(\frac{\log n}{n}\right)^{\frac{2\bar{\alpha}}{2\bar{\alpha}+1+d_2}} $。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。