Skip to main content
QUICK REVIEW

[论文解读] Local bandwidth selection for kernel density estimation in bifurcating Markov chain model

S. Valère Bitseki Penda, Angelina Roche|arXiv (Cornell University)|Jun 21, 2017
Markov Chains and Monte Carlo Methods参考文献 23被引用 4
一句话总结

本文提出了一种用于多维分叉马尔可夫链(BMCs)核密度估计的数据驱动局部带宽选择方法,将Goldenshuger-Lepski方法适配于处理依赖的树状结构数据。建立了适用于BMC泛函的伯恩斯坦型不等式,并引入了数据自适应的惩罚校准,使得在弱依赖假设下达到极小极大最优收敛速率,具有理论保证并在高维设置下得到数值验证。

ABSTRACT

We propose an adaptive estimator for the stationary distribution of a bifurcating Markov Chain on $\mathbb R^d$. Bifurcating Markov chains (BMC for short) are a class of stochastic processes indexed by regular binary trees. A kernel estimator is proposed whose bandwidth is selected by a method inspired by the works of Goldenshluger and Lepski [18]. Drawing inspiration from dimension jump methods for model selection, we also provide an algorithm to select the best constant in the penalty.

研究动机与目标

  • 解决在多维设置下非参数核密度估计中分叉马尔可夫链(BMCs)缺乏数据驱动带宽选择的问题。
  • 将Goldenshuger-Lepski方法扩展至BMCs,其中由于树状结构依赖性,标准的i.i.d.数据集中不等式不再适用。
  • 为涉及核函数与卷积的BMC泛函提出一种新型伯恩斯坦型不等式,该不等式对所有正偏差参数均成立,且与样本量无关。
  • 解决Goldenshuger-Lepski准则中方差项依赖于未知密度的问题,提出对惩罚常数进行数据自适应校准。
  • 为所选估计器的风险提供理论保证,包括在不变密度满足正则性条件下的极小极大最优性。

提出的方法

  • 通过定义一个最小化经验偏差-方差权衡的带宽选择器,将Goldenshuger-Lepski方法适配于BMCs:$\widehat{h} = \arg\min_{h \in \mathcal{H}} \{ \widehat{A}(h) + bV(h) \}$,其中$\widehat{A}(h)$用于估计偏差,$V(h)$为方差代理。
  • 推导出一种适用于从二叉树上核泛函导出的依赖随机变量和的新型伯恩斯坦型集中不等式,对所有正偏差参数成立,且与样本量无关。
  • 提出一种改进的选择规则,其中惩罚常数$b$通过受Arlot和Massart(2009)启发的算法从数据中自动校准,克服了$V(h)$对未知密度的依赖。
  • 采用局部准则,使带宽能自适应于密度的局部光滑性,从而实现点态风险控制,而非全局带宽选择。
  • 使用带宽集合$\mathcal{H}_n$,满足$|h| \geq \log(|\mathbb{T}_n|)/|\mathbb{T}_n|$,确保渐近一致性的适当缩放。
  • 证明在核函数和不变密度$\nu$满足正则性条件时,所得估计器可达到极小极大最优收敛速率。

实验结果

研究问题

  • RQ1能否为多维分叉马尔可夫链中的核密度估计开发一种数据驱动的带宽选择规则,其中观测值具有依赖性和树状结构?
  • RQ2在标准集中不等式不适用的依赖数据结构(如BMCs)中,Goldenshuger-Lepski方法应如何适配?
  • RQ3涉及核函数与卷积的BMC泛函的合理伯恩斯坦型不等式是什么?它如何用于控制经验均值与其期望之间的偏差?
  • RQ4当Goldenshuger-Lepski规则中的惩罚项依赖于未知密度时,应如何校准?何种数据驱动算法可确保最优性能?
  • RQ5可为所得估计器建立何种理论风险界?其在正则密度类的$\mathbb{L}_s$-风险下是否达到极小极大最优性?

主要发现

  • 为分叉马尔可夫链泛函建立了一种新型伯恩斯坦型不等式,对所有正偏差参数均成立,且与样本量无关,从而实现更精确的集中控制。
  • 所提出的带宽选择器在核函数和不变密度满足正则性条件时,对$\mathbb{L}_s$-风险实现了极小极大最优收敛速率。
  • 数据自适应惩罚校准算法确保所选估计器在无需预先知晓密度的情况下实现最优偏差-方差权衡。
  • 理论分析表明,在带宽和常数满足适当条件时,经验核均值与其期望之间偏差的尾概率以$O(|\mathbb{T}_n|^{-1})$的速率衰减。
  • 该方法对BMCs中的依赖结构具有鲁棒性,并提供了在带宽集合$\mathcal{H}_n$上一致成立的非渐近风险界。
  • 数值研究证实了该方法在有限样本下的有效性,尤其在自适应带宽选择至关重要的高维设置中表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。