Skip to main content
QUICK REVIEW

[论文解读] Density Functional Estimators with k-Nearest Neighbor Bandwidths

Weihao Gao, Sewoong Oh|arXiv (Cornell University)|Feb 10, 2017
Statistical Methods and Inference参考文献 5被引用 5
一句话总结

该论文提出了一种基于k近邻(k-NN)带宽的局部似然密度估计器(k-LNN),用于估计概率密度函数的多项式泛函,例如Rényi熵。通过使用固定k个最近邻距离进行自适应带宽选择,并应用一种新颖的去偏方案以校正渐近偏差,该方法实现了L²一致性,并在高维和边界偏倚的设定下优于最先进的核密度估计(KDE)和k-NN估计器。

ABSTRACT

Estimating expected polynomials of density functions from samples is a basic problem with numerous applications in statistics and information theory. Although kernel density estimators are widely used in practice for such functional estimation problems, practitioners are left on their own to choose an appropriate bandwidth for each application in hand. Further, kernel density estimators suffer from boundary biases, which are prevalent in real world data with lower dimensional structures. We propose using the fixed-k nearest neighbor distances for the bandwidth, which adaptively adjusts to local geometry. Further, we propose a novel estimator based on local likelihood density estimators, that mitigates the boundary biases. Although such a choice of fixed-k nearest neighbor distances to bandwidths results in inconsistent estimators, we provide a simple debiasing scheme that precomputes the asymptotic bias and divides off this term. With this novel correction, we show consistency of this debiased estimator. We provide numerical experiments suggesting that it improves upon competing state-of-the-art methods.

研究动机与目标

  • 为解决在具有低维流形的高维数据中,核密度估计器(KDEs)因边界偏倚和固定带宽导致性能下降的问题。
  • 通过引入去偏校正,克服基于k-NN的带宽选择在密度泛函估计中导致的不一致性。
  • 开发一种一致且自适应的估计器,用于估计密度的多项式泛函的积分,例如Rényi熵。
  • 在具有复杂几何结构和边界效应的情境下,提升相对于现有KDE和k-NN估计器的实证性能。

提出的方法

  • 使用固定k个最近邻距离作为自适应、与数据相关的带宽,以更好地捕捉多尺度数据中的局部几何结构。
  • 采用局部似然密度估计(LLDE)作为密度估计器,以减轻在高维空间中嵌入的低维流形中普遍存在的边界偏倚。
  • 应用一种新颖的去偏方案,预先计算并移除k-LNN估计器的渐近偏差,从而确保L²一致性。
  • 通过证明经验矩(S₀, S₁, S₂)在局部似然框架下收敛到其极限形式,推导出k-LNN估计器的渐近分布。
  • 利用Efron-Stein不等式界定估计器的方差,证明在邻居数m满足适当条件时,估计器以概率收敛。
  • 通过证明估计器的条件期望在核函数h有界且连续的假设下收敛到真实泛函值,建立一致性。

实验结果

研究问题

  • RQ1固定k个最近邻带宽是否能提升在高维、低维流形数据中密度泛函估计器的自适应性和一致性?
  • RQ2所提出的去偏方案是否能有效校正基于k-NN带宽选择在泛函估计中引入的渐近偏差?
  • RQ3k-LNN估计器在L²一致性与实证性能方面,相较于最先进的KDE和k-NN估计器表现如何?
  • RQ4当应用于k-NN带宽时,局部似然密度估计是否能有效降低密度泛函估计中的边界偏倚?
  • RQ5k-LNN估计器的方差行为如何?其在合理的样本量与邻居数缩放条件下是否能实现一致收敛?

主要发现

  • 在较弱的正则性条件下,所提出的带去偏处理的k-LNN估计器对Jα(X)(密度的多项式泛函的积分)实现了L²一致性。
  • 基于k-NN的估计器的渐近偏差被分析性地表征,并通过校正因子被消除,从而在固定k带宽固有的不一致性下仍能实现一致性。
  • 当邻居数m按O(log n)缩放时,k-LNN估计器的方差被界为O(1/n),确保了以概率收敛。
  • 数值实验表明,k-LNN估计器在估计精度方面优于对比的KDE和k-NN估计器,尤其在高维和边界偏倚的设定下表现更优。
  • 该估计器对数据中的流形结构具有鲁棒性,这在具有低维嵌入的合成数据上表现更优的结果中得到验证。
  • 理论分析证实,估计器的条件期望收敛到真实泛函值,经校正后建立了渐近无偏性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。