Skip to main content
QUICK REVIEW

[论文解读] Bandwidth Selection for Weighted Kernel Density Estimation

Bin Wang, Xiaofeng Wang|arXiv (Cornell University)|Sep 11, 2007
Statistical Methods and InferenceMathematics参考文献 32被引用 20
一句话总结

本文提出了加权核密度估计(wKDE)的带宽选择方法,以改进使用加权样本对目标人群进行密度估计的性能。提出了三种基于均方误差积分(MISE)的带宽估计器,通过蒙特卡洛模拟评估其性能,并针对区间有界数据中的边界问题,结合信息性右删失的真实数据进行了应用研究。

ABSTRACT

In the this paper, the authors propose to estimate the density of a targeted population with a weighted kernel density estimator (wKDE) based on a weighted sample. Bandwidth selection for wKDE is discussed. Three mean integrated squared error based bandwidth estimators are introduced and their performance is illustrated via Monte Carlo simulation. The least-squares cross-validation method and the adaptive weight kernel density estimator are also studied. The authors also consider the boundary problem for interval bounded data and apply the new method to a real data set subject to informative censoring.

研究动机与目标

  • 开发在加权样本存在情况下的可靠加权核密度估计(wKDE)带宽选择技术。
  • 解决数据受信息性删失或区间限制时的密度估计挑战。
  • 通过优化带宽选择最小化均方误差积分(MISE),提升密度估计的准确性。
  • 在实际场景中评估最小二乘交叉验证与自适应权重核估计器的性能。
  • 提供一个稳健的wKDE框架,以处理在有界或删失数据中常见的边界效应。

提出的方法

  • 提出三种基于最小化均方误差积分(MISE)的加权核密度估计带宽估计器。
  • 采用蒙特卡洛模拟比较所提出的基于MISE的带宽估计器的性能。
  • 将最小二乘交叉验证方法改进以适用于加权核密度估计。
  • 引入一种自适应权重核密度估计器,以在信息性删失下提升估计准确性。
  • 应用边界校正技术,以处理标准KDE可能失效的区间有界数据。
  • 在具有信息性删失的真实数据集上验证所提方法,以展示其实际应用价值。

实验结果

研究问题

  • RQ1如何在加权核密度估计中优化带宽选择,以最小化均方误差积分?
  • RQ2基于MISE的带宽估计器与最小二乘交叉验证方法在准确性与稳健性方面如何比较?
  • RQ3边界效应对区间有界数据的wKDE性能有何影响,又该如何缓解?
  • RQ4自适应权重核密度估计器在处理现实世界数据中的信息性删失方面效果如何?
  • RQ5所提出的带宽选择方法能否在实际删失数据集中提升密度估计的准确性?

主要发现

  • 三种基于MISE的带宽估计器在密度估计方面相比传统方法表现出更高的准确性。
  • 最小二乘交叉验证方法表现具有竞争力,但在模拟设置中稳定性不如基于MISE的方法。
  • 自适应权重核密度估计器在信息性删失存在时有效降低了偏差。
  • 边界校正技术显著提升了区间有界数据的估计准确性。
  • 将所提方法应用于具有信息性删失的真实数据集时,其性能优于标准KDE方法。
  • 蒙特卡洛模拟证实了基于MISE的带宽估计器在各种数据配置下的稳健性与一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。