Skip to main content
QUICK REVIEW

[论文解读] The correlation-assisted missing data estimator

Timothy I. Cannings, Yingying Fan|arXiv (Cornell University)|Nov 5, 2019
Statistical Methods and Bayesian Inference参考文献 22被引用 4
一句话总结

该论文提出了相关性辅助缺失数据(CAM)估计器,一种新颖的方法,通过利用完整案例与不完整观测之间的相关性来提高估计精度。在U统计量、核密度估计和非参数回归中,与完整案例分析相比,该方法可降低均方误差,并在缺失数据完全随机的假设下,提供了更低方差和渐近正态性的理论保证。

ABSTRACT

We introduce a novel approach to estimation problems in settings with missing data. Our proposal -- the Correlation-Assisted Missing data (CAM) estimator -- works by exploiting the relationship between the observations with missing features and those without missing features in order to obtain improved prediction accuracy. In particular, our theoretical results elucidate general conditions under which the proposed CAM estimator has lower mean squared error than the widely used complete-case approach in a range of estimation problems. We showcase in detail how the CAM estimator can be applied to $U$-Statistics to obtain an unbiased, asymptotically Gaussian estimator that has lower variance than the complete-case $U$-Statistic. Further, in nonparametric density estimation and regression problems, we construct our CAM estimator using kernel functions, and show it has lower asymptotic mean squared error than the corresponding complete-case kernel estimator. We also include practical demonstrations throughout the paper using simulated data and the Terneuzen birth cohort and Brandsma datasets available from CRAN.

研究动机与目标

  • 为解决缺失数据情境下完整案例分析的低效性,即丢弃了不完整观测中的宝贵信息。
  • 开发一种通用框架,通过利用完整案例与缺失特征观测之间的相关性来提高估计精度。
  • 为CAM估计器相比完整案例估计器在多种统计模型中具有更低的均方误差提供理论保证。
  • 通过数据驱动、快速且完全自动化的构造方法,实现在非参数和U统计量设置下的实际应用。

提出的方法

  • CAM估计器通过使用与完整案例估计器相关的一个统计量,基于完整和不完整观测数据,对完整案例估计器进行线性调整。
  • 利用完整案例估计器与基于不完整数据的辅助估计器之间的相关性,以减少均方误差。
  • 对于U统计量,最优调整项本身也是一个U统计量,从而支持理论分析,并可构建无偏且渐近正态的CAM估计器。
  • 在非参数设置中,该方法应用核函数来构造CAM估计器,并提供了渐近方差降低的理论依据。
  • 提出了一种基于经验相关性估计的数据驱动版本CAM估计器,确保在无需知晓最优调整项的情况下具有实际可用性。
  • 理论分析包括在标准非参数正则条件下,利用集中不等式和渐近展开对偏差和方差的界进行推导。

实验结果

研究问题

  • RQ1在何种条件下,CAM估计器的均方误差低于完整案例估计器?
  • RQ2在缺失数据完全随机机制下,CAM估计器是否可在U统计量设置中构造为无偏且渐近正态?
  • RQ3CAM估计器在基于核函数的非参数密度估计和回归中如何改善渐近均方误差?
  • RQ4CAM估计器中的最优调整项是什么?在实际中如何从数据中估计该调整项?
  • RQ5CAM估计器能否在真实世界缺失数据集(如Terneuzen出生队列和Brandsma数据集)中有效应用?

主要发现

  • 在一般条件下,CAM估计器的均方误差低于完整案例估计器,且无需假设数据为缺失完全随机。
  • 在U统计量设置中,当数据缺失完全随机时,CAM估计器为无偏且渐近正态,其渐近方差严格小于完整案例U统计量的方差。
  • 对于核密度估计和局部常数回归,CAM估计器的渐近均方误差低于完整案例核估计器,且改进程度在主导项中可量化。
  • 在U统计量设置中,CAM估计器的最优调整项对应于一个U统计量,从而支持理论分析并可构建一致估计器。
  • 在模拟和真实数据应用中,包括Terneuzen出生队列和Brandsma数据集,数据驱动的CAM估计器实现了显著的方差降低。
  • 理论界证实,CAM估计器的偏差和方差项收敛合理,残差项在标准非参数正则条件下以概率趋于零。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。