Skip to main content
QUICK REVIEW

[论文解读] Integrating Multisource Block-Wise Missing Data in Model Selection

Fei Xue, Annie Qu|arXiv (Cornell University)|Jan 12, 2019
Statistical Methods and Inference参考文献 63被引用 11
一句话总结

本文提出了一种多重块状缺失数据整合方法——多重块状插补(Multiple Block-wise Imputation, MBI),通过利用完整与不完整观测值,提升变量选择与估计效率。MBI方法在不同缺失模式组间构建加权估计方程,在低维与高维设置下均实现估计与模型选择的一致性,即使在信息性缺失条件下,性能也优于现有方法。

ABSTRACT

For multi-source data, blocks of variable information from certain sources are likely missing. Existing methods for handling missing data do not take structures of block-wise missing data into consideration. In this paper, we propose a Multiple Block-wise Imputation (MBI) approach, which incorporates imputations based on both complete and incomplete observations. Specifically, for a given missing pattern group, the imputations in MBI incorporate more samples from groups with fewer observed variables in addition to the group with complete observations. We propose to construct estimating equations based on all available information, and optimally integrate informative estimating functions to achieve efficient estimators. We show that the proposed method has estimation and model selection consistency under both fixed-dimensional and high-dimensional settings. Moreover, the proposed estimator is asymptotically more efficient than the estimator based on a single imputation from complete observations only. In addition, the proposed method is not restricted to missing completely at random. Numerical studies and ADNI data application confirm that the proposed method outperforms existing variable selection methods under various missing mechanisms.

研究动机与目标

  • 解决现有方法在高维设置下处理多源块状缺失数据的局限性。
  • 通过整合不同缺失模式组中完整与不完整观测值的信息,改进变量选择与参数估计。
  • 开发一种在缺失完全随机(MCAR)与缺失随机(MAR)机制下均保持一致性和效率的方法,不局限于MCAR假设。
  • 整合具有不同缺失模式的多个组的插补结果,为信息量更丰富的估计函数分配更高权重。
  • 建立所提估计量相对于单次插补方法的理论一致性与渐近效率。

提出的方法

  • 提出一种多重块状插补(MBI)框架,结合完整案例组与观测变量较少的不完整组的插补结果。
  • 基于所有可用数据构建估计方程,整合来自不同缺失模式组的有信息估计函数。
  • 根据缺失变量数量与插补准确性为估计函数分配权重,优先选择可靠性更高的组。
  • 采用广义矩法(GMM)估计参数,确保渐近正态性与效率。
  • 应用惩罚估计方程(如SCAD或Lasso型)进行变量选择,确保选择一致性。
  • 通过结合块状插补与降维技术,将方法扩展至高维设置。

实验结果

研究问题

  • RQ1是否存在一种统一方法,能有效整合多源块状缺失数据,同时保持估计与选择一致性?
  • RQ2所提出的MBI方法在估计效率与变量选择准确性方面,相较于单次插补与多次插补方法表现如何?
  • RQ3MBI方法在信息性缺失机制下是否仍保持一致性和效率,而不仅限于缺失随机(MAR)情形?
  • RQ4在具有复杂缺失模式的真实数据中,MBI方法是否能优于现有方法(如DISCOM、iMSF、iSFS)?
  • RQ5MBI估计量的渐近效率与一致性的理论依据是什么?

主要发现

  • 所提出的MBI方法在固定维数与高维设置下均实现估计与模型选择的一致性。
  • MBI估计量在渐近意义上比仅基于完整案例的单次插补估计量更高效。
  • 在数值研究中,MBI在预测上实现了更低的均方误差(RMSE),且选择的变量更少,同时在识别相关生物标志物方面准确度更高。
  • 在ADNI数据集中,MBI选出了29个体磁共振成像(MRI)、2个正电子发射断层扫描(PET)与10个基因表达生物标志物,其中包括SFRP1与海马体积等临床相关标志物,这些标志物与阿尔茨海默病具有生物学关联。
  • 该方法识别出两个独特的MRI特征——左侧旁中央小叶平均皮层厚度与右侧颞极皮层厚度标准差——这些特征未被其他方法选中,但已知与阿尔茨海默病相关。
  • 在预测准确度与变量选择方面,MBI方法在85%缺失率与信息性缺失机制下,均优于DISCOM、CC-SCAD与DISCOM-Huber。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。