Skip to main content
QUICK REVIEW

[论文解读] Multiple Imputation of Missing Values in Household Data with Structural Zeros

Olanrewaju Akande, Jerome P. Reiter|arXiv (Cornell University)|Jul 19, 2017
Bayesian Methods and Mixture Models参考文献 15被引用 4
一句话总结

本文提出了一种基于嵌套狄利克雷过程混合多项式模型(NDPMPM)的多重插补方法,用于处理具有结构零值的住户调查数据。该方法结合吉布斯抽样与拒绝抽样,以处理缺失值,同时保持多变量依赖关系,并确保不可能的住户配置(例如,子女年龄小于父母)被赋予零概率,从而实现准确的插补并正确传播不确定性。

ABSTRACT

We present an approach for imputation of missing items in multivariate categorical data nested within households. The approach relies on a latent class model that (i) allows for household level and individual level variables, (ii) ensures that impossible household configurations have zero probability in the model, and (iii) can preserve multivariate distributions both within households and across households. We present a Gibbs sampler for estimating the model and generating imputations. We also describe strategies for improving the computational efficiency of the model estimation. We illustrate the performance of the approach with data that mimic the variables collected in typical population censuses.

研究动机与目标

  • 解决在必须尊重结构零值(例如,年龄限制)的多变量分类住户数据中插补缺失值的挑战。
  • 在插补过程中保持住户内部及跨住户的复杂多变量关联。
  • 通过多重插补实现适当的不确定性量化,以支持有效的后续推断。
  • 提高NDPMPM模型在大规模具有缺失值的住户数据上的计算效率。
  • 开发可扩展的MCMC估计策略,在保持模型有效性的同时减少运行时间。

提出的方法

  • 使用嵌套狄利克雷过程混合多项式模型(NDPMPM)对住户层面和个体层面分类变量的联合分布进行建模。
  • 通过增加拒绝抽样步骤扩展吉布斯抽样,以生成尊重结构零约束(如家庭内部年龄不等式)的插补值。
  • 对似然函数应用截断-加权近似以提高计算效率,同时不损失准确性。
  • 将户主数据转换为住户层面变量,以降低模型复杂度并加速MCMC收敛。
  • 采用烧毁期后的薄化处理与收敛性监测,以确保从MCMC样本中获得可靠的后验推断。
  • 通过后验预测分布生成50个完整数据集,用于多重插补推断。

实验结果

研究问题

  • RQ1NDPMPM模型结合拒绝抽样是否能有效插补住户数据中的缺失值,同时强制执行结构零约束?
  • RQ2与标准插补技术相比,所提出方法在多大程度上保持了住户内部及跨住户的多变量关联?
  • RQ3在将NDPMPM应用于具有缺失值的住户数据时,计算瓶颈是什么,如何缓解?
  • RQ4插补后的分布在多大程度上与原始数据的真实联合分布匹配,特别是对于复杂住户配置?
  • RQ5使用可扩展近似方法(截断-加权、变量重定义)是否在减少计算时间的同时保持了准确性?

主要发现

  • NDPMPM结合拒绝抽样成功保持了住户数据中的多变量关联,插补后的边际、二元及三元概率与原始完整数据中的结果高度一致。
  • 该方法有效强制执行了结构零约束,确保不可能的配置(如子女年龄大于生物学父母)被赋予零概率。
  • 截断-加权近似与住户层面变量转换显著减少了MCMC运行时间,同时保持了插补分布的高准确性。
  • 在MCAR情景下缺失率较低时,NDPMPM插补的95%置信区间紧密包含真实总体值,表明不确定性量化可靠。
  • 尽管性能表现优异,该方法在估计同种族家庭比例时显示出轻微的向下偏差,尤其在较大规模家庭中,凸显了在复杂人口统计结构插补中仍存在的持续挑战。
  • 结果表明,结合拒绝抽样与计算优化的NDPMPM是一种稳健且可扩展的解决方案,适用于具有结构约束的普查与调查数据的多重插补。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。