Skip to main content
QUICK REVIEW

[论文解读] Are deep learning models superior for missing data imputation in large surveys? Evidence from an empirical comparison

Zhenhua Wang, Olanrewaju Akande|arXiv (Cornell University)|Mar 14, 2021
Statistical Methods and Bayesian Inference参考文献 42被引用 11
一句话总结

本研究基于美国社区调查的真实调查数据,评估了深度学习插补方法(GAIN 和 MIDA)与基于分类树和随机森林的 MICE 方法在多种缺失数据情景下的表现。尽管深度学习模型在计算效率方面具有优势,但在偏差、均方误差和覆盖率方面,其表现仍显著逊于使用分类树的 MICE 方法,尤其在中等样本量和简单数据结构下表现更差。

ABSTRACT

Multiple imputation (MI) is a popular approach for dealing with missing data arising from non-response in sample surveys. Multiple imputation by chained equations (MICE) is one of the most widely used MI algorithms for multivariate data, but it lacks theoretical foundation and is computationally intensive. Recently, missing data imputation methods based on deep learning models have been developed with encouraging results in small studies. However, there has been limited research on evaluating their performance in realistic settings compared to MICE, particularly in big surveys. We conduct extensive simulation studies based on a subsample of the American Community Survey to compare the repeated sampling properties of four machine learning based MI methods: MICE with classification trees, MICE with random forests, generative adversarial imputation networks, and multiple imputation using denoising autoencoders. We find the deep learning imputation methods are superior to MICE in terms of computational time. However, with the default choice of hyperparameters in the common software packages, MICE with classification trees consistently outperforms, often by a large margin, the deep learning imputation methods in terms of bias, mean squared error, and coverage under a range of realistic settings.

研究动机与目标

  • 评估深度学习插补方法(GAIN 和 MIDA)在大规模调查数据中相对于传统 MICE 方法的表现。
  • 评估深度学习模型是否在偏差、均方误差和覆盖率方面相较于使用分类树和随机森林的 MICE 方法具有实质性改进。
  • 研究默认超参数设置(反映现实世界实践)对深度学习插补模型性能的影响。
  • 确定深度神经网络是否适用于中等维度且结构简单的调查数据。
  • 为深度学习方法在现实缺失数据机制下的多重插补中的可靠性提供实证证据。

提出的方法

  • 基于美国社区调查的一个子样本开展广泛的模拟研究,以生成现实的缺失数据模式。
  • 比较了四种插补方法:使用分类树的 MICE、使用随机森林的 MICE、GAIN(生成对抗性插补网络)以及 MIDA(使用去噪自编码器的多重插补)。
  • 通过重复抽样评估偏差、均方误差(MSE)和覆盖率在多个估计量和缺失数据机制下的表现。
  • 使用基于真实调查结构生成的合成数据以及先前文献中的基准数据集评估性能。
  • 采用常见软件包中的默认超参数设置,以反映典型使用者的实际应用,避免进行大量调参。
  • 报告整体 MSE 和准确性的结果,并评估在重复抽样中插补结果的稳定性。

实验结果

研究问题

  • RQ1在现实调查数据条件下,深度学习插补模型(GAIN 和 MIDA)是否在偏差、MSE 和覆盖率方面优于使用分类树的 MICE 方法?
  • RQ2当应用于大规模调查数据集时,深度学习模型的计算效率与 MICE 方法相比如何?
  • RQ3标准软件包中的默认超参数设置在多大程度上影响了深度学习插补模型的性能?
  • RQ4为何 GAIN 和 MIDA 在重复抽样中表现出高度不稳定的插补结果,且变异度远高于使用分类树的 MICE 方法?
  • RQ5深度学习模型与使用分类树的 MICE 方法之间的性能差距,是由于数据结构过于简单,还是由于训练样本量不足所致?

主要发现

  • 由于 GPU 加速,深度学习插补模型(GAIN 和 MIDA)显著快于 MICE 方法,展现出明显的计算优势。
  • 尽管计算速度更快,但在所有模拟情景下,GAIN 和 MIDA 在偏差、均方误差和覆盖率方面均持续劣于使用分类树的 MICE 方法。
  • 使用分类树的 MICE 方法在表现上大幅优于深度学习模型,尤其在包含连续变量和中等样本量的情境下。
  • GAIN 和 MIDA 产生了高度不稳定的插补结果,其在重复抽样中的变异度极大,表明其在重复抽样性质方面可靠性较差。
  • 即使在使用默认超参数(代表现实世界实践)的情况下,性能差距依然存在,表明问题并非单纯由调参不当引起。
  • 在 MICE 中,集成方法(如随机森林)并未提升性能,反而比单个分类树更耗时,表明在实践中使用分类树的 MICE 更为可取。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。