Skip to main content
QUICK REVIEW

[论文解读] Missing Value Imputation for Mixed Data via Gaussian Copula

Yuxuan Zhao, Madeleine Udell|arXiv (Cornell University)|Oct 28, 2019
Statistical Methods and Inference参考文献 29被引用 6
一句话总结

本文提出了一种无需调优的半参数插补算法,用于混合数据(连续、有序和二值变量),基于高斯 copula 模型,保留边际分布和有序结构。该方法采用高效的近似 EM 算法,从未完全观测数据中估计 copula 参数,在多种真实和合成数据集上,其插补精度优于当前最先进方法。

ABSTRACT

Missing data imputation forms the first critical step of many data analysis pipelines. The challenge is greatest for mixed data sets, including real, Boolean, and ordinal data, where standard techniques for imputation fail basic sanity checks: for example, the imputed values may not follow the same distributions as the data. This paper proposes a new semiparametric algorithm to impute missing values, with no tuning parameters. The algorithm models mixed data as a Gaussian copula. This model can fit arbitrary marginals for continuous variables and can handle ordinal variables with many levels, including Boolean variables as a special case. We develop an efficient approximate EM algorithm to estimate copula parameters from incomplete mixed data. The resulting model reveals the statistical associations among variables. Experimental results on several synthetic and real datasets show superiority of our proposed algorithm to state-of-the-art imputation algorithms for mixed data.

研究动机与目标

  • 解决包含连续、有序和二值变量的混合数据集中缺失数据插补的挑战,因为分布不一致,标准方法会失效。
  • 开发一种尊重数据有序性质的方法,避免在将有序变量视为分类或连续变量时丢失排序信息。
  • 创建一种全自动、无参数的插补算法,无需超参数调优或对数据分布的先验知识。
  • 通过拟合的 copula 模型实现变量间统计关联的可解释建模。
  • 为具有缺失数据的高斯 copula 估计提供一种快速的频率学替代方法,替代现有的贝叶斯 MCMC 方法。

提出的方法

  • 使用高斯 copula 建模混合数据,假设每个观测变量是潜变量多元正态分布的单调变换。
  • 将有序变量表示为潜连续变量上的阈值,保留顺序关系的同时允许灵活的边际分布。
  • 开发一种近似 EM 算法,从未完全观测数据中估计 copula 相关系数和阈值参数,避免完整的 MCMC 采样。
  • 使用坐标轴单调变换,确保对数据缩放和变换的不变性,增强鲁棒性。
  • 通过拟合 copula 模型下的条件分布抽样来插补缺失值,利用完整的依赖结构。
  • 在 EM 算法中采用低秩近似,以提高计算效率,同时不损失准确性。

实验结果

研究问题

  • RQ1基于 copula 的模型能否有效处理具有缺失值的混合数据类型(连续、有序、二值),同时保留边际分布?
  • RQ2所提出的用于不完全混合数据的近似 EM 算法在准确性和速度上是否优于现有最先进插补方法?
  • RQ3与低秩矩阵补全和基于随机森林的插补方法相比,该方法在保留有序结构和处理高缺失率方面表现如何?
  • RQ4拟合的 copula 模型能否在真实世界数据集中揭示可解释的变量间统计关联?
  • RQ5该方法是否对数据的单调变换具有不变性,以满足实际应用中的鲁棒性要求?

主要发现

  • 所提出的 Copula-EM 方法在所有测试数据集上均实现了最低的 SMAE(对称平均绝对误差),包括电影评分、社会调查和健康数据,通常领先幅度显著。
  • 在缺失率为 30% 的 MovieLens 数据集上,Copula-EM 的 SMAE 为 0.799,优于 missForest(0.800)、imputeFAMD(0.823)和 xPCA(0.911)。
  • 在德国乳腺癌研究组(GBSG)数据集上,Copula-EM 对有序变量的 SMAE 为 0.793,对连续变量为 0.876,优于所有基线方法。
  • 在讲师评估(LEV)数据集上,Copula-EM 对标签的 SMAE 为 0.750,对特征的 SMAE 为 0.907,显著优于 missForest(分别为 0.970 和 0.799)。
  • 该方法表现出强鲁棒性和稳定性,在 100 次随机测试运行中标准误差较低,表明性能一致。
  • Copula-EM 显著快于贝叶斯 MCMC 方法,并在相同时间预算下产生更准确的估计,确立了其效率优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。