[论文解读] Probabilistic Missing Value Imputation for Mixed Categorical and Ordered Data
本文提出扩展高斯 Copula(EGC),一种无需超参数的混合类别型与有序数据概率模型,通过基于 argmax 的类别变量建模方式,利用潜变量高斯分布实现。该方法在合成与真实世界数据集上均实现了最先进的填补准确度,支持单次与多次填补,并在准确度与效率方面优于现有方法。
Many real-world datasets contain missing entries and mixed data types including categorical and ordered (e.g. continuous and ordinal) variables. Imputing the missing entries is necessary, since many data analysis pipelines require complete data, but this is challenging especially for mixed data. This paper proposes a probabilistic imputation method using an extended Gaussian copula model that supports both single and multiple imputation. The method models mixed categorical and ordered data using a latent Gaussian distribution. The unordered characteristics of categorical variables is explicitly modeled using the argmax operator. The method makes no assumptions on the data marginals nor does it require tuning any hyperparameters. Experimental results on synthetic and real datasets show that imputation with the extended Gaussian copula outperforms the current state-of-the-art for both categorical and ordered variables in mixed data.
研究动机与目标
- 解决包含类别型与有序变量的混合类型数据集中缺失值填补的挑战。
- 开发一种显式建模无序类别变量的概率填补方法,无需任意编码或预处理。
- 为下游分析提供支持单次与多次填补的不确定性量化。
- 构建一种对边缘分布无假设、无需超参数的模型。
- 在高维或长条形数据场景下,提升对 MICE、missForest 和 LRMC 等现有方法的鲁棒性与效率。
提出的方法
- 扩展高斯 Copula 将每个类别变量建模为潜变量高斯向量的 argmax,保留类别的无序特性。
- 有序变量(连续型与序数型)被建模为潜变量高斯标量,其依赖关系通过潜相关矩阵捕捉。
- 采用潜变量高斯 Copula 框架并显式建模边缘分布,实现无需假设边缘分布参数形式的联合分布估计。
- 提出一种稳健且可扩展的参数拟合算法,支持小批量训练、并行计算与低秩结构,以提升效率。
- 通过从全条件分布中抽样实现多次填补,提供类别概率与置信区间。
- 该模型具有可识别性,可匹配任意类别边缘分布,与先前方法中冗余参数的问题不同。
实验结果
研究问题
- RQ1概率填补模型能否在无需数据预处理或超参数调优的情况下,有效处理混合类别型与有序数据?
- RQ2基于 argmax 的潜变量高斯模型在混合数据中能否有效捕捉复杂依赖结构?
- RQ3扩展高斯 Copula 是否在填补准确度与计算效率方面均优于 MICE、missForest 与 softImpute 等最先进方法?
- RQ4该模型能否准确估计类别边缘分布,并在多次填补中有效传播不确定性?
- RQ5该方法在不同缺失数据机制与不同数据规模下的表现如何?
主要发现
- 扩展高斯 Copula(EGC)在合成与真实世界数据集上,对类别型与有序变量的填补准确度均达到最先进水平。
- 在 n=1000 的合成数据集中,EGC 的类别错误为 0.64(0.01),连续变量错误为 1.81(0.04),优于 missForest 与 softImpute。
- 在 n=10000 与 n=20000 的数据集中,EGC 分别保持 0.64(0.01) 与 0.64(0.01) 的类别错误,且显著快于 missForest。
- 该模型在类别边缘分布拟合方面表现出色,在 70 个数据集与不同类别数量下,估计概率与经验分布高度一致。
- 在 n=10000 时,EGC 的运行时间为 107(4) 秒,而 missForest 为 1006(70) 秒,尽管准确度更高,仍实现四倍加速。
- 该方法在类别数据上始终优于 softImpute,但在有序变量上表现较差,凸显了联合建模不同类型数据的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。