[论文解读] Transformed Distribution Matching for Missing Value Imputation
本文提出了一种新型无监督缺失值填补方法——变换分布匹配(Transformed Distribution Matching, TDM),该方法通过学习可逆变换将数据映射到潜在空间,在该空间中通过最优传输实现分布匹配。通过联合学习变换并基于Wasserstein距离最小化来填补缺失值,TDM在多种数据集和缺失机制下实现了最先进性能,且超参数调优极少。
We study the problem of imputing missing values in a dataset, which has important applications in many domains. The key to missing value imputation is to capture the data distribution with incomplete samples and impute the missing values accordingly. In this paper, by leveraging the fact that any two batches of data with missing values come from the same data distribution, we propose to impute the missing values of two batches of samples by transforming them into a latent space through deep invertible functions and matching them distributionally. To learn the transformations and impute the missing values simultaneously, a simple and well-motivated algorithm is proposed. Our algorithm has fewer hyperparameters to fine-tune and generates high-quality imputations regardless of how missing values are generated. Extensive experiments over a large number of datasets and competing benchmark algorithms show that our method achieves state-of-the-art performance.
研究动机与目标
- 解决在复杂、高维数据分布下填补缺失值的挑战。
- 开发一种无需显式建模完整数据分布或依赖真实缺失值知识的方法。
- 通过学习可逆变换更好地捕捉数据几何结构,从而改进现有分布匹配方法。
- 通过引入单一损失函数训练目标,减少对大量超参数调优的依赖。
- 在无需任务特定调整的情况下,实现对多种缺失机制(MCAR、MAR、MNAR)的稳健性能。
提出的方法
- 该方法使用深度可逆神经网络(INNs)将观测到的和不完整的数据样本映射到共享的潜在空间。
- 在潜在空间中,最小化两批变换后样本之间的Wasserstein-2距离,以实现分布对齐。
- 训练目标结合了观测值的重建损失和变换后批次间的最优传输距离,从而实现变换与填补的联合学习。
- 网络的可逆性可防止模型崩溃,并确保缺失值的忠实重建。
- 算法通过单一损失函数端到端训练,降低复杂度和对超参数的敏感性。
- 该方法对缺失机制具有不变性,因此在MCAR、MAR和MNAR设置下均表现稳健。
实验结果
研究问题
- RQ1与在数据空间中直接匹配相比,将数据变换到潜在空间是否能提升缺失值填补中的分布匹配效果?
- RQ2学习保持数据几何结构的可逆变换,是否能带来比标准分布匹配方法更优的填补质量?
- RQ3单一统一的损失函数是否能有效实现变换与填补的联合学习,且超参数调优极少?
- RQ4所提出方法在多种数据集和缺失机制(MCAR、MAR、MNAR)下的表现如何?
- RQ5潜在空间中更优的分布匹配是否能转化为下游任务(如分类)的更好性能?
主要发现
- TDM在广泛的数据集上实现了最先进性能,其在MAE、RMSE和W22指标上均优于现有方法,包括OTImputer、SoftImpute和MIRACLE。
- 平均而言,TDM在多种数据集和缺失机制下,相比次优基线方法,将MAE降低了最多15%。
- TDM在训练过程中表现出更优的稳定性,避免了在较小数据集(如glass和blood_transfusion)上OTImputer出现的过拟合问题。
- 当使用填补后的数据进行下游分类任务时,该方法能持续提升分类准确率,性能接近使用真实完整数据训练的模型。
- 尽管由于额外的变换学习,TDM每轮迭代速度约为OTImputer的2–3倍,但性能提升足以证明计算成本的合理性。
- 即使TDM并未在数据空间中直接最小化Wasserstein距离,其性能仍显著优于OTImputer,表明潜在空间匹配能更有效地捕捉数据几何结构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。