Skip to main content
QUICK REVIEW

[论文解读] Does imputation matter? Benchmark for predictive models

Katarzyna Woźnica, Przemysław Biecek|arXiv (Cornell University)|Jul 6, 2020
Statistical Methods and Bayesian Inference参考文献 10被引用 13
一句话总结

本文提出了首个针对13个真实世界分类数据集的实证基准,评估不同插补方法对机器学习模型预测性能的影响。研究发现,像随机插补和均值插补这样的简单方法通常优于更复杂的插补技术,但没有任何一种方法在所有模型和评估指标上始终占优,凸显了插补策略、模型类型与性能度量之间的强烈交互作用。

ABSTRACT

Incomplete data are common in practical applications. Most predictive machine learning models do not handle missing values so they require some preprocessing. Although many algorithms are used for data imputation, we do not understand the impact of the different methods on the predictive models' performance. This paper is first that systematically evaluates the empirical effectiveness of data imputation algorithms for predictive models. The main contributions are (1) the recommendation of a general method for empirical benchmarking based on real-life classification tasks and the (2) comparative analysis of different imputation methods for a collection of data sets and a collection of ML algorithms.

研究动机与目标

  • 建立一个系统化、可复现的基准,用于评估真实场景中插补方法对预测模型性能的影响。
  • 解决现有研究仅关注插补准确率而缺乏对插补技术与下游模型性能之间实证关联的评估这一不足。
  • 探究先进插补方法是否能在多种机器学习算法和数据集上一致地提升预测能力。
  • 探索插补策略、模型类型与性能度量之间的交互作用,揭示复杂依赖关系,挑战普遍性推荐。

提出的方法

  • 研究使用来自OpenML100的13个真实世界二分类数据集,且至少有一个特征包含缺失值。
  • 每个数据集按80%训练集和20%测试集进行划分,以评估模型在未见数据上的性能。
  • 评估七种插补方法:均值、随机、softImpute、missForest、VIM_hotdeck、VIM_kknn和mice_default,每种方法在各数据集上的成功率均有报告。
  • 在每个插补后的训练集上训练五种机器学习模型(glmnet、kknn、ranger、rpart、xgboost),并在测试集上使用F1和AUC指标进行评估。
  • 通过跨数据集的平均排名聚合性能结果,使用主成分分析(PCA)可视化插补方法与模型之间的交互关系。
  • 采用贪心搜索方法,识别出能最大化覆盖所有数据集和模型中最佳配置的插补方法序列。

实验结果

研究问题

  • RQ1不同插补方法如何影响机器学习模型在真实世界数据上的预测性能?
  • RQ2是否存在一种在多种数据集和机器学习算法中始终最优的插补方法?
  • RQ3性能度量(F1与AUC)如何影响插补技术的排名?
  • RQ4特定插补方法与特定机器学习模型之间存在何种交互作用?
  • RQ5元学习方法能否捕捉插补策略、数据结构与模型性能之间复杂且非均匀的关系?

主要发现

  • 在F1指标下,超过75%的最优配置中,简单插补方法如随机和均值插补表现最佳。
  • 在AUC指标下,表现最佳的插补组合为均值与VIM_kknn或mice_default的组合,尽管missForest和随机插补也表现出高度竞争力。
  • 没有任何一种插补方法在所有模型和度量下始终排名第一;性能高度依赖于评估指标的选择。
  • missForest在多种模型和度量下均获得最高或接近最高的排名,尤其在F1性能方面表现突出。
  • PCA分析揭示了基于模型兼容性的插补方法聚类:均值、missForest和VIM_kknn更适用于rpart和kknn,而mice则在ranger和xgboost上表现最佳。
  • 贪心搜索表明,结合随机、missForest和热插补可覆盖超过75%的F1最优配置,表明这些方法具有显著的互补性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。