Skip to main content
QUICK REVIEW

[论文解读] Performance comparison of State-of-the-art Missing Value Imputation Algorithms on Some Bench mark Datasets

M. Naresh Kumar|arXiv (Cornell University)|Jul 22, 2013
Machine Learning and Data Classification参考文献 22被引用 3
一句话总结

本文提出RNI-II插补算法,该算法采用一种新颖的索引度量和距离计算方法,以提升数据集中的缺失值估计效果。在UCI和KEEL基准数据集上的评估表明,RNI-II在提升C4.5和GA-C4.5决策树分类器的分类准确率方面显著优于KNNI、WKNNI、KMI、FKMI和SVMI,且具有统计学显著性(p < 0.05)。

ABSTRACT

Decision making from data involves identifying a set of attributes that contribute to effective decision making through computational intelligence. The presence of missing values greatly influences the selection of right set of attributes and this renders degradation in classification accuracies of the classifiers. As missing values are quite common in data collection phase during field experiments or clinical trails appropriate handling would improve the classifier performance. In this paper we present a review of recently developed missing value imputation algorithms and compare their performance on some bench mark datasets.

研究动机与目标

  • 评估现代缺失值插补算法在真实世界基准数据集上的性能。
  • 解决临床和时间序列数据库中缺失值导致的分类器准确率下降问题。
  • 提出并验证RNI-II算法作为提升分类性能的更优插补方法。
  • 使用标准UCI和KEEL数据集,将RNI-II与KNNI、WKNNI、KMI、FKMI和SVMI进行比较。
  • 通过Wilcoxon符号秩检验建立RNI-II性能提升的统计学显著性。

提出的方法

  • RNI-II计算一种新颖的索引度量,以评估数据记录的相似性,从而实现对不完整记录间距离的更精确估计。
  • 该算法利用此索引度量计算数据点之间的接近度,替代插补中传统的欧几里得距离。
  • 通过基于新距离度量识别最相似的记录,并从邻近记录中分配值来执行插补。
  • 对于数值属性,使用相似邻近记录的均值;对于名义属性,选择众数。
  • 该方法与决策树分类器(C4.5和GA-C4.5)集成,以评估插补对分类准确率的影响。
  • 使用显著性水平α = 0.05的Wilcoxon符号秩检验验证性能差异的统计学显著性。

实验结果

研究问题

  • RQ1RNI-II插补算法在基准数据集上与KNNI、WKNNI、KMI、FKMI和SVMI相比,性能如何?
  • RQ2当处理缺失值时,RNI-II是否显著提升C4.5和GA-C4.5分类器的分类准确率?
  • RQ3与其它插补方法相比,RNI-II的性能提升是否具有统计学显著性?
  • RQ4RNI-II中新颖的索引度量在多大程度上提升了插补准确率,相较于传统基于距离的方法?
  • RQ5不同插补策略在多样化的真实世界数据集中对分类器性能有何影响?

主要发现

  • 在AUS数据集上,使用GA-C4.5分类器时,RNI-II的平均测试准确率达到85.65%,显著优于FKMI(81.45%)和KMI(81.16%)。
  • 在IRM数据集上,RNI-II使C4.5的准确率相比FKMI、KNNI和WKNNI提高了约8%。
  • Wilcoxon符号秩检验显示,将RNI-II与KMI、FKMI、KNNI和WKNNI比较时,p值为0.02或更低,证实了统计学显著性。
  • 对于GA-C4.5,RNI-II在所有对比方法中取得最高的正秩和(28),且p值≤0.05。
  • 与SVMI比较时,RNI-II未达到统计学显著性(p = 0.37),尽管在大多数数据集中仍表现出更高的准确率。
  • 可视化分析(图2–6)证实,RNI-II在所有数据集中持续产生更高的准确率增益,柱状图高于基线表明一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。