QUICK REVIEW
[论文解读] Algorithm for Missing Values Imputation in Categorical Data with Use of Association Rules
Jiří Kaiser|arXiv (Cornell University)|Nov 8, 2012
Data Mining Algorithms and Applications参考文献 11被引用 8
一句话总结
本文提出了一种新颖的算法,用于使用关联规则对分类数据中的缺失值进行填补,提供了三种变体,其性能优于简单的众数填补方法。通过利用频繁项集和基于规则的推理,该方法在预测缺失类别方面实现了更高的准确性,证明了其在包含不完整分类信息的真实数据集中的有效性。
ABSTRACT
This paper presents algorithm for missing values imputation in categorical data. The algorithm is based on using association rules and is presented in three variants. Experimental shows better accuracy of missing values imputation using the algorithm then using most common attribute value.
研究动机与目标
- 为解决数据挖掘和机器学习中常见的分类数据集缺失值问题。
- 通过利用分类属性之间的关系,提升填补准确度,超越简单的基于众数的填补方法。
- 开发并评估一种基于关联规则的分类数据填补算法的三种变体。
- 使用准确率和错误率等定量指标,在真实数据集上验证该方法的性能。
提出的方法
- 该算法使用先验算法从完整数据中构建关联规则,以识别频繁项集并生成规则。
- 对于每个缺失值,该方法选择置信度最高的规则,其前提条件与实例的已知值匹配。
- 提出了三种变体:一种使用置信度最高的规则,一种使用多条规则进行投票,一种结合置信度和支持度阈值。
- 填补过程涉及将元组中已知属性值与规则的前提条件匹配,并使用结论预测缺失值。
- 该方法基于假设:事务中分类属性之间存在潜在依赖关系,这些关系通过关联规则捕捉。
- 评估使用准确率为首要指标,将填补结果与测试集中的实际值进行比较。
实验结果
研究问题
- RQ1关联规则能否有效捕捉分类属性之间的依赖关系,以提升缺失值填补的性能?
- RQ2与简单的众数填补方法相比,基于规则的填补方法在分类数据上的准确率如何?
- RQ3所提出的三种基于规则的填补算法变体之间性能差异为何?
- RQ4在规则选择中引入置信度和支持度阈值是否能提升填补的可靠性?
主要发现
- 所提出的算法在缺失分类值预测的准确度方面显著优于常见的众数填补方法。
- 采用多条规则进行投票的变体准确度最高,表明通过共识可提升鲁棒性。
- 使用关联规则使填补错误率相比基线方法有明显降低。
- 该方法在不同分类数据集上均表现出一致的性能,验证了其泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。