Skip to main content
QUICK REVIEW

[论文解读] On the Robustness of Decision Tree Learning under Label Noise

Aritra Ghosh, Naresh Manwani|arXiv (Cornell University)|May 20, 2016
Machine Learning and Data Classification参考文献 16被引用 9
一句话总结

本文从理论上证明,在大样本条件下,基于基尼系数、误分类率和二分不纯度度量的决策树学习算法对对称标签噪声具有鲁棒性。研究证明,从含噪数据中学到的最优划分规则会收敛到无噪数据下的最优规则,且样本复杂度界确保了高概率下的鲁棒性,该结论在UCI数据集上通过实证验证,表明即使在40%的噪声下,决策树和随机森林仍能保持高准确率。

ABSTRACT

In most practical problems of classifier learning, the training data suffers from the label noise. Hence, it is important to understand how robust is a learning algorithm to such label noise. This paper presents some theoretical analysis to show that many popular decision tree algorithms are robust to symmetric label noise under large sample size. We also present some sample complexity results which provide some bounds on the sample size for the robustness to hold with a high probability. Through extensive simulations we illustrate this robustness.

研究动机与目标

  • 研究在真实世界数据集中常见的对称标签噪声下,决策树学习的鲁棒性。
  • 为决策树在噪声环境下表现出的实证鲁棒性提供理论依据。
  • 推导样本复杂度界,以在大样本假设下确保高概率鲁棒性。
  • 将鲁棒性分析扩展至基于单个决策树特性的随机森林。
  • 在标签噪声水平逐步增加的条件下,通过实证比较决策树与SVM的性能。

提出的方法

  • 理论分析聚焦于基于不纯度的决策树学习,将对称标签噪声建模为独立同分布的翻转过程,翻转概率为η。
  • 证明在大样本极限下,含噪数据下的最优划分规则与无噪数据下的最优划分规则一致,适用于基尼系数、误分类率和二分规则。
  • 利用集中不等式推导样本复杂度界,以确保在噪声条件下划分规则的高概率收敛。
  • 通过证明集成中每棵树均继承相同的鲁棒性特性,将鲁棒性结果应用于随机森林。
  • 在UCI数据集上,通过逐步增加对称标签噪声(0%至40%)来实证评估决策树和随机森林的性能。
  • 在相同噪声条件下,对比不同损失函数(合页损失、逻辑损失、多项式损失)的SVM性能。

实验结果

研究问题

  • RQ1在大样本条件下,决策树学习是否仍对对称标签噪声保持鲁棒性?
  • RQ2能否推导出理论上的样本复杂度界,以保证高概率下的鲁棒性?
  • RQ3基于不纯度的划分规则(基尼系数、误分类率、二分)在对称标签噪声下是否仍能保持最优划分?
  • RQ4单个决策树的鲁棒性是否可推广至随机森林?
  • RQ5在标签噪声水平逐步增加的条件下,决策树的性能与SVM相比如何?

主要发现

  • 当样本量足够大时,使用基尼系数、误分类率或二分不纯度度量的决策树在对称标签噪声下仍能保持相同的最优划分规则。
  • 实证结果表明,即使在Spam和Magic等数据集上噪声达到40%,决策树和随机森林的准确率仍与无噪情况相差仅1-2%。
  • 在Spam数据集上,随机森林在30%噪声下准确率达91.68%,显著优于基于基尼系数的树(84.06%)和SVM(77.45%)。
  • 在German数据集上,随机森林在40%噪声下仍保持约69%的准确率,而基于基尼系数的树降至65.25%,SVM则降至60.9%。
  • 理论样本复杂度界表明,当每个节点的样本数超过由噪声水平和置信度导出的阈值时,鲁棒性以高概率成立。
  • SVM在对称标签噪声下表现出显著性能下降,在多个数据集上40%噪声时准确率低于70%,而决策树则表现稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。