QUICK REVIEW
[论文解读] Unbiased Measurement of Feature Importance in Tree-Based Methods
Zhengze Zhou, Giles Hooker|arXiv (Cornell University)|Mar 12, 2019
Statistical Methods and Inference参考文献 42被引用 17
一句话总结
本文通过使用袋外样本的分裂改进分数来校正传统分裂改进(基尼重要性)中固有的偏差,提出了一种针对树模型的无偏特征重要性度量方法。该方法能有效减少对连续特征或高基数分类特征的虚假重要性估计,并在原假设下确保无偏估计,计算开销极低,且可轻松集成到 scikit-learn 和 randomForest 等现有库中。
ABSTRACT
We propose a modification that corrects for split-improvement variable importance measures in Random Forests and other tree-based methods. These methods have been shown to be biased towards increasing the importance of features with more potential splits. We show that by appropriately incorporating split-improvement as measured on out of sample data, this bias can be corrected yielding better summaries and screening tools.
研究动机与目标
- 解决已知的分裂改进特征重要性度量中对具有更多潜在分裂点的特征存在系统性偏倚的问题,尤其针对连续特征或高基数分类变量。
- 开发一种简单、计算高效的修正方法,利用袋外样本或保留数据估计分裂改进,避免对训练数据的过拟合。
- 提供一种理论基础坚实的无偏替代方案,作为 scikit-learn 和 randomForest 等主流库中当前使用有偏样本内度量的默认特征重要性方法。
- 通过模拟和真实数据集的实证验证,证明该方法在特征筛选和排序方面具有更高的可靠性。
- 通过确保无预测能力的特征在期望下获得零重要性,提升模型解释性和下游分析的可信度。
提出的方法
- 该方法将样本内分裂改进替换为袋外样本或保留数据上的分裂改进,以避免过拟合。
- 对于随机森林中的每棵树,分裂时的基尼不纯度减少量均在袋外样本上计算,而非用于构建树的训练集。
- 最终的特征重要性为所有树和所有分裂点的袋外分裂改进值的平均值,从而实现无偏估计。
- 该方法与现有树构建框架兼容,仅需极少代码修改,仅需调整分裂改进的聚合方式。
- 该方法可扩展至诚实树或任何具有自然测试集的场景,如交叉验证或保留划分。
- 提供了理论依据,证明在原假设下(无预测能力),期望重要性为零。
实验结果
研究问题
- RQ1随机森林中的标准分裂改进度量是否系统性地偏向于具有更多潜在分裂点的特征?
- RQ2袋外分裂改进估计能否纠正此偏差,并产生更可靠的特征重要性排序?
- RQ3所提出的无偏度量与现有方法(如置换重要性和 cforest)在真实世界和模拟数据中的表现如何比较?
- RQ4该方法对不同类型的特征(如二值、分类和连续变量)是否具有鲁棒性?
- RQ5该无偏度量能否支持树模型中的正式统计推断,如假设检验或置信区间?
主要发现
- 随机森林中的标准分裂改进度量显著偏向于具有更多潜在分裂点的特征,如连续特征或高基数分类变量。
- 在包含10个噪声特征的模拟实验中,所提出的无偏特征重要性(UFI)正确识别出唯一的真实预测变量,而标准分裂改进(SI)却将一个噪声特征排在更高位置。
- 在 Adult 和 Boston Housing 数据集上,UFI 产生的特征排序比 SI 更为合理且一致,噪声特征的重要性接近于零。
- UFI 的重要性得分与两种前沿方法 cforest 和 ranger 的结果高度一致,表明其具有强大的实证有效性。
- 该方法无需额外计算成本,因为袋外样本在随机森林训练过程中已自动生成。
- 理论分析证实,无预测能力的特征在该方法下期望重要性为零,满足无偏性要求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。