[论文解读] TE2Rules: Explaining Tree Ensembles using Rules
TE2Rules 是一种新颖的方法,可为二叉树集成模型生成高保真度、可解释的规则,特别关注少数类(正类)。它使用 Apriori 算法挖掘多棵树中的决策路径,生成简洁、精确的规则,在正类上的保真度优于当前最先进的解释方法,同时保持运行时效率,并可通过提前停止实现运行时-保真度之间的权衡。
Tree Ensemble (TE) models, such as Gradient Boosted Trees, often achieve optimal performance on tabular datasets, yet their lack of transparency poses challenges for comprehending their decision logic. This paper introduces TE2Rules (Tree Ensemble to Rules), a novel approach for explaining binary classification tree ensemble models through a list of rules, particularly focusing on explaining the minority class. Many state-of-the-art explainers struggle with minority class explanations, making TE2Rules valuable in such cases. The rules generated by TE2Rules closely approximate the original model, ensuring high fidelity, providing an accurate and interpretable means to understand decision-making. Experimental results demonstrate that TE2Rules scales effectively to tree ensembles with hundreds of trees, achieving higher fidelity within runtimes comparable to baselines. TE2Rules allows for a trade-off between runtime and fidelity, enhancing its practical applicability. The implementation is available here: https://github.com/linkedin/TE2Rules.
研究动机与目标
- 为高风险应用(如医疗保健和欺诈检测)中使用的树集成模型,解决少数类(正类)缺乏忠实、可解释的解释问题。
- 开发一种基于规则的解释器,不仅整体保真度高,而且特别针对正类预测保持高保真度,而现有方法通常对正类解释不足。
- 支持从包含数百棵树的树集成中可扩展、高效的规则挖掘,以支持在真实系统中的实际部署。
- 通过在规则生成过程中允许提前停止,实现运行时与保真度之间的可调权衡。
- 确保生成的规则既精确(高正类预测率),又能覆盖正类预测的有意义部分。
提出的方法
- TE2Rules 通过识别在多个树中频繁共同出现、并导向正类预测的内部树节点来挖掘规则。
- 它应用 Apriori 算法,发现那些在正类预测中常被激活、但在负类预测中常被抑制的树节点组合。
- 每条规则均源自节点组合,指定必须满足的特征阈值,以使数据点能够遍历这些节点并获得正类预测。
- 通过贪心选择算法对规则进行后处理,保留最小规则集,以覆盖大多数正类预测,同时保持高保真度。
- 该算法支持最多 3 个阶段的增量处理,每个阶段发现更复杂的节点组合,从而提升正类上的规则质量和保真度。
- 支持提前停止:仅运行至第 2 或第 3 阶段即可实现接近最优的保真度,同时显著降低运行时间。
实验结果
研究问题
- RQ1基于规则的解释器能否在树集成模型中对少数类(正类)实现高保真度,而现有方法常在此类任务上失败?
- RQ2与单棵树或启发式规则提取相比,基于 Apriori 的多棵树节点组合挖掘如何提升规则质量和保真度?
- RQ3规则生成中的运行时与保真度之间存在何种权衡?提前停止是否能在降低计算成本的同时保持高保真度?
- RQ4TE2Rules 在包含数百棵树的大规模树集成上如何扩展?其性能与当前最先进的解释器相比如何?
- RQ5挖掘出的规则在多大程度上覆盖了正类预测?不同规则生成阶段的精确率与覆盖率如何变化?
主要发现
- 即使挖掘的规则数量少于 deFragTrees,TE2Rules 在正类上的保真度仍高于 inTrees 和 deFragTrees。
- 运行至第 3 阶段可获得最高的正类保真度,而第 2 阶段之后的增益微乎其微,表明对大多数应用场景而言,2–3 个阶段已足够。
- 尽管挖掘的规则数量多于 inTrees,TE2Rules 在正类保真度上仍优于 inTrees,证明其规则质量与覆盖范围更优。
- TE2Rules 的运行时间与当前最先进的解释器相当,第 3 阶段的执行仅比第 2 阶段略贵,得益于 Apriori 的高效剪枝。
- 后处理显著减少了规则数量,生成了一个紧凑、高精度的规则集,能以最小冗余解释大多数正类预测。
- 该方法实现了实用的运行时-保真度权衡:提前停止(如第 2 阶段)可显著降低计算量,同时对正类保真度的损失可忽略不计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。