Skip to main content
QUICK REVIEW

[论文解读] LIBRE: Learning Interpretable Boolean Rule Ensembles

Graziano Mita, Paolo Papotti|arXiv (Cornell University)|Nov 15, 2019
Explainable Artificial Intelligence (XAI)参考文献 35被引用 5
一句话总结

LIBRE 是一种新颖的集成方法,通过结合基于随机特征子集的自底向上弱学习器,学习可解释的布尔规则集合,从而在平衡和非平衡数据中实现强大的泛化能力。它在保持高度紧凑、人类可读的规则集合的同时,实现了与黑箱模型相当的预测性能,优于现有基于规则的方法在可解释性和可扩展性方面的表现,并原生支持缺失值处理。

ABSTRACT

We present a novel method - LIBRE - to learn an interpretable classifier, which materializes as a set of Boolean rules. LIBRE uses an ensemble of bottom-up weak learners operating on a random subset of features, which allows for the learning of rules that generalize well on unseen data even in imbalanced settings. Weak learners are combined with a simple union so that the final ensemble is also interpretable. Experimental results indicate that LIBRE efficiently strikes the right balance between prediction accuracy, which is competitive with black box methods, and interpretability, which is often superior to alternative methods from the literature.

研究动机与目标

  • 为解决在传统基于规则的方法难以捕捉少数类的非平衡数据设置中,学习可解释且准确的分类器的挑战。
  • 通过集成学习克服现有基于规则的学习方法的局限性——如规则数量过多、泛化能力差、对噪声和数据碎片敏感——从而提升性能。
  • 在保持可解释性的同时,通过紧凑的规则集合(规则数量少、规则长度短)实现与黑箱模型相当的预测性能。
  • 原生支持类别型和连续型特征中的缺失值处理,无需预处理步骤,提升实际应用价值。
  • 通过特征子采样和高效的规则生成,降低计算负担,实现对大规模数据集的有效扩展。

提出的方法

  • LIBRE 采用自底向上的弱学习器集成,通过单调布尔函数合成生成规则,从单个样本出发,基于覆盖率和准确率进行泛化。
  • 每个弱学习器在随机特征子集上运行,减少过拟合,提升泛化能力,尤其在非平衡场景下表现更优。
  • 所有弱学习器生成的候选规则通过简单的并集操作合并,避免使用复杂的元模型或加权方案,从而保持可解释性。
  • 方法不对规则大小或支持度施加人为约束,允许发现复杂而有意义的模式,同时通过集成平均实现规则集合的紧凑性。
  • 规则选择以可解释性为目标,优先选择规则数量少、冗余度低的集合,通过 F1 分数和规则数量等指标进行评估。
  • 框架原生支持类别型和连续型特征中的缺失值,无需进行插补或二值化等预处理步骤。

实验结果

研究问题

  • RQ1基于自底向上的规则学习器的集成是否能在非平衡数据集中提升泛化能力和鲁棒性,同时保持可解释性?
  • RQ2与最先进基于规则的方法相比,LIBRE 在预测性能、规则集合紧凑性和可扩展性方面表现如何?
  • RQ3LIBRE 在无需数据预处理的情况下,对缺失值的处理能力有多强?这种能力对性能有何影响?
  • RQ4通过并集方式组合自底向上的学习器,是否能在保持可解释性的同时,实现与黑箱模型相当的性能?
  • RQ5与现有基于规则的学习方法相比,LIBRE 在数据集规模和特征维度增加时的可扩展性如何?

主要发现

  • LIBRE 在非平衡设置下取得与 XGBoost 和随机森林等黑箱模型相当的 F1 分数,尤其在其他基于规则的方法失效的场景中表现突出。
  • 在 Liver 和 Adult 数据集中,LIBRE 生成的规则集合最为紧凑——规则数量少于 10 个——同时保持了高 F1 分数,在可解释性方面优于 ripper-k、s-brl 和 brs。
  • 对于包含大量缺失值的 Sap-Full 数据集,LIBRE 在无需预处理的情况下仍保持强劲性能,而 ripper-k、brs 和 modlem 则需对连续特征进行预处理。
  • 在可扩展性测试中,LIBRE 在 100 万条记录的数据集上训练时间不足 400 秒(399±8 秒),而 modlem 和 brs 在相同数据集上因内存溢出而失败。
  • LIBRE 的运行时间随数据集规模呈次线性增长,其弱学习器分别处理正样本和负样本集合,显著降低了大规模数据集的计算负担。
  • 该方法生成高度可解释的模型:在 Adult 和 Bank 等大规模数据集上,平均生成的规则数量少于 10 个,且规则长度膨胀极小;而 s-brl 的规则复杂度随规则数量迅速增加。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。