Skip to main content
QUICK REVIEW

[论文解读] Generalized Linear Rule Models

Dennis Wei, Sanjeeb Dash|arXiv (Cornell University)|Jun 5, 2019
Bayesian Modeling and Causal Inference参考文献 28被引用 16
一句话总结

本文提出了一种基于列生成的广义线性规则模型,用于在回归和概率分类任务中对指数级庞大的基于规则的特征空间进行优化。通过迭代求解混合整数规划或启发式子问题以生成高质量规则,该方法在准确率-复杂度权衡方面优于现有的规则集成方法,在保持可解释性的同时,其性能可与树集成和非线性SVM等较难解释的模型相媲美或超越。

ABSTRACT

This paper considers generalized linear models using rule-based features, also referred to as rule ensembles, for regression and probabilistic classification. Rules facilitate model interpretation while also capturing nonlinear dependences and interactions. Our problem formulation accordingly trades off rule set complexity and prediction accuracy. Column generation is used to optimize over an exponentially large space of rules without pre-generating a large subset of candidates or greedily boosting rules one by one. The column generation subproblem is solved using either integer programming or a heuristic optimizing the same objective. In experiments involving logistic and linear regression, the proposed methods obtain better accuracy-complexity trade-offs than existing rule ensemble algorithms. At one end of the trade-off, the methods are competitive with less interpretable benchmark models.

研究动机与目标

  • 开发一种广义线性模型方法,结合基于规则的特征,以提升可解释性与建模灵活性。
  • 解决在不预先生成候选规则或使用贪心规则添加策略的前提下,搜索指数级庞大规则空间的挑战。
  • 优化预测准确率与规则集复杂度之间的权衡,以规则数量和长度作为衡量指标。
  • 通过二值化处理同时支持二元与数值特征,同时保持计算可行性。
  • 证明规则集成模型可在保持高性能的同时,与树集成和非线性SVM等非可解释模型性能相当。

提出的方法

  • 使用列生成(CG)技术,从指数级庞大的规则空间中动态生成规则,无需预先计算候选规则集。
  • 通过整数规划或启发式方法求解CG子问题,以优化相同的目标准则函数。
  • 在回归和概率分类任务中应用广义线性模型(GLM),将规则作为特征输入。
  • 采用特征二值化:对分类变量使用独热编码,对数值特征使用双向阈值化处理。
  • 在每次CG迭代中重新拟合GLM,允许规则权重被更新或丢弃,避免逐个贪心添加规则。
  • 提出两种变体:LRR(N)用于通用规则生成,LR1(N)用于一阶规则生成;当与数值特征结合时,可构成广义可加模型(GAM)。

实验结果

研究问题

  • RQ1列生成能否有效应用于非线性广义线性模型中的规则集成学习?
  • RQ2所提方法是否在准确率-复杂度权衡方面优于现有规则集成算法?
  • RQ3当规则数量达到数百个时,规则集成模型是否仍能保持可解释性,同时与非可解释模型性能相当?
  • RQ4在回归与分类任务中,高阶规则(交互项)与一阶规则相比,其预测性能如何?
  • RQ5基于启发式的列生成结合自适应二值化,能否提升模型性能,特别是在回归任务中?

主要发现

  • 所提LRR(N)方法在分类与回归任务中,均优于RuleFit及其他规则集成方法,在准确率-复杂度权衡方面表现更优。
  • 在MEPS数据集上,LRR(N)实现了平均$R^2$为0.789,仅使用108.2个加权规则,其复杂度低于RuleFit(N),同时保持了具有竞争力的性能。
  • 在分类任务中,LRR(N)实现了平均AUC为0.618,仅使用61.8个加权规则,在准确率与复杂度方面均优于RuleFit。
  • Friedman检验显示在回归任务中具有统计显著性(p值为0.046),LRR(N)在模型质量上显著优于LR1(N)。
  • 权衡曲线表明,仅使用数十个规则的模型通常可达到接近最大性能,从而可在不造成显著准确率损失的前提下实现大幅简化。
  • 该方法在性能上可与非线性SVM和树集成模型相媲美,同时通过稀疏的基于规则的表示保持了可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。