Skip to main content
QUICK REVIEW

[论文解读] Optimal Generalized Decision Trees via Integer Programming

Oktay Günlük, Jayant Kalagnanam|arXiv (Cornell University)|Dec 10, 2016
Machine Learning and Data Classification参考文献 20被引用 20
一句话总结

本文提出一种混合整数规划(MIP)公式,用于构建类别数据的最优决策树,支持类别特征的组合分支规则,并通过阈值化处理数值特征。该方法生成的树更小、更准确且更具可解释性,优于CART,在FICO的HELoc数据集和乳腺癌分类基准数据集上达到最先进性能。

ABSTRACT

Decision trees have been a very popular class of predictive models for decades due to their interpretability and good performance on categorical features. However, they are not always robust and tend to overfit the data. Additionally, if allowed to grow large, they lose interpretability. In this paper, we present a mixed integer programming formulation to construct optimal decision trees of a prespecified size. We take the special structure of categorical features into account and allow combinatorial decisions (based on subsets of values of features) at each node. Our approach can also handle numerical features via thresholding. We show that very good accuracy can be achieved with small trees using moderately-sized training sets. The optimization problems we solve are tractable with modern solvers.

研究动机与目标

  • 开发一种方法,为具有类别特征的二分类问题构建最优决策树,确保高准确率和可解释性。
  • 解决CART等启发式决策树算法的局限性,这些算法由于采用贪心、顺序的构建方式,常产生次优树。
  • 支持类别特征的灵活分支规则,例如将一组值(如“已婚”或“伴侣”)作为一个整体进行划分,提升模型表达能力。
  • 针对敏感性、特异性等特定性能指标进行优化,而不仅限于准确率,从而实现面向特定领域的模型设计。
  • 证明利用现代MIP求解器,即使在中等规模数据集上,也能高效计算出最优树。

提出的方法

  • 将最优决策树问题建模为混合整数线性规划(MILP),其中整数变量表示节点决策和分支规则。
  • 通过允许一组值定义分割,实现类别特征的组合分支规则,相比二值编码,显著提升模型表达能力。
  • 通过引入基于阈值的分割来处理数值特征,与CART风格的决策规则保持一致。
  • 通过预设树的大小(深度或节点数)来控制复杂度,防止过拟合。
  • 利用现代MIP求解器的分支定界法求解公式,实现在合理时间限制内达到最优或近似最优解。
  • 应用特定问题的有效不等式和预处理技术,减少求解时间,充分利用类别特征的结构特性。

实验结果

研究问题

  • RQ1精确的整数规划方法是否能在分类准确率和可解释性方面优于CART等启发式决策树算法?
  • RQ2与标准的二元分割相比,类别特征上的组合分支规则在多大程度上能提升模型性能?
  • RQ3最优决策树是否能在中等规模的真实世界数据集上实现足够高效的构建,以满足实际应用需求?
  • RQ4当优化目标为敏感性或特异性而非准确率时,最优树与启发式树的性能表现如何比较?
  • RQ5所提出的MIP公式在训练集规模增大时是否具有良好的可扩展性?通过特定问题的优化改进,能否有效降低求解时间?

主要发现

  • 在FICO HELoc数据集上,最优决策树(ODT)使用90%的数据构建深度为2的树,测试准确率达到71.6%,优于CART的71.0%。
  • 在乳腺癌数据集上,深度为2的ODT在满足95%训练敏感性约束下,测试敏感性(TPR)达到94.7%,同时保持93.0%的高特异性。
  • 在相同训练约束下,深度为2的ODT在敏感性上泛化能力优于深度为3的树,测试TPR达到94.7%,而深度为3的树为93.0%。
  • 在深度为2的树和100%训练敏感性约束下,ODT在乳腺癌数据集上实现了99.1%的特异性和79.6%的敏感性。
  • 在HELoc数据集上,ODT公式在405秒内求解至最优,证明其在中等规模数据集上的可计算性。
  • 当需要小型、高性能树时,ODT方法在准确率和可解释性方面始终优于CART。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。