[论文解读] Optimal Sparse Decision Trees
该论文提出了一种首个实用的最优稀疏决策树算法,通过分析界、自定义数据结构以及位向量库,在合理时间内实现可证明的最优性。该方法在基准数据集和高风险数据集(如 COMPAS、FICO)上优于现有方法(如 BinOCT 和 CART),能够处理数万至数百万条样本的问题,同时证明最优性或近似最优性。
Decision tree algorithms have been among the most popular algorithms for interpretable (transparent) machine learning since the early 1980's. The problem that has plagued decision tree algorithms since their inception is their lack of optimality, or lack of guarantees of closeness to optimality: decision tree algorithms are often greedy or myopic, and sometimes produce unquestionably suboptimal models. Hardness of decision tree optimization is both a theoretical and practical obstacle, and even careful mathematical programming approaches have not been able to solve these problems efficiently. This work introduces the first practical algorithm for optimal decision trees for binary variables. The algorithm is a co-design of analytical bounds that reduce the search space and modern systems techniques, including data structures and a custom bit-vector library. Our experiments highlight advantages in scalability, speed, and proof of optimality. The code is available at https://github.com/xiyanghu/OSDT.
研究动机与目标
- 为长期存在的决策树算法非最优性问题提供解决方案,因为这些算法通常采用贪心策略,导致次优结果。
- 开发一种可扩展且高效的算法,为二值特征保证最优或近似最优的决策树。
- 在刑事司法和信用风险等高风险领域中实现可解释模型的应用,这些领域对透明度和准确性要求极高。
- 提供最优性证明,证明在给定稀疏度水平下,不存在更优的决策树。
- 克服先前基于数学规划或 SAT 的最优决策树方法在可扩展性方面的局限。
提出的方法
- 该算法利用分析界显著缩小最优决策树的搜索空间。
- 采用仅存储叶节点的树表示方法,实现高效计算并利用对称性。
- 通过自定义的位向量库加速决策树评估,支持对多个数据点的并行计算。
- 结合快速搜索策略与计算重用机制,最大限度减少冗余计算。
- 将问题建模为正则化优化任务,平衡准确率与叶节点数量,采用定制约束的混合整数规划框架。
- 该方法在算法技术与系统级优化之间协同设计,包括用于中间结果的专用数据结构。
实验结果
研究问题
- RQ1我们能否设计一种实用算法,在数万至数百万条样本的真实世界数据集上,找到可证明最优的稀疏决策树?
- RQ2与先前的数学规划或 SAT 基础方法相比,分析界与系统级优化在速度和可扩展性方面表现如何?
- RQ3在刑事再犯和信用风险等高风险应用中,所提方法是否产生比贪心或启发式方法更优或更可靠的模型?
- RQ4当使用可证明最优的算法验证时,先前工作中关于最优性的现有声明在多大程度上成立?
- RQ5在不同数据集上,哪些算法组件——分析界、位向量评估、数据结构——对减少运行时间影响最大?
主要发现
- OSDT 首次为 COMPAS 和 FICO 数据集找到了可证明最优的稀疏决策树,而此前其他方法虽声称最优但未经验证。
- 在 Monk1 数据集上,OSDT 仅用 3.390 秒即达到最优性能,而正则化 BinOCT 在一小时后仍未完成,实现 17 倍速度提升。
- 在所有测试的基准数据集上,OSDT 在保持最优或近似最优稀疏度的同时,始终在准确率上优于 CART 和 BinOCT。
- 通过实现优化(包括位向量评估与计算重用),算法将运行时间减少了 97%。
- 在交叉验证实验中,OSDT 在相同稀疏度水平下,训练准确率始终高于 CART 和 BinOCT,且在多个数据集上对应提升了测试准确率。
- 消融研究证实,分析界与位向量评估是减少计算时间最关键的两个组件,其影响在不同数据集上均显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。