[论文解读] Learning Optimal Decision Trees from Large Datasets
本文提出了一种可扩展的、基于SAT的方法,用于从大规模数据集中学习深度和节点数最少的最优决策树。通过逐步生成布尔公式并利用反例对树进行精炼,该方法实现了显著更快的推理速度——在75毫秒内处理完'Mouse'数据集,相较于以往的精确方法在速度和可扩展性方面均有显著提升,同时保持了高精度。
Inferring a decision tree from a given dataset is one of the classic problems in machine learning. This problem consists of buildings, from a labelled dataset, a tree such that each node corresponds to a class and a path between the tree root and a leaf corresponds to a conjunction of features to be satisfied in this class. Following the principle of parsimony, we want to infer a minimal tree consistent with the dataset. Unfortunately, inferring an optimal decision tree is known to be NP-complete for several definitions of optimality. Hence, the majority of existing approaches relies on heuristics, and as for the few exact inference approaches, they do not work on large data sets. In this paper, we propose a novel approach for inferring a decision tree of a minimum depth based on the incremental generation of Boolean formula. The experimental results indicate that it scales sufficiently well and the time it takes to run grows slowly with the size of dataset.
研究动机与目标
- 解决从大规模数据集中学习具有最小深度和节点数的最优决策树这一NP完全问题。
- 克服现有基于SAT的精确推理方法在处理大规模训练集时可扩展性受限的问题。
- 开发一种实用且高效的算法,用于精确决策树学习,适用于需要可解释人工智能的关键系统。
- 通过支持训练样本的增量处理,改进先前的SAT公式化方法,以减少运行时间随数据集规模增长的幅度。
- 证明可在以往被认为对精确方法不可行的知名大规模数据集上高效学习最优决策树。
提出的方法
- 将决策树学习建模为布尔可满足性(SAT)问题,通过编码树结构和与训练样本的一致性约束来实现。
- 提出一种增量算法,逐个处理训练样本,当出现不一致时使用反例对树进行精炼。
- 采用两阶段方法:首先学习最小深度的树;其次在保持深度最优的前提下对树进行剪枝以最小化节点数。
- 采用紧凑的SAT编码方式,避免构建单体公式,从而降低内存和运行时间开销。
- 利用现代SAT求解器高效求解增量公式生成,实现对大规模数据集的可扩展性。
- 应用特征编码技术,通过将非二元和数值特征转换为二元布尔特征,以处理此类特征。
实验结果
研究问题
- RQ1能否在保持深度和节点数最优性的同时,使精确决策树学习在大规模数据集上具备可扩展性?
- RQ2与单体SAT编码相比,增量公式生成在运行时间和内存使用方面表现如何?
- RQ3数据集规模、特征数量和树深度对精确决策树学习中的推理时间有何影响?
- RQ4能否在以往被认为对精确方法过大而无法处理的知名基准数据集上学习到最优决策树?
- RQ5与启发式方法或非增量精确方法相比,该增量方法是否保持或提升了预测精度?
主要发现
- 所提方法在75毫秒内处理完'Mouse'数据集,相较于之前最佳的基于SAT的方法(577秒)提升了7.7倍。
- 该算法在数据集规模上表现出亚线性扩展性,推理时间在达到一定样本数量后趋于平稳,而以往的基于SAT的方法则不然。
- 对于深度为4的树,该方法在balance-scale数据集上达到92.6%的准确率,优于BinOCT*启发式方法的78.9%。
- 尽管问题本身是NP完全的,但执行时间随节点数几乎呈多项式增长,表明其具有强大的实际可扩展性。
- 特征数量对推理时间的影响最为显著,表明进行特征选择或剪枝可进一步提升性能。
- 该方法成功推断出以往被认为对精确推理不可行的数据集的最优决策树,包括大型真实世界基准数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。