[论文解读] A Scalable MIP-based Method for Learning Optimal Multivariate Decision Trees
该论文提出了一种基于1-范数支持向量机(SVM)的新型混合整数规划(MIP)公式SVM1-ODT,用于训练最优多变量决策树,相较于以往的MIP和启发式方法,其在样本外准确率上提升了6%–20%。该方法引入了割平面技术以收紧松弛问题,并提出了一种基于线性规划(LP)的数据选择方法,使模型能够训练规模高达245,000个样本的数据集,突破了以往基于MIP方法5,500个样本的限制。
Several recent publications report advances in training optimal decision trees (ODT) using mixed-integer programs (MIP), due to algorithmic advances in integer programming and a growing interest in addressing the inherent suboptimality of heuristic approaches such as CART. In this paper, we propose a novel MIP formulation, based on a 1-norm support vector machine model, to train a multivariate ODT for classification problems. We provide cutting plane techniques that tighten the linear relaxation of the MIP formulation, in order to improve run times to reach optimality. Using 36 data-sets from the University of California Irvine Machine Learning Repository, we demonstrate that our formulation outperforms its counterparts in the literature by an average of about 10% in terms of mean out-of-sample testing accuracy across the data-sets. We provide a scalable framework to train multivariate ODT on large data-sets by introducing a novel linear programming (LP) based data selection method to choose a subset of the data for training. Our method is able to routinely handle large data-sets with more than 7,000 sample points and outperform heuristics methods and other MIP based techniques. We present results on data-sets containing up to 245,000 samples. Existing MIP-based methods do not scale well on training data-sets beyond 5,500 samples.
研究动机与目标
- 为解决CART和C4.5等启发式决策树方法的次优性问题,这些方法采用贪心策略逐次进行分裂决策,而未考虑未来分裂的影响。
- 克服现有基于MIP的最优决策树(ODT)方法在可扩展性方面的局限,这些方法在数据集超过约5,500个样本后因变量和约束数量急剧增加而难以处理。
- 开发一种稳健且可扩展的框架,用于训练多变量ODT,通过受1-范数SVM启发的MIP公式,最大化分类间隔和分类准确率。
- 通过引入一种新型基于LP的数据选择方法,提升基于MIP的ODT训练在大规模真实世界数据上的可处理性,同时保留完整数据集中的关键信息。
提出的方法
- 提出一种新的MIP公式SVM1-ODT,采用1-范数SVM目标函数以最大化分类间隔和正确分类的样本数,支持多变量分裂。
- 引入割平面技术以收紧MIP公式的线性松弛,减少整数性间隙,加速最优解的收敛。
- 通过重构方法消除大M(big-M)约束,提升数值稳定性与解的质量。
- 提出一种基于LP的数据选择方法,在MIP训练前选择具有代表性的数据点子集,保留关键信息的同时减小问题规模。
- 将所选子集用于通过SVM1-ODT MIP模型训练ODT,针对每组数据集调整参数以平衡准确率与运行时间。
- 采用两阶段训练流程:先进行数据选择,再进行最优树学习,从而实现对超过245,000个样本数据集的可扩展性训练。
实验结果
研究问题
- RQ1基于1-范数SVM的MIP公式是否能在多变量决策树的样本外分类准确率上超越现有MIP和启发式方法?
- RQ2如何通过技术手段收紧MIP松弛,以提升大规模ODT训练的求解速度与最优性间隙?
- RQ3基于LP的数据选择方法是否能有效减少训练数据规模,同时保持大规模数据集上的模型性能?
- RQ4所提出方法在突破以往基于MIP的ODT方法5,500个样本限制的大数据集上,其可扩展性如何?
- RQ5SVM1-ODT与数据选择方法的结合是否能在多种真实世界数据集上持续提升准确率与效率?
主要发现
- 在20个UCI数据集(树深度为2)上,SVM1-ODT公式相较于最先进的MIP和启发式方法,平均提升了6%–10%的样本外测试准确率。
- 在树深度为3时,该方法在测试准确率上实现了平均17%–20%的提升,表明其在深层树结构中也表现出色。
- 基于LP的数据选择方法可将训练样本数量减少至原始数据集的1%–12%,同时保持高准确率,使模型能够处理高达245,000个样本的数据集。
- 在大型数据集如Avila(104,300个样本)和skin-segmentation(245,057个样本)上,该方法在树深度为3时分别实现了86.3%和94.9%的测试准确率,优于CART和OCT-H。
- 该方法在准确率与可扩展性方面均持续优于基线MIP模型和启发式基线,且在大规模数据集上的训练时间控制在4小时以内。
- 引入割平面与移除大M约束显著提升了MIP松弛的紧致性,从而缩短了求解时间并改善了最优性间隙。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。