[论文解读] Pruning Random Forests for Prediction on a Budget
本文提出了一种针对随机森林的自底向上剪枝方法,在预算约束下优化预测准确率与特征获取成本之间的权衡。通过将剪枝建模为带有特征重用约束的0-1整数规划问题,并证明其约束矩阵的全单峰性,该方法可借助线性规划松弛和原始-对偶算法在多项式时间内实现最优剪枝,相较于现有最先进方法在基准数据集上实现了极小的准确率损失与显著的成本降低。
We propose to prune a random forest (RF) for resource-constrained prediction. We first construct a RF and then prune it to optimize expected feature cost & accuracy. We pose pruning RFs as a novel 0-1 integer program with linear constraints that encourages feature re-use. We establish total unimodularity of the constraint set to prove that the corresponding LP relaxation solves the original integer program. We then exploit connections to combinatorial optimization and develop an efficient primal-dual algorithm, scalable to large datasets. In contrast to our bottom-up approach, which benefits from good RF initialization, conventional methods are top-down acquiring features based on their utility value and is generally intractable, requiring heuristics. Empirically, our pruning algorithm outperforms existing state-of-the-art resource-constrained algorithms.
研究动机与目标
- 解决大规模分类系统中资源受限的预测问题,其中特征获取会产生成本或延迟。
- 在不降低预测准确率的前提下,降低随机森林的平均特征获取成本。
- 开发一种全局最优的剪枝策略,利用特征重用并联合剪枝集成中的所有树。
- 通过采用自底向上、基于初始化的方法,克服传统自顶向下特征选择方法的不可解性。
- 通过对偶性与网络流理论,实现大规模数据集上的可扩展、高效剪枝。
提出的方法
- 将随机森林剪枝建模为带有约束的0-1整数线性规划问题,以促进树之间特征的重用。
- 证明约束矩阵的全单峰性,确保线性规划松弛能获得最优整数解。
- 基于网络流理论设计一种原始-对偶算法,以实现大规模数据集上的可扩展性。
- 以预训练的随机森林作为初始化,随后剪枝各棵树以最小化经验误差与平均特征成本。
- 建模特征获取成本,使得在单个样本上重复使用某一特征不会产生额外成本(仅首次获取时计费)。
- 将该方法应用于均匀与非均匀特征成本设置,证明其对成本异质性的鲁棒性。
实验结果
研究问题
- RQ1自底向上的剪枝方法是否能在资源受限预测中实现优于自顶向下特征选择的成本-准确率权衡?
- RQ2在剪枝过程中强制实施特征重用是否能实现显著的成本降低,同时保持准确率损失最小?
- RQ3由于全单峰性,是否能通过线性规划松弛在多项式时间内最优求解剪枝问题?
- RQ4与现有算法相比,该方法在非均匀特征成本下的表现如何?
- RQ5分裂准则的选择(如信息熵 vs. Pairs)是否会影响剪枝结果与成本-准确率权衡?
主要发现
- 在MiniBooNE数据集上,剪枝将平均特征成本从7.3降低至0.2,同时保持测试误差为6.6%。
- 剪枝后,68.3%的测试样本不再使用某一特定特征,显著降低了获取成本,且准确率损失可忽略不计。
- 所提出的BudgetPrune方法优于CCP与GreedyPrune,尤其在非均匀特征成本下,CCP性能急剧下降。
- 基于Pairs分裂准则的剪枝在低成本环境下实现了更高准确率,而基于信息熵的森林在高成本环境下表现更优。
- 原始-对偶算法能高效扩展至大规模数据集,得益于全单峰性,可通过线性规划松弛实现最优剪枝。
- 该方法对随机特征子集大小(k=20 vs. k=120)的变化表现出鲁棒性,BudgetPrune在较大k值下仍保持优异性能,而GreedyPrune则在大k值下失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。