[论文解读] Large Random Forests: Optimisation for Rapid Evaluation
本文提出一种将大型随机森林压缩为单个语义等价的代数决策图(ADD)的方法,使分类速度提升几个数量级,同时内存使用量减少高达99.99%。该方法通过基于ADD的聚合、多数投票抽象和不可行路径消除,消除冗余而不改变预测准确率或方差。
Random Forests are one of the most popular classifiers in machine learning. The larger they are, the more precise is the outcome of their predictions. However, this comes at a cost: their running time for classification grows linearly with the number of trees, i.e. the size of the forest. In this paper, we propose a method to aggregate large Random Forests into a single, semantically equivalent decision diagram. Our experiments on various popular datasets show speed-ups of several orders of magnitude, while, at the same time, also significantly reducing the size of the required data structure.
研究动机与目标
- 解决大型随机森林分类运行时间过长的问题,其运行时间与树的数量呈线性关系。
- 在不改变预测语义或方差的前提下,减少内存占用并提高评估效率。
- 探索使用代数与语义优化技术,将整个森林整体聚合为紧凑的决策图。
- 评估基于决策图的优化方法是否在速度和大小缩减方面优于现有方法。
提出的方法
- 通过固定谓词排序的规范聚合,将随机森林转换为单个代数决策图(ADD)。
- 通过在编译时预先计算各类别频率,应用组合式抽象以降低结构复杂度。
- 通过将多数投票结果合并为每条路径的单一值,执行非组合式抽象,以保持分类语义。
- 使用类似“无关项”的最小化方法,消除具有矛盾谓词的不可行路径,进一步减小尺寸并提升评估速度。
- 利用ADD特有的操作(如连接、加法和约简)优化运行时间和内存使用。
- 采用变量排序启发式方法最小化最终图的大小,确保结果为规范且最小的表示形式。
实验结果
研究问题
- RQ1大型随机森林能否在保持分类准确率和方差的前提下被压缩为单个决策图?
- RQ2与标准随机森林评估相比,基于ADD的聚合在多大程度上能减少分类时间和内存占用?
- RQ3对不可行路径的消除是否能防止指数级膨胀,并在实际中进一步提升性能?
- RQ4在尺寸和速度增益方面,组合式与非组合式抽象有何差异?
- RQ5该方法能否推广到标准UCI数据集之外的其他分类器或数据类型?
主要发现
- 所提方法实现了数个数量级的速度提升,在标准UCI数据集上,分类时间最高减少至原来的1/1000。
- 在某些情况下,内存使用量减少了高达99.99%,最终决策图远小于原始森林。
- 在Balance Scale数据集上,森林节点数从2,158,330个压缩至仅144个,减少了99.99%。
- 在Breast Cancer数据集上,节点数从5,494,682个减少至3,760个,尺寸缩减了99.93%,准确率损失极小。
- 不可行路径消除有效防止了指数级膨胀,并进一步减小了图的大小,甚至使部分图比原始森林更小。
- 该方法保持了原始随机森林的方差和预测准确率,确认了所有测试用例中语义等价性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。