[论文解读] Exact Distributed Training: Random Forest with Billions of Examples
本文提出 DRF,一种用于在高达 180 亿个样本的数据集上进行精确分布式随机森林训练的算法,无需近似,采用基于深度层级和工作节点的架构,最大限度减少内存、磁盘和网络开销。该算法实现了最先进的可扩展性,在 22 小时内训练出包含 173 亿个样本的树模型,同时表明即使在超过十亿样本的规模下,模型性能仍随数据集增大而持续提升。
We introduce an exact distributed algorithm to train Random Forest models as well as other decision forest models without relying on approximating best split search. We explain the proposed algorithm and compare it to related approaches for various complexity measures (time, ram, disk, and network complexity analysis). We report its running performances on artificial and real-world datasets of up to 18 billions examples. This figure is several orders of magnitude larger than datasets tackled in the existing literature. Finally, we empirically show that Random Forest benefits from being trained on more data, even in the case of already gigantic datasets. Given a dataset with 17.3B examples with 82 features (3 numerical, other categorical with high arity), our implementation trains a tree in 22h.
研究动机与目标
- 开发一种分布式、精确的随机森林训练算法,避免在分裂选择中使用近似。
- 将随机森林训练扩展到超过 100 亿个样本的数据集,超越以往的精确与近似方法。
- 在分布式训练过程中,最小化对 RAM、磁盘 I/O、网络流量和 CPU 使用的计算复杂度。
- 通过实证验证,即使在十亿样本量级,随机森林仍能从更多数据中获益。
- 支持分布式特征重要性计算,并为依赖树的模型(如梯度提升树)提供支持。
提出的方法
- 算法按层级处理树结构,将数据集的列分布到各工作节点上,避免全局数据访问。
- 工作节点使用确定性的伪随机生成器,在无需网络通信的情况下同步各节点的自助采样结果。
- 使用位向量映射记录每个样本到叶节点的分配,每个样本仅需 ⌈log₂ℓ⌉ 位,其中 ℓ 为活动叶节点的数量。
- 分裂候选由分裂器工作节点并行评估,每个节点负责部分特征;树构建器协调节点分裂与树结构的生成。
- 管理器负责协调树构建器并聚合最终模型,确保与标准随机森林的精确等价性。
- 对大规模数据集中的数值特征使用外部排序,数据在工作节点间分区,以支持顺序访问。
实验结果
研究问题
- RQ1能否在不使用近似的情况下,使精确的分布式随机森林算法扩展到包含 100 亿个以上样本的数据集?
- RQ2在更大规模数据集(如 173 亿个样本)上训练是否能带来超越小规模数据集的模型性能提升?
- RQ3与现有精确方法(如 Sliq、Sprint)相比,所提出的 DRF 算法在内存、磁盘和网络复杂度方面表现如何?
- RQ4随着数据集规模和树深度的增加,AUC 等模型指标在多大程度上仍能持续提升?
- RQ5在精确框架中,能否高效支持分布式特征重要性计算以及依赖树模型(如 XGBoost 风格)的训练?
主要发现
- DRF 在 22 小时内成功训练出包含 173 亿个样本(82 个特征,其中 3 个为数值型,其余为高基数类别特征)的随机森林,创下新的规模纪录。
- 该模型在完整 173 亿个样本数据集上达到 AUC 0.847,且在深度 20 时性能仍在提升,表明学习能力尚未达到平台期。
- 在深度 20 时,173 亿个样本中 96.9% 的样本仍处于开放叶节点,表明剪枝无法带来显著的加速效果。
- 对于 1% 的数据,单个树的过拟合从深度 13 开始出现,而对于 100% 的数据,直到深度 17 才出现,表明在大规模下使用更深的树是可行的。
- 在深度 20 时,节点密度(0.415)和样本密度(0.969)表明,即使在高深度下,树结构依然高效且数据丰富。
- 该方法在空间、磁盘和网络复杂度方面优于以往的精确方法,并支持分布式特征重要性计算。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。