Skip to main content
QUICK REVIEW

[论文解读] An Efficient and Robust System for Vertically Federated Random Forest

Houpu Yao, Jiazhou Wang|arXiv (Cornell University)|Jan 26, 2022
Privacy-Preserving Technologies in Data被引用 8
一句话总结

本文提出了一种高效且鲁棒的垂直联邦随机森林系统,相较于最先进的SecureBoost,训练速度最快提升83倍,推理速度最快提升25倍,通过优化同态加密、安全多方计算以及并行化树训练实现。该系统支持实时推理,可扩展至数百万条记录,具备高分区容错能力,在保持相当准确率的同时保护数据隐私。

ABSTRACT

As there is a growing interest in utilizing data across multiple resources to build better machine learning models, many vertically federated learning algorithms have been proposed to preserve the data privacy of the participating organizations. However, the efficiency of existing vertically federated learning algorithms remains to be a big problem, especially when applied to large-scale real-world datasets. In this paper, we present a fast, accurate, scalable and yet robust system for vertically federated random forest. With extensive optimization, we achieved $5 imes$ and $83 imes$ speed up over the SOTA SecureBoost model \cite{cheng2019secureboost} for training and serving tasks. Moreover, the proposed system can achieve similar accuracy but with favorable scalability and partition tolerance. Our code has been made public to facilitate the development of the community and the protection of user data privacy.

研究动机与目标

  • 为解决现有垂直联邦学习系统在大规模真实世界数据集上训练和推理效率低下的问题。
  • 设计一种系统,在保持高准确率的同时,相比SOTA方法(如SecureBoost)显著提升速度和可扩展性。
  • 确保在金融和医疗等隐私关键应用场景中的生产级部署中具备鲁棒性和分区容错能力。
  • 通过优化通信、计算和系统架构,实现低延迟服务,支持实时推理。
  • 提供一个公开可用、可投入生产的系统,支持多方之间的数据隐私保护和高效模型训练。

提出的方法

  • 该系统采用一种新颖的联邦随机森林算法,可在不暴露原始特征数据的情况下,实现跨多个参与方的安全分布式决策树训练。
  • 集成定制化的同态加密方案,以在跨参与方计算过程中保护特征值,确保数据隐私。
  • 使用安全多方计算(MPC)安全计算信息增益和分裂点,最大限度减少信息泄露。
  • 优化通信协议,通过减少参与方之间的数据传输量来降低延迟,尤其是在特征聚合和分裂点选择阶段。
  • 采用分布式架构,隔离单个决策树,支持通过增加机器实现水平扩展,并支持批处理以实现高吞吐量推理。
  • 应用四阶段优化流水线(O1–O4):RIAC用于安全聚合,MPC用于分裂计算,优化通信,以及流式处理/批处理用于推理加速。

实验结果

研究问题

  • RQ1垂直联邦随机森林系统能否在保持相当准确率的同时,相比现有SOTA方法(如SecureBoost)实现显著更快的训练和推理速度?
  • RQ2同态加密与MPC如何高效结合,以在不损害性能的前提下实现安全、可扩展的树学习?
  • RQ3系统级优化(如通信减少、并行化和批处理)在联邦学习中对实时推理的提升程度如何?
  • RQ4所提出的系统在包含数百万条记录和高查询负载的生产规模部署中,能否保持鲁棒性和分区容错能力?
  • RQ5各项优化技术(如RIAC、MPC、通信调优)对训练和推理整体性能提升的贡献程度如何?

主要发现

  • 所提系统在FK数据集上相比SOTA的SecureBoost,训练时间最快提升83倍,训练时间从超过300分钟缩短至仅60分钟。
  • 通过优化流式处理,推理延迟从10秒(SecureBoost)降低至0.12秒,实现生产工作负载的实时推理。
  • 在单台机器上每方处理100个查询的批处理场景下,系统每秒可处理3,000个查询(QPS),展现出强大的水平可扩展性。
  • 系统保持与集中式模型和SecureBoost相当的准确率,在FK数据集上AUC得分为0.66,在epsilon数据集上为0.79,收敛时达到或超过SOTA水平。
  • 消融实验表明,所有优化(O1–O4)的组合将FK数据集上的训练时间从35小时缩短至仅1小时,相比基线提升35倍。
  • 该系统已在生产环境部署,成功处理数亿次推理调用而未发生故障,充分证明其在真实世界应用中的鲁棒性和可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。