Skip to main content
QUICK REVIEW

[论文解读] Adaptive Histogram-Based Gradient Boosted Trees for Federated Learning

Yuya Jeremy Ong, Yi Zhou|arXiv (Cornell University)|Dec 11, 2020
Privacy-Preserving Technologies in Data参考文献 19被引用 13
一句话总结

本文提出了一种新型联邦学习方法——Party-Adaptive XGBoost(PAX),用于梯度提升树模型,该方法采用无需密码加密的、针对参与方自适应的直方图聚合技术。PAX在非独立同分布(non-IID)数据分布下,相较于Homo SecureBoost等安全基线方法,实现了更高的模型准确率和高达24倍的训练速度提升,使XGBoost在企业级联邦学习部署中更具实用性。

ABSTRACT

Federated Learning (FL) is an approach to collaboratively train a model across multiple parties without sharing data between parties or an aggregator. It is used both in the consumer domain to protect personal data as well as in enterprise settings, where dealing with data domicile regulation and the pragmatics of data silos are the main drivers. While gradient boosted tree implementations such as XGBoost have been very successful for many use cases, its federated learning adaptations tend to be very slow due to using cryptographic and privacy methods and have not experienced widespread use. We propose the Party-Adaptive XGBoost (PAX) for federated learning, a novel implementation of gradient boosting which utilizes a party adaptive histogram aggregation method, without the need for data encryption. It constructs a surrogate representation of the data distribution for finding splits of the decision tree. Our experimental results demonstrate strong model performance, especially on non-IID distributions, and significantly faster training run-time across different data sets than existing federated implementations. This approach makes the use of gradient boosted trees practical in enterprise federated learning.

研究动机与目标

  • 为解决现有联邦梯度提升方法在企业环境中性能差、训练延迟高的问题。
  • 在不依赖复杂密码保护机制的前提下,实现跨去中心化数据源的高效、隐私保护的XGBoost模型训练。
  • 克服联邦学习环境中常见的数据分布不平衡与非独立同分布(non-IID)数据特性。
  • 开发一种可扩展且鲁棒的替代方案,以应对Homo SecureBoost等现有安全提升框架带来的高计算开销。
  • 证明可针对不同参与方自适应调整的直方图聚合方法,能够提升联邦树模型的模型准确率与训练速度。

提出的方法

  • PAX使用针对参与方自适应的直方图聚合,为决策树分裂决策构建本地数据分布的代理表示。
  • 各参与方基于自身数据分布计算本地直方图,并将其发送给聚合方,避免原始数据传输。
  • 聚合方采用加权融合策略,综合考虑各参与方间的数据不平衡问题。
  • 该方法根据数据特征和本地样本规模,动态调整各参与方的直方图分辨率与分箱策略。
  • 分裂选择基于梯度提升框架,基于聚合后的直方图表示优化损失函数(如对数损失、均方误差)。
  • 该方法避免端到端加密,显著降低通信与计算开销,同时保持模型效用。

实验结果

研究问题

  • RQ1能否设计一种联邦XGBoost框架,在准确率与训练速度上均优于现有安全提升方法?
  • RQ2在企业联邦学习中常见的极端非独立同分布(non-IID)数据分布下,模型表现如何?
  • RQ3在无加密保护的前提下,针对参与方的自适应直方图聚合能否有效处理数据不平衡并降低通信开销?
  • RQ4缺乏密码保护是否会导致模型性能相比安全基线方法下降?
  • RQ5当某一参与方拥有远超其他参与方的数据量时,该方法是否仍能保持鲁棒性?

主要发现

  • 在随机划分的数据下,PAX在Airline数据集上达到88%的准确率;在极端不平衡划分(Partition 5)下达到91%,优于Homo SecureBoost与逻辑回归。
  • PAX在平衡的Airline数据集上仅用49秒完成训练,而Homo SecureBoost耗时1177秒,实现24倍速度提升。
  • 即使某一参与方仅持有1%的数据,PAX仍保持高性能,表明其对数据不平衡具有强鲁棒性。
  • 在所有数据划分方案下,包括非独立同分布场景,PAX均优于Homo SecureBoost与逻辑回归。
  • 由于无需密码开销,PAX实现了显著更快的训练速度,同时保持或提升了模型准确率。
  • PAX的自适应直方图机制降低了对集中式数据协调的依赖,并最小化了通信过程中的隐私数据泄露风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。