[论文解读] Federated Boosted Decision Trees with Differential Privacy
该论文提出了一种使用Rényi差分隐私(RDP)和轻量级安全聚合的联邦差分隐私梯度提升决策树(GBDT)框架。通过将隐私预算战略性地分配给叶节点权重,并采用批量牛顿更新与迭代Hessian分解,该方法在仅5–10轮通信中实现了最先进的性能——与非私有模型相当,且性能损失极小。
There is great demand for scalable, secure, and efficient privacy-preserving machine learning models that can be trained over distributed data. While deep learning models typically achieve the best results in a centralized non-secure setting, different models can excel when privacy and communication constraints are imposed. Instead, tree-based approaches such as XGBoost have attracted much attention for their high performance and ease of use; in particular, they often achieve state-of-the-art results on tabular data. Consequently, several recent works have focused on translating Gradient Boosted Decision Tree (GBDT) models like XGBoost into federated settings, via cryptographic mechanisms such as Homomorphic Encryption (HE) and Secure Multi-Party Computation (MPC). However, these do not always provide formal privacy guarantees, or consider the full range of hyperparameters and implementation settings. In this work, we implement the GBDT model under Differential Privacy (DP). We propose a general framework that captures and extends existing approaches for differentially private decision trees. Our framework of methods is tailored to the federated setting, and we show that with a careful choice of techniques it is possible to achieve very high utility while maintaining strong levels of privacy.
研究动机与目标
- 为解决现有联邦GBDT方法依赖同态加密(HE)或多方计算(MPC)等重型密码学技术却缺乏正式隐私保障的问题。
- 弥合非私有GBDT模型的高实用性与联邦设置中强隐私保护之间的差距。
- 开发一个统一、模块化的差分隐私GBDT训练框架,支持高效通信与隐私会计。
- 识别各组件(如分裂候选、更新类型、批处理)的最优配置,以在严格隐私预算下最大化模型实用性。
提出的方法
- 将GBDT分解为五个组件:分裂候选生成、分裂选择、叶节点权重优化、隐私预算分配和通信策略。
- 采用Rényi差分隐私(RDP)进行精确的隐私会计,相比传统DP可获得更紧的隐私界。
- 使用迭代Hessian(IH)分裂候选以提升私有环境下的稳定性和性能。
- 采用批量牛顿更新以减少通信轮次,同时平滑噪声影响。
- 对叶节点权重而非分裂决策应用差分隐私,因为叶节点权重对模型实用性贡献更大。
- 结合安全聚合与轻量级MPC,确保隐私保护的同时避免重型密码学开销。
实验结果
研究问题
- RQ1在差分隐私下,GBDT训练流程中哪些组件对噪声最敏感,隐私预算应如何在这些组件间分配?
- RQ2在通信轮次极少的联邦设置下,私有GBDT模型能否实现与非私有模型相当的实用性?
- RQ3不同分裂候选方法(如随机、直方图、迭代Hessian)在DP下的模型性能有何影响?
- RQ4在差分隐私GBDT训练中,使用牛顿更新与梯度或平均更新相比有何影响?
- RQ5对模型更新进行批处理是否能降低通信成本而不牺牲私有联邦GBDT的模型实用性?
主要发现
- 所提方法采用迭代Hessian(IH)分裂候选与批量牛顿更新($p=0.25$),在六个数据集上持续优于SOTA基线,尤其在高隐私保护($\epsilon = 0.1$)下表现显著。
- 采用$B=20$或$B=50$的批量更新可将通信轮次减少至5–10轮,与完整提升相比AUC损失不超过0.04。
- 主要将隐私预算分配给叶节点权重而非分裂决策,可显著提升模型实用性,因为叶节点权重对预测准确率影响更大。
- 在仅使用10轮通信的情况下,该方法的AUC与非私有基线相差不超过0.01,展现出优异的实用性-隐私权衡。
- DP-TR牛顿IH EBM结合批处理($p=0.25$)在所有数据集上的平均排名最高,甚至优于训练$10T$轮的DP-EBM。
- 与完整提升相比,该框架将通信成本降低了高达95%,且性能损失可忽略不计,使其适用于现实世界的联邦部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。