Skip to main content
QUICK REVIEW

[论文解读] FedXGBoost: Privacy-Preserving XGBoost for Federated Learning

Nhan Khanh Le, Yang Liu|arXiv (Cornell University)|Jun 20, 2021
Privacy-Preserving Technologies in Data参考文献 18被引用 9
一句话总结

FedXGBoost 提出两种隐私保护协议——FedXGBoost-SMM 和 FedXGBoost-LDP——用于联邦 XGBoost,实现无损准确率的同时,相比基于加密的方法具有更低的开销。通过将分割评分计算重新表述为安全矩阵乘法,并结合不可否认性增强,FedXGBoost-SMM 在不损失准确率的情况下确保隐私;而 FedXGBoost-LDP 则利用局部差分隐私与噪声扰动,实现实际部署。

ABSTRACT

Federated learning is the distributed machine learning framework that enables collaborative training across multiple parties while ensuring data privacy. Practical adaptation of XGBoost, the state-of-the-art tree boosting framework, to federated learning remains limited due to high cost incurred by conventional privacy-preserving methods. To address the problem, we propose two variants of federated XGBoost with privacy guarantee: FedXGBoost-SMM and FedXGBoost-LDP. Our first protocol FedXGBoost-SMM deploys enhanced secure matrix multiplication method to preserve privacy with lossless accuracy and lower overhead than encryption-based techniques. Developed independently, the second protocol FedXGBoost-LDP is heuristically designed with noise perturbation for local differential privacy, and empirically evaluated on real-world and synthetic datasets.

研究动机与目标

  • 解决现有基于加密的方法在联邦学习中因高开销导致的高效隐私保护 XGBoost 缺乏问题。
  • 设计一种基于安全矩阵乘法的协议(FedXGBoost-SMM),在相比同态加密方法计算成本更低的情况下,实现无损准确率的隐私保护。
  • 设计一种启发式局部差分隐私协议(FedXGBoost-LDP),用于实际部署,在真实世界和合成数据集上实现可接受的模型效用。
  • 通过引入增强的不可否认性并分析固有漏洞,减轻安全矩阵乘法和同态加密在 XGBoost 中的隐私泄露风险。
  • 证明在不牺牲模型性能的前提下,隐私保护 XGBoost 在垂直划分的联邦设置中的可行性和实用性。

提出的方法

  • 将 XGBoost 的分割评分评估表述为类别矩阵与梯度向量之间的安全矩阵乘法(SMM)问题。
  • 通过引入不可否认性机制增强 SMM 协议,防止任何一方在极端好奇心下推断出真实矩阵条目。
  • 对 XGBoost 目标函数进行一阶近似,推导出噪声梯度的无偏估计量,从而实现准确的分割评分计算。
  • 设计 FedXGBoost-LDP,利用对梯度和海塞矩阵的噪声扰动实现局部差分隐私,以保护个体数据贡献。
  • 采用垂直数据划分,其中每个客户端持有不同的特征,实现无需共享原始数据的协作训练。
  • 将隐私保护协议集成到联邦 XGBoost 训练流水线中,保持模型准确率的同时确保差分隐私保证。

实验结果

研究问题

  • RQ1能否通过增强安全矩阵乘法,在联邦 XGBoost 中提供强隐私保障,同时避免准确率损失和高计算成本?
  • RQ2在将现有安全矩阵乘法和同态加密协议应用于 XGBoost 时,其固有的隐私泄露风险是什么?如何缓解?
  • RQ3所提出的 FedXGBoost-LDP 协议在真实世界和合成数据集上的模型效用与隐私权衡方面表现如何?
  • RQ4基于线性代数的方法(如 FedXGBoost-SMM)是否能在效率和准确率上超越基于加密的方法?
  • RQ5对 XGBoost 目标函数进行一阶近似,在注入噪声的情况下,能否实现分割评分估计的无偏性?

主要发现

  • FedXGBoost-SMM 通过将分割评分计算重新表述为安全矩阵乘法并增强不可否认性,实现了无损模型准确率,相比同态加密显著降低了开销。
  • 增强后的 SMM 协议即使在条目为类别数据的情况下,也能有效防止极度好奇的参与方可高概率推断真实矩阵值。
  • FedXGBoost-LDP 采用局部差分隐私与噪声扰动的启发式方法,在真实世界和合成数据集上实现了可接受的模型效用。
  • 对 XGBoost 目标函数的一阶近似可为噪声环境下的分割评分提供无偏估计量,从而在梯度与海塞矩阵被扰动的情况下仍保持模型性能。
  • 在噪声环境下,分割评分估计量的方差在理论上被有界,表明尽管方差增加,估计量仍保持无偏。
  • 实证评估证实,FedXGBoost-LDP 在真实世界数据集上保持了具有竞争力的性能,展示了其在 XGBoost 隐私保护联邦学习中的实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。