Skip to main content
QUICK REVIEW

[论文解读] PIVODL: Privacy-preserving vertical federated learning over distributed labels

Hangyu Zhu, Rui Wang|arXiv (Cornell University)|Aug 25, 2021
Privacy-Preserving Technologies in Data被引用 4
一句话总结

PIVODL 提出了一种隐私保护的垂直联邦学习框架,用于在标签分布在多个客户端的情况下训练 XGBoost 模型。它结合同态加密与部分差分隐私,防止在梯度和叶权重传输过程中泄露标签信息,在推理攻击下仍能实现可忽略的性能下降和强大的隐私保障。

ABSTRACT

Federated learning (FL) is an emerging privacy preserving machine learning protocol that allows multiple devices to collaboratively train a shared global model without revealing their private local data. Non-parametric models like gradient boosting decision trees (GBDT) have been commonly used in FL for vertically partitioned data. However, all these studies assume that all the data labels are stored on only one client, which may be unrealistic for real-world applications. Therefore, in this work, we propose a secure vertical FL framework, named PIVODL, to train GBDT with data labels distributed on multiple devices. Both homomorphic encryption and differential privacy are adopted to prevent label information from being leaked through transmitted gradients and leaf values. Our experimental results show that both information leakage and model performance degradation of the proposed PIVODL are negligible.

研究动机与目标

  • 解决垂直联邦学习中数据标签分布在多个客户端而非集中于单一参与方的现实场景。
  • 缓解因标签在客户端间拆分而导致的梯度和叶权重传输所引发的隐私风险。
  • 防止利用特征分裂间梯度与海森矩阵和差异的差分攻击。
  • 通过防止客户端从叶权重值推断真实标签,保护模型推理过程中的标签隐私。
  • 设计一种安全、高效且隐私保护的框架,用于在标签分布设置下训练梯度提升决策树。

提出的方法

  • 引入一种安全的节点分裂协议,使源客户端与分裂客户端协作计算不纯度得分,而无需暴露标签信息。
  • 使用加法同态加密(Paillier)在树节点分裂过程中安全聚合来自各客户端的梯度与海森矩阵。
  • 实施一种部分差分隐私机制,仅对发送给源客户端的叶权重值添加高斯噪声,以防止标签推断。
  • 将 XGBoost 训练过程分解为客户端特定的计算任务,用于数据分割与增益得分计算,最大限度减少标签相关数据的暴露。
  • 设计一种通信高效的协议,确保仅传输加密或扰动后的中间值,从而保持数据本地性。
  • 确保所有敏感信息——包括梯度、海森矩阵和叶权重——均通过密码学与隐私保护机制加以保护。

实验结果

研究问题

  • RQ1当标签分布在多个客户端时,能否设计一种安全的垂直联邦学习系统用于 XGBoost 训练?
  • RQ2当标签未集中于单一客户端时,如何安全地执行梯度与海森矩阵的聚合?
  • RQ3哪些机制可以防止利用特征分裂间梯度和差异的差分隐私攻击?
  • RQ4是否可以选择性地对叶权重应用差分隐私,以防止标签推断,同时不降低模型性能?
  • RQ5所提出的系统在确保标签隐私免受推理攻击的同时,能在多大程度上保持模型准确性?

主要发现

  • 所提出的 PIVODL 框架实现了可忽略的模型性能下降,测试性能对不同差分隐私级别(ε)的敏感性极低。
  • 在未启用差分隐私的情况下,标签推理攻击的猜测准确率在信用卡和银行营销数据集上均超过 60%,表明存在严重的标签泄露风险。
  • 在应用部分差分隐私且 ε = 10 后,银行营销数据集上的猜测准确率降至 14.45%,信用卡数据集上降至 27.78%,低于 50% 的随机猜测阈值。
  • 同态加密的使用使通信成本最高增加 25MB(在设备能效预测数据集上使用六棵提升树的模型),该开销被认为是可以接受的。
  • 加密显著增加了训练时间,其中同态加密占总训练时间的很大比例,表明仍需进一步优化。
  • 部分差分隐私机制能有效防止客户端通过叶权重分析推断真实标签,确保推理过程中无标签信息泄露。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。