[论文解读] Differentially Private Label Protection in Split Learning
本文提出 TPSL(Transcript Private Split Learning),一种新颖的分割学习框架,通过在传输的梯度上施加差分隐私来保护标签隐私。通过使用拉普拉斯或离散噪声进行有针对性的梯度扰动,TPSL 在保持最小效用损失的前提下实现了可证明的 $(2\epsilon, 0)$-差分隐私,在大规模数据集上的效用-隐私权衡表现优于基线方法。
Split learning is a distributed training framework that allows multiple parties to jointly train a machine learning model over vertically partitioned data (partitioned by attributes). The idea is that only intermediate computation results, rather than private features and labels, are shared between parties so that raw training data remains private. Nevertheless, recent works showed that the plaintext implementation of split learning suffers from severe privacy risks that a semi-honest adversary can easily reconstruct labels. In this work, we propose extsf{TPSL} (Transcript Private Split Learning), a generic gradient perturbation based split learning framework that provides provable differential privacy guarantee. Differential privacy is enforced on not only the model weights, but also the communicated messages in the distributed computation setting. Our experiments on large-scale real-world datasets demonstrate the robustness and effectiveness of extsf{TPSL} against label leakage attacks. We also find that extsf{TPSL} have a better utility-privacy trade-off than baselines.
研究动机与目标
- 解决分割学习中因梯度可被用于重构标签而带来的关键隐私漏洞。
- 不仅对模型参数,也对分割学习中共享的通信记录(即梯度)提供可证明的差分隐私保障。
- 设计一种高效且通用的框架,将差分隐私集成到分割学习中,无需复杂的多方计算或显著的计算开销。
- 相较于纵向联邦学习设置下的现有 DP 方法,提升效用-隐私权衡表现。
提出的方法
- 提出 TPSL,一种在训练过程中对各方之间交换的梯度施加差分隐私的分割学习框架。
- 引入 GradPerturb,一种仅在正确类别梯度的最优方向上添加噪声的梯度扰动机制,以保留模型效用。
- 采用多分类拉普拉斯或离散扰动分布,确保扰动后梯度满足 $(\epsilon, 0)$-DP。
- 使用基于通信记录的隐私定义来衡量标签隐私,涵盖协议中所有共享消息。
- 仅在反向传播的梯度上应用噪声,避免了梯度裁剪或全层噪声注入的需求。
- 通过使整个通信记录满足差分隐私,而非仅模型参数,从而实现端到端隐私保护。
实验结果
研究问题
- RQ1能否在分割学习中有效对共享梯度施加差分隐私,以防止标签泄露?
- RQ2如何设计一种梯度扰动机制,在实现强隐私保障的同时保留模型效用?
- RQ3与现有基线方法相比,DP 增强的分割学习框架的效用-隐私权衡如何?
- RQ4我们能否在通信记录(即所有传输消息)上实现可证明的差分隐私,而不仅限于模型参数?
主要发现
- TPSL 在通信记录上实现了可证明的 $(2\epsilon, 0)$-差分隐私,确保在正式威胁模型下的标签隐私。
- 通过 GradPerturb 使用方向性噪声,相比各向同性噪声或基线 DP 方法,实现了更优的效用-隐私权衡。
- 在大规模真实世界数据集上的实验表明,TPSL 能有效抵御标签重构攻击,同时保持高模型准确率。
- 该框架带来的计算和通信开销极低,与标准分割学习相当,使其在实际部署中具有可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。