[论文解读] PrivColl: Practical Privacy-Preserving Collaborative Machine Learning
PrivColl 是一种轻量级、隐私保护的协同机器学习框架,通过同态加法运算的加法秘密共享机制,安全地计算模型更新,从而同时保障数据和模型隐私。该框架在保持模型准确性和在诚实但好奇攻击者模型下的可证明隐私性的同时,相较于基于MPC/HE的方法,神经网络训练速度最高提升了216倍。
Collaborative learning enables two or more participants, each with their own training dataset, to collaboratively learn a joint model. It is desirable that the collaboration should not cause the disclosure of either the raw datasets of each individual owner or the local model parameters trained on them. This privacy-preservation requirement has been approached through differential privacy mechanisms, homomorphic encryption (HE) and secure multiparty computation (MPC), but existing attempts may either introduce the loss of model accuracy or imply significant computational and/or communicational overhead. In this work, we address this problem with the lightweight additive secret sharing technique. We propose PrivColl, a framework for protecting local data and local models while ensuring the correctness of training processes. PrivColl employs secret sharing technique for securely evaluating addition operations in a multiparty computation environment, and achieves practicability by employing only the homomorphic addition operations. We formally prove that it guarantees privacy preservation even though the majority (n-2 out of n) of participants are corrupted. With experiments on real-world datasets, we further demonstrate that PrivColl retains high efficiency. It achieves a speedup of more than 45X over the state-of-the-art MPC/HE based schemes for training linear/logistic regression, and 216X faster for training neural network.
研究动机与目标
- 填补现有密码学方法在协同学习中计算或通信开销过高导致实际应用受限的空白。
- 在协同训练过程中防止原始训练数据和本地模型参数被泄露。
- 在强隐私保障下,实现对线性回归、逻辑回归和深度神经网络等多种模型的高效训练。
- 通过最小化对同态乘法和密码学环境中非线性函数等昂贵操作的依赖,提升实用性。
- 在诚实但好奇威胁模型下,形式化证明即使有 $ n-2 $ 个参与方被攻破,隐私保护依然成立。
提出的方法
- 采用两层架构,包含本地数据拥有者和不可信的聚合节点,确保数据和模型的本地性。
- 使用加法秘密共享机制,仅通过同态加法运算分发并安全计算模型更新。
- 重新设计协同学习工作流,将梯度下降分解为加法原语,避免昂贵的同态乘法和非线性运算。
- 在反向传播中应用链式法则分解,将计算分布到本地节点和聚合器之间,保持正确性。
- 确保对任意基于梯度的模型(包括线性/逻辑回归及带有Sigmoid激活函数的全连接神经网络)均保持正确性。
- 形式化证明,即使有 $ n-2 $ 个参与方被攻破,攻击者学习敏感数据或模型参数的概率仍可忽略($ \neq \text{negligible} $)。
实验结果
研究问题
- RQ1能否设计一种隐私保护的协同学习框架,避免HE和MPC方法带来的高计算与通信开销,同时保持强隐私保障?
- RQ2是否可能仅通过同态加法运算实现对训练数据和本地模型参数的端到端隐私保护?
- RQ3该框架在不同机器学习模型和网络条件下的性能,相较于最先进的MPC/HE方案如何?
- RQ4该框架能否在不引入噪声的情况下保持模型准确率,从而避免差分隐私方法常见的准确率下降问题?
- RQ5在诚实但好奇攻击者模型下,当最多有 $ n-2 $ 个参与方被攻破时,该框架的理论隐私保障是什么?
主要发现
- PrivColl 在训练线性和逻辑回归模型时,相较最先进的MPC/HE方案,速度提升超过45倍。
- 在神经网络训练方面,PrivColl 比 MZ17 基于MPC的方法快216倍,在拥有60,000个样本的广域网(WAN)环境下,训练耗时18,367.88秒(约5.1小时)。
- 在局域网(LAN)环境下,PrivColl 仅用1,352.87秒(约22.5分钟)即可完成60,000个样本的神经网络训练,而MZ17在LAN环境下耗时超过81小时(294,239.7秒)。
- 该框架保持了与非私有训练相当的模型准确率,避免了差分隐私方法中常见的准确率下降问题。
- 在WAN环境下,通信开销占主导地位,但计算效率仍高,通信成本随数据规模呈次线性增长。
- PrivColl 的总开销在WAN环境下主要由通信主导,但依然具有实用性——尤其相较于MPC方案,后者在WAN环境下完全不可行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。