[论文解读] Privacy Threats Against Federated Matrix Factorization
本文识别并分析了在三种数据划分类型——水平、垂直和联邦迁移矩阵分解(MF)下的联邦矩阵分解(MF)中的隐私威胁,展示了诚实但好奇的参与者如何推断出私有的用户偏好、用户ID和用户资料数据。本文提出了基于密码学、混淆技术和硬件的隐私保护方法以缓解这些风险,是首次对联邦MF中隐私威胁的全面研究。
Matrix Factorization has been very successful in practical recommendation applications and e-commerce. Due to data shortage and stringent regulations, it can be hard to collect sufficient data to build performant recommender systems for a single company. Federated learning provides the possibility to bridge the data silos and build machine learning models without compromising privacy and security. Participants sharing common users or items collaboratively build a model over data from all the participants. There have been some works exploring the application of federated learning to recommender systems and the privacy issues in collaborative filtering systems. However, the privacy threats in federated matrix factorization are not studied. In this paper, we categorize federated matrix factorization into three types based on the partition of feature space and analyze privacy threats against each type of federated matrix factorization model. We also discuss privacy-preserving approaches. As far as we are aware, this is the first study of privacy threats of the matrix factorization method in the federated learning framework.
研究动机与目标
- 根据特征空间划分,将联邦矩阵分解分为三类:水平、垂直和联邦迁移MF。
- 分析每类联邦MF中的隐私威胁,特别是诚实但好奇的参与者如何从模型更新中推断出私有的用户偏好、用户ID和资料数据。
- 评估每类联邦MF设置在面对推理攻击时的抗性。
- 提出并讨论隐私保护技术——密码学、混淆和硬件隔离方法——以在联邦训练过程中保护敏感数据。
- 为未来对攻击有效性的实证评估以及扩展到其他MF变体(如交替最小二乘法)奠定基础。
提出的方法
- 根据数据和参数划分,将联邦MF分为三类:水平(共享用户/项目)、垂直(异构特征)和联邦迁移(共享用户/项目但部分模型参数)。
- 在诚实但好奇的威胁模型下建模训练过程,参与者合谋从梯度和共享参数中推断私有数据。
- 分析梯度和参数交换模式,识别用户ID、用户偏好和资料矩阵的泄露向量。
- 提出基于同态加密(HE)和秘密共享的密码学解决方案,以保护中间计算。
- 评估基于混淆的方法,如差分隐私(DP),尽管需注意数据稀疏性可能导致的噪声问题。
- 讨论使用可信执行环境(TEEs)的硬件隔离方法,以隔离并保护训练计算。
实验结果
研究问题
- RQ1在联邦学习框架下,水平、垂直和联邦迁移矩阵分解中的隐私威胁有何不同?
- RQ2诚实但好奇的参与者如何从联邦MF中的模型更新中推断出私有的用户偏好、用户ID或资料数据?
- RQ3基于参数共享和梯度暴露,各类联邦MF设置在面对推理攻击时的相对抗性如何?
- RQ4在保护联邦MF方面,哪种隐私保护技术——密码学、混淆还是硬件隔离——最为有效?
- RQ5数据稀疏性和模型结构如何影响差分隐私在联邦MF中的可行性及其噪声影响?
主要发现
- 在水平联邦MF中,由于完整共享模型参数,暴露了最多隐私信息,包括用户ID和完整的用户偏好数据。
- 在垂直联邦MF中,推荐系统可从共享参数中推断用户ID,而辅助数据提供方则不会向推荐系统泄露任何信息。
- 在联邦迁移MF中,会泄露私有的评分数据和用户/项目资料,但不会暴露用户ID,提供了中等程度的抗性。
- 联邦MF中的梯度和参数交换过程使得推理攻击成为可能,能够以高精度重建私有训练数据。
- 基于密码学的技术,如同态加密和秘密共享,能有效保护中间数据,但通信开销仍是挑战。
- 差分隐私在稀疏MF设置中可能引入过多噪声,降低模型效用,而TEEs提供强隔离性,但依赖于硬件信任假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。