Skip to main content
QUICK REVIEW

[论文解读] Shared MF: A privacy-preserving recommendation system

Senci Ying|arXiv (Cornell University)|Aug 18, 2020
Privacy-Preserving Technologies in Data参考文献 13被引用 8
一句话总结

本文提出SharedMF,一种隐私保护的分布式矩阵分解推荐系统,通过秘密共享技术在保障用户数据隐私的同时保持高效率。通过用计算开销较低的秘密共享替代计算密集型的同态加密,SharedMF实现了显著更快的训练速度——相比基于同态加密的方法最高快2.2倍,使其在不牺牲安全性的前提下适用于大规模推荐系统。

ABSTRACT

Matrix factorization is one of the most commonly used technologies in recommendation system. With the promotion of recommendation system in e-commerce shopping, online video and other aspects, distributed recommendation system has been widely promoted, and the privacy problem of multi-source data becomes more and more important. Based on Federated learning technology, this paper proposes a shared matrix factorization scheme called SharedMF. Firstly, a distributed recommendation system is built, and then secret sharing technology is used to protect the privacy of local data. Experimental results show that compared with the existing homomorphic encryption methods, our method can have faster execution speed without privacy disclosure, and can better adapt to recommendation scenarios with large amount of data.

研究动机与目标

  • 为应对分布式推荐系统中日益严峻的数据隐私挑战,特别是在大规模电子商务和内容平台中的应用。
  • 设计一种安全且高效的同态加密替代方案,以在协同模型训练过程中保护用户数据。
  • 通过在多个数据源之间利用秘密共享,实现在联邦学习环境中隐私保护的矩阵分解。
  • 在不同数据量和数据源数量下,评估所提方法在真实世界数据集上的性能与可扩展性。
  • 证明秘密共享在保证强隐私保障的前提下,其运行速度可超越同态加密。

提出的方法

  • 系统将用户数据分布在多个客户端(如淘宝、亚马逊)上,而项目特征则存储并更新于中央服务器。
  • 每个客户端本地使用矩阵分解计算用户向量,并通过加法秘密共享方式共享加密的子向量,以防止原始数据暴露。
  • 模型更新(梯度)以秘密共享形式交换,确保任意单一参与方可重建原始数据。
  • 中央服务器在不访问底层明文数据的前提下聚合秘密共享的梯度,并更新项目向量。
  • 该方法通过依赖高效的秘密共享协议实现安全聚合,避免了同态加密带来的高计算成本。
  • 使用具有不同用户数和项目数的真实世界数据集对框架进行评估,以测试其可扩展性与性能。

实验结果

研究问题

  • RQ1秘密共享是否能在不牺牲训练效率的前提下,有效保护分布式矩阵分解中的用户数据隐私?
  • RQ2在大规模推荐系统中,秘密共享的性能与同态加密相比如何?
  • RQ3所提出的系统是否在确保无任何参与方能重建敏感用户信息的同时,仍保持高推荐准确率?
  • RQ4随着数据源和项目数量的增加,系统如何实现可扩展性?
  • RQ5系统是否能在保留强隐私保障的前提下,实现接近非加密分布式矩阵分解的性能表现?

主要发现

  • 在大规模数据集(如500个项目)上,SharedMF的训练速度相比基于同态加密的FedML系统最高快2.2倍,证明了其卓越的效率。
  • 在500个项目的情况下,SharedMF的训练耗时为583.37秒,而使用Paillier加密的FedML耗时2064.62秒,显示出显著的性能优势。
  • 秘密共享的通信开销保持较低水平,且不随项目数量显著增加,表明其对大规模项目集合具有良好的适应性。
  • 随着数据源数量的增加,模型损失下降,表明矩阵完整性提高,证实了联邦学习在数据丰富的环境中的优势。
  • 系统性能接近非加密分布式矩阵分解,证明了其实际可用性及极低的性能开销。
  • 秘密共享在速度与可扩展性方面均优于同态加密,使其更适合处理大规模数据量的真实世界推荐系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。