Skip to main content
QUICK REVIEW

[论文解读] Towards a More Reliable Privacy-preserving Recommender System

Jiahong jiang, Cheng–Te Li|arXiv (Cornell University)|Nov 21, 2017
Privacy-Preserving Technologies in Data参考文献 9被引用 6
一句话总结

本文提出安全分布式协同过滤(SDCF),一种保护用户评分值、评分存在性以及训练后的推荐模型的隐私保护框架,采用两阶段随机响应算法与分布式矩阵分解相结合。SDCF在保持高推荐准确率的同时实现差分隐私,无论在数值评分预测任务还是单类评分预测任务中,RMSE与AUC损失均接近非私有基线模型。

ABSTRACT

This paper proposes a privacy-preserving distributed recommendation framework, Secure Distributed Collaborative Filtering (SDCF), to preserve the privacy of value, model and existence altogether. That says, not only the ratings from the users to the items, but also the existence of the ratings as well as the learned recommendation model are kept private in our framework. Our solution relies on a distributed client-server architecture and a two-stage Randomized Response algorithm, along with an implementation on the popular recommendation model, Matrix Factorization (MF). We further prove SDCF to meet the guarantee of Differential Privacy so that clients are allowed to specify arbitrary privacy levels. Experiments conducted on numerical rating prediction and one-class rating action prediction exhibit that SDCF does not sacrifice too much accuracy for privacy.

研究动机与目标

  • 解决协同过滤系统中评分值、评分存在性以及训练后推荐模型的隐私泄露问题。
  • 设计一种分布式客户端-服务器架构,确保所有敏感数据均保留在客户端,避免传输至不可信服务器。
  • 通过将两阶段随机响应机制与模型训练相结合,提供形式化的差分隐私保障。
  • 在强隐私保护下仍保持高推荐准确率,尤其在数值评分预测与单类评分预测任务中表现优异。
  • 将该框架扩展至其他基于梯度下降的模型(如因子分解机),而不仅限于矩阵分解。

提出的方法

  • SDCF将矩阵分解模型拆分为用户特定的个人元素(U)与项目特定的公共元素(V),仅将V存储在服务器上,而将U与评分数据保留在客户端。
  • 在训练过程中,客户端下载公共元素(V),本地更新个人元素(U),并仅向服务器传输公共元素的梯度,从而防止评分值与模型信息泄露。
  • 采用两阶段随机响应算法对用户评分的存在性与数值进行掩码,确保客户端层面的差分隐私。
  • 第一阶段通过随机响应扰动评分值,第二阶段通过概率性地改变评分的存在性来掩码评分存在性。
  • 通过在两阶段随机响应过程中仔细校准隐私参数(εg 与 εI),框架确保隐私损失被严格限制。
  • 该方法通过将用户相关参数(如 w_c, v^l_c)视为个人元素,项目相关参数视为公共元素,扩展至因子分解机,实现基于梯度的分布式训练。

实验结果

研究问题

  • RQ1能否在一个分布式协同过滤框架中,同时保护评分值、评分存在性以及训练后的模型隐私?
  • RQ2在不依赖可信服务器或第三方的情况下,如何在分布式矩阵分解设置中形式化保证差分隐私?
  • RQ3两阶段随机响应机制在数值评分预测与单类评分预测任务中对推荐准确率的影响程度如何?
  • RQ4所提出的框架能否推广至使用梯度下降进行学习的其他模型(如因子分解机)?
  • RQ5不同的隐私预算(εg, εI)如何影响隐私与推荐效用之间的权衡?

主要发现

  • SDCF通过两阶段随机响应机制实现差分隐私,形式化证明隐私损失被限制在 εg 与 εI 之内。
  • 在数值评分预测任务中,当 εg = 4 时,RMSE 值与非私有基线模型相当,且在足够训练迭代后性能趋于饱和。
  • 在单类评分行为预测任务中,AUC 损失仅比非私有基线增加 0.03–0.07,表明尽管存在扰动导致的信息损失,仍具备可接受的推荐效用。
  • 由于通过扰动-响应规则(PRR)删除了部分评分行为,性能下降在单类任务中更为显著,但准确率仍保持较高水平且具有实际应用价值。
  • 该框架成功防止了评分值、模型及存在性信息的泄露,因为所有原始数据与个人模型参数均保留在客户端。
  • 该方法可扩展至因子分解机及其他基于梯度的模型,使其在传统矩阵分解之外具备更广泛的应用潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。