Skip to main content
QUICK REVIEW

[论文解读] Privacy Preserving Recommendation System Based on Groups

Shang Shang, Yuk Hui|arXiv (Cornell University)|May 2, 2013
Privacy-Preserving Technologies in Data参考文献 33被引用 7
一句话总结

本文提出了一种隐私保护推荐系统,通过基于群体的协作来匿名化用户偏好,同时保持较高的推荐准确率。通过利用分布式对等偏好交换和混合马尔可夫随机场模型,该系统实现了接近群体规模的匿名集合,并在缺乏个体偏好数据的情况下,于MovieLens和Epinions数据集上优于最先进的方法(如L+和ItemRank)。

ABSTRACT

Recommendation systems have received considerable attention in the recent decades. Yet with the development of information technology and social media, the risk in revealing private data to service providers has been a growing concern to more and more users. Trade-offs between quality and privacy in recommendation systems naturally arise. In this paper, we present a privacy preserving recommendation framework based on groups. The main idea is to use groups as a natural middleware to preserve users' privacy. A distributed preference exchange algorithm is proposed to ensure the anonymity of data, wherein the effective size of the anonymity set asymptotically approaches the group size with time. We construct a hybrid collaborative filtering model based on Markov random walks to provide recommendations and predictions to group members. Experimental results on the MovieLens and Epinions datasets show that our proposed methods outperform the baseline methods, L+ and ItemRank, two state-of-the-art personalized recommendation algorithms, for both recommendation precision and hit rate despite the absence of personal preference information.

研究动机与目标

  • 为解决推荐系统中个性化与隐私之间的矛盾,将推荐从个体层面转向群体层面。
  • 开发一种框架,保护用户隐私免受不可信服务提供商的侵害,且不依赖计算成本高昂的密码学技术。
  • 通过使用群体层面的社会与内容信息,在不共享个人偏好数据的情况下,仍保持高推荐质量。
  • 证明基于群体的协作可实现与基于个体的系统相当或更优的性能,同时保护用户匿名性。

提出的方法

  • 设计了一种分布式、对等的偏好交换协议,通过在群体内交换偏好来匿名化用户数据,确保有效匿名集合渐近接近群体规模。
  • 构建了一种基于马尔可夫随机场的混合协同过滤模型,整合项目内容与群体社交网络结构以实现推荐。
  • 用户偏好在群体层面聚合,推荐在每个群体成员本地生成,防止个体资料泄露至中心服务器。
  • 系统使用群体成员身份——基于自然属性(性别、年龄、职业)或社区检测——作为保护隐私的中间件层。
  • 使用MovieLens和Epinions数据集进行5折交叉验证,评估精确率与召回率,以训练和评估推荐模型。
  • 该框架设计为可与其他隐私保护技术(如差分隐私)组合使用,增强了其可扩展性。

实验结果

研究问题

  • RQ1基于群体的协作是否能在不损害推荐质量的前提下,有效保护推荐系统中的用户隐私?
  • RQ2用户群体的规模与结构如何影响匿名集合大小与推荐性能?
  • RQ3基于马尔可夫随机场与群体级数据的混合推荐模型,是否能优于基于个体的最先进方法(如L+和ItemRank)?
  • RQ4使用自然用户群体(如按年龄或职业划分)是否比随机分配或通过社区检测得到的群体表现更优?
  • RQ5在不向服务提供商暴露个体偏好数据的前提下,通过分布式对等偏好交换能在多大程度上实现隐私保护?

主要发现

  • 该基于群体的推荐系统在MovieLens和Epinions数据集上,即使在缺乏个体偏好数据的情况下,其精确率与命中率仍优于L+和ItemRank。
  • 在MovieLens上,基于职业群体的推荐在top-50的召回率达到最高(0.518),优于L+和ItemRank在所有top-k值下的表现。
  • 在Epinions上,采用社区检测的群体模型在top-50的召回率达到0.250,优于L+(0.248)和ItemRank(0.245),表明其在个体数据保真度较低的情况下仍具鲁棒性。
  • 在MovieLens上,自然群体(如按年龄、职业划分)始终优于随机分配的群体,表明有意义的群体结构可提升推荐准确率。
  • 分布式偏好交换协议随时间推移成功将有效匿名集合提升至接近群体规模,验证了其隐私保护设计的有效性。
  • 混合马尔可夫随机场模型有效利用了群体社交结构与项目内容,实现了无需向服务提供商暴露个体资料的精准本地推荐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。