Skip to main content
QUICK REVIEW

[论文解读] Making Recommender Systems Forget: Learning and Unlearning for Erasable Recommendation

Yuyuan Li, Xiaolin Zheng|arXiv (Cornell University)|Mar 22, 2022
Machine Learning in Healthcare被引用 6
一句话总结

本文提出LASER,一种新颖的可擦除推荐框架,可在基于协同过滤的推荐系统中实现高效且有效的遗忘学习。通过利用基于超图的用户聚类以及在平衡组之间的顺序课程学习,LASER在完全擦除用户数据的同时保持了模型效用,相较于现有最先进遗忘方法,在真实世界数据集上的效率和推荐准确率方面均表现更优。

ABSTRACT

Privacy laws and regulations enforce data-driven systems, e.g., recommender systems, to erase the data that concern individuals. As machine learning models potentially memorize the training data, data erasure should also unlearn the data lineage in models, which raises increasing interest in the problem of Machine Unlearning (MU). However, existing MU methods cannot be directly applied into recommendation. The basic idea of most recommender systems is collaborative filtering, but existing MU methods ignore the collaborative information across users and items. In this paper, we propose a general erasable recommendation framework, namely LASER, which consists of Group module and SeqTrain module. Firstly, Group module partitions users into balanced groups based on their similarity of collaborative embedding learned via hypergraph. Then SeqTrain module trains the model sequentially on all groups with curriculum learning. Both theoretical analysis and experiments on two real-world datasets demonstrate that LASER can not only achieve efficient unlearning, but also outperform the state-of-the-art unlearning framework in terms of model utility.

研究动机与目标

  • 为了解决在GDPR等隐私法规下推荐系统中用户粒度数据擦除的挑战。
  • 开发一种遗忘框架,能够在高效移除协同过滤模型中用户数据脉络的同时保持模型效用。
  • 克服现有机器遗忘方法的局限性,这些方法无法在用户与项目之间保持协同信息。
  • 设计一种可扩展且理论基础坚实的遗忘过程,支持在统一框架中同时实现学习与遗忘。

提出的方法

  • LASER采用Group模块,通过从超图中提取的协同嵌入将用户划分为平衡的聚类,确保组内相似度高且数据分布均衡。
  • SeqTrain模块以由易到难的顺序在这些组上顺序训练模型,模拟人类的课程学习,以提升模型收敛性和效用。
  • 引入协同凝聚度作为度量指标,用于量化每组内部的协同信息量,从而指导分组与训练过程。
  • 框架采用带约束的平衡k-means聚类算法,以确保组大小均匀,从而优化遗忘效率。
  • 理论分析证明,平衡分组可最小化预期遗忘成本,且当所有组大小相等时达到最优配置。
  • 模型通过经验风险最小化进行训练,通过引入包含组特定损失和性能指标的贝叶斯先验来最大化模型效用。
Figure 1: A schematic view of learning and unlearning in recommendation.
Figure 1: A schematic view of learning and unlearning in recommendation.

实验结果

研究问题

  • RQ1能否设计一种机器遗忘框架,以在协同过滤模型中保留用户与项目之间的协同信息?
  • RQ2以由易到难的课程学习顺序进行训练,对遗忘过程中的模型效用有何影响?
  • RQ3基于协同嵌入对用户进行平衡分组,是否能提升遗忘效率并降低计算成本?
  • RQ4所提出的LASER框架在模型效用和遗忘完整性方面,相较于现有遗忘基线,能有多大程度的超越?

主要发现

  • LASER通过在数据子集上重新训练,实现了完全遗忘(G1),确保目标用户的数据脉络被彻底从模型中清除。
  • 该框架通过在平衡组上顺序训练以保留协同信息,从而提升了模型效用(G3),在NDCG和HR指标上优于最先进遗忘基线。
  • 平衡分组可最小化预期遗忘成本,理论证明表明在损失函数下,等大小组配置可实现最低的预期成本。
  • 在ML-100K和Amazon-Books数据集上的实证结果表明,LASER即使在遗忘后仍能保持高推荐准确率,且在不同类型的遗忘请求下,NDCG@10和HR@10指标均保持一致提升。
  • 所提出的协同嵌入方法相较于稀疏的用户-项目交互,显著提升了协同凝聚度,验证了其在捕捉高阶用户-项目关系方面的有效性。
Figure 2: Overview of LASER framework.
Figure 2: Overview of LASER framework.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。