Skip to main content
QUICK REVIEW

[论文解读] Data Leakage via Access Patterns of Sparse Features in Deep Learning-based Recommendation Systems

Hanieh Hashemi, Wenjie Xiong|arXiv (Cornell University)|Dec 12, 2022
Privacy-Preserving Technologies in Data被引用 5
一句话总结

本文揭示了在基于深度学习的推荐系统中,嵌入表的访问模式可能泄露用户的私密信息,即使模型计算过程被隐藏。通过分析稀疏特征的查找操作,攻击者在不受信任的云环境中可重新识别用户、推断敏感属性,并长期追踪用户行为,表明现有的防护措施(如联邦学习和ORAM)在实时推理场景下不足以应对这一威胁。

ABSTRACT

Online personalized recommendation services are generally hosted in the cloud where users query the cloud-based model to receive recommended input such as merchandise of interest or news feed. State-of-the-art recommendation models rely on sparse and dense features to represent users' profile information and the items they interact with. Although sparse features account for 99% of the total model size, there was not enough attention paid to the potential information leakage through sparse features. These sparse features are employed to track users' behavior, e.g., their click history, object interactions, etc., potentially carrying each user's private information. Sparse features are represented as learned embedding vectors that are stored in large tables, and personalized recommendation is performed by using a specific user's sparse feature to index through the tables. Even with recently-proposed methods that hides the computation happening in the cloud, an attacker in the cloud may be able to still track the access patterns to the embedding tables. This paper explores the private information that may be learned by tracking a recommendation model's sparse feature access patterns. We first characterize the types of attacks that can be carried out on sparse features in recommendation models in an untrusted cloud, followed by a demonstration of how each of these attacks leads to extracting users' private information or tracking users by their behavior over time.

研究动机与目标

  • 研究基于深度学习的推荐系统中的隐私漏洞,即用户私密数据可能通过稀疏特征嵌入表的访问模式被泄露。
  • 识别并分析特定类型的攻击——如用户重新识别、敏感属性推断和基于频率的长期行为追踪——这些攻击利用不受信任云环境中的访问模式。
  • 证明即使采用安全计算技术与秘密哈希函数,嵌入表的访问模式泄露仍是生产规模推荐系统中的关键威胁。
  • 指出当前隐私保护方案(如联邦学习和不经意访问内存ORAM)在防止推理过程中访问模式泄露方面的局限性。
  • 将研究重点从密集特征泄露转向推荐模型中尚未充分探索的稀疏特征访问模式泄露威胁。

提出的方法

  • 分析如DLRM等先进推荐模型的架构,重点关注稀疏特征(如用户年龄、性别、商品类别)如何用于索引大型嵌入表。
  • 建立威胁场景:不受信任的云服务器观察嵌入表的访问模式,并将其与用户行为相关联,以推断私密信息。
  • 设计并模拟三种攻击类型:(1) 利用静态稀疏特征(如性别、年龄)实现用户重新识别;(2) 从动态稀疏特征(如购买商品)中推断敏感属性;(3) 基于频率的长期用户行为追踪。
  • 使用统计与模式分析方法,将对特定嵌入表索引的重复访问与用户身份或行为相关联,即使无法直接访问特征值。
  • 评估现有隐私保护技术(如联邦学习和ORAM)对这些访问模式攻击的防御效果,揭示其在实时推理工作负载中的局限性。
  • 证明即使对输入特征进行秘密哈希,嵌入表的访问模式仍会泄露信息,从而证明仅靠输入混淆不足以实现隐私保护,必须同时对访问模式进行混淆。

实验结果

研究问题

  • RQ1在不受信任的云环境中,攻击者在多大程度上能基于对静态稀疏特征(如年龄、性别)的访问模式重新识别用户?
  • RQ2能否通过访问模式分析,从动态稀疏特征(如商品类别或购买历史)中推断出敏感属性(如种族、宗教、政治观点)?
  • RQ3仅基于嵌入表访问日志,基于频率的追踪攻击在多大程度上能实现对用户行为的长期监控?
  • RQ4为何现有隐私保护技术(如联邦学习和ORAM)在推荐系统推理中无法有效防范访问模式泄露?
  • RQ5对输入特征进行秘密哈希能否防止访问模式泄露?还是嵌入表的访问模式仍会暴露私密信息?

主要发现

  • 即使模型内部计算被隐藏,推荐系统中嵌入表的访问模式仍可用于高精度的用户重新识别。
  • 通过分析访问频率与序列,可从动态稀疏特征(如商品类别或购买历史)中推断出性别、种族或政治观点等敏感属性。
  • 基于频率的追踪攻击可重建用户随时间的行为模式,仅凭嵌入表的访问日志即可实现长期用户画像构建。
  • 即使对输入特征进行秘密哈希,嵌入表的访问模式仍会泄露信息,证明仅靠输入混淆无法实现充分的隐私保护。
  • 现有隐私保护方案(如联邦学习和ORAM)在推荐系统实时推理中效果有限,因其性能开销过高且与动态访问模式不兼容。
  • 本文揭示了当前研究中的一个关键空白:尽管密集特征泄露已受到关注,但稀疏特征访问模式泄露问题仍基本未被研究,而嵌入表占模型参数总量的99%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。