Skip to main content
QUICK REVIEW

[论文解读] Adversarial Recommendation: Attack of the Learned Fake Users

Konstantina Christakopoulou, Arindam Banerjee|arXiv (Cornell University)|Sep 21, 2018
Adversarial Robustness in Machine Learning参考文献 28被引用 3
一句话总结

本文提出了一种基于机器学习的框架,用于生成逼真的虚假用户资料,可对抗性地操纵推荐系统,同时保持隐蔽性。通过将攻击建模为推荐系统与基于生成对抗网络(GAN)的对手之间的双人博弈,该方法同时优化了虚假用户资料的真实性与攻击意图,表明即使经过学习的细微虚假用户,也能显著降低目标用户的推荐质量。

ABSTRACT

Can machine learning models for recommendation be easily fooled? While the question has been answered for hand-engineered fake user profiles, it has not been explored for machine learned adversarial attacks. This paper attempts to close this gap. We propose a framework for generating fake user profiles which, when incorporated in the training of a recommendation system, can achieve an adversarial intent, while remaining indistinguishable from real user profiles. We formulate this procedure as a repeated general-sum game between two players: an oblivious recommendation system $R$ and an adversarial fake user generator $A$ with two goals: (G1) the rating distribution of the fake users needs to be close to the real users, and (G2) some objective $f_A$ encoding the attack intent, such as targeting the top-K recommendation quality of $R$ for a subset of users, needs to be optimized. We propose a learning framework to achieve both goals, and offer extensive experiments considering multiple types of attacks highlighting the vulnerability of recommendation systems.

研究动机与目标

  • 探究推荐系统的机器学习模型是否可被与真实用户无异的对抗性虚假用户资料所操纵。
  • 开发一种学习框架,生成具有逼真评分分布的虚假用户资料,同时针对特定攻击目标(如降低目标用户的Top-K推荐质量)进行优化。
  • 弥合传统洗钱攻击(手工构造的虚假资料)与对抗样本(输入扰动)在推荐系统背景下的差距。
  • 在对手知识处于现实假设的前提下,评估低秩推荐模型对端到端、学习型对抗攻击的脆弱性。

提出的方法

  • 将对抗性推荐建模为一个重复的、非零和的双人博弈,涉及一个盲从的推荐系统 $ R $ 和一个对抗性虚假用户生成器 $ A $,包含两个目标:(G1) 虚假用户评分的真实性,以及 (G2) 攻击意图的优化。
  • 使用生成对抗网络(GANs)学习真实用户评分的分布,并生成模仿该分布的逼真虚假用户资料。
  • 采用零阶优化方法更新虚假用户资料,无需访问推荐系统模型的梯度,从而实现无梯度的攻击优化。
  • 集成一个损失函数,平衡真实性(如评分分布和特征谱的相似性)与对抗性目标(如最小化对目标用户或项目的预测评分)。
  • 假设攻击者知晓推荐系统的模型架构,可使用增强数据重新训练模型,从而实现对虚假资料的迭代优化。
  • 通过在训练集中注入虚假用户后测量推荐质量的变化(如Top-K性能)来评估攻击效果。

实验结果

研究问题

  • RQ1机器学习推荐模型是否可被与真实用户无异的虚假用户资料有效攻击?
  • RQ2基于GAN的生成器在模仿真实用户评分模式的同时,能在多大程度上实现特定的对抗性目标?
  • RQ3当攻击者无法访问推荐系统模型的梯度时,零阶优化方法在构建对抗性攻击方面的有效性如何?
  • RQ4学习型虚假用户对目标用户或项目Top-K推荐质量的影响如何?
  • RQ5单一策略性操纵(如最小化目标项目最高评分用户的预测得分)是否足以导致目标项目推荐质量的广泛恶化?

主要发现

  • 所提出的框架成功生成了在评分分布和特征谱方面与真实用户在统计上无差异的虚假用户资料,使其具有高度真实性。
  • 该攻击显著降低了目标用户的Top-K推荐质量,其中一项关键发现表明,仅最小化目标项目最高评分用户对该项目的预测得分,就足以彻底破坏其推荐表现。
  • 该方法在多种攻击目标下均实现了高攻击成功率,包括促进或抑制特定项目,且在对推荐系统模型了解有限的情况下依然有效。
  • 实验表明,基于GAN的生成器在真实性与攻击有效性方面均优于手工构造的虚假资料,证实了学习方法相对于启发式方法的优越性。
  • 该框架揭示了即使攻击者无法访问模型梯度,推荐系统仍可能因真实、学习型的虚假用户而遭受数据污染攻击。
  • 结果表明,当前推荐系统可能对数据级对抗攻击缺乏足够鲁棒性,凸显了开发对抗性感知防御机制的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。