[论文解读] Topic-oriented Adversarial Attacks against Black-box Neural Ranking Models
该论文提出了一种新颖的主题导向对抗性攻击框架(TARA),用于黑盒神经排序模型,利用强化学习与替代模型生成语义保持的扰动,使目标文档在相同主题的多个查询中排名提升。该方法显著优于现有攻击方法,在黑盒设置下于MS MARCO数据集上实现平均排名提升18.3 vs. 31.6。
Neural ranking models (NRMs) have attracted considerable attention in information retrieval. Unfortunately, NRMs may inherit the adversarial vulnerabilities of general neural networks, which might be leveraged by black-hat search engine optimization practitioners. Recently, adversarial attacks against NRMs have been explored in the paired attack setting, generating an adversarial perturbation to a target document for a specific query. In this paper, we focus on a more general type of perturbation and introduce the topic-oriented adversarial ranking attack task against NRMs, which aims to find an imperceptible perturbation that can promote a target document in ranking for a group of queries with the same topic. We define both static and dynamic settings for the task and focus on decision-based black-box attacks. We propose a novel framework to improve topic-oriented attack performance based on a surrogate ranking model. The attack problem is formalized as a Markov decision process (MDP) and addressed using reinforcement learning. Specifically, a topic-oriented reward function guides the policy to find a successful adversarial example that can be promoted in rankings to as many queries as possible in a group. Experimental results demonstrate that the proposed framework can significantly outperform existing attack strategies, and we conclude by re-iterating that there exist potential risks for applying NRMs in the real world.
研究动机与目标
- 为填补现有对抗性攻击在神经排序模型上仅针对单个查询对的空白,提出更具现实意义的主题导向攻击场景。
- 开发一种基于决策的黑盒攻击框架,无需模型梯度信息,仅依赖目标模型的硬标签反馈。
- 通过将攻击建模为由主题感知奖励引导的马尔可夫决策过程,提升攻击的有效性。
- 在静态与动态两种设置下进行评估,模拟模型可能随时间更新的真实世界部署场景。
- 展示神经排序模型对通用性、主题级扰动的高度脆弱性,此类扰动难以察觉却极为有效。
提出的方法
- 将主题导向攻击形式化为马尔可夫决策过程(MDP),其中智能体学习生成扰动以最大化查询组内排名提升。
- 使用替代排序模型模拟目标模型的行为,并在强化学习过程中指导策略网络。
- 设计一种主题导向的奖励函数,鼓励攻击在尽可能多的主题组内查询中提升目标文档的排名。
- 采用策略梯度方法(如PPO)优化攻击策略,通过触发词插入或词语替换方式施加扰动。
- 支持静态与动态两种模式:在动态模式下,攻击通过使用新反馈重新训练策略来适应模型更新。
- 在文档的不同位置(开头、中间、结尾)应用触发词注入,并改变替换词语的数量,以研究有效性与隐蔽性之间的权衡。
实验结果
研究问题
- RQ1是否可以设计出在共享同一主题的一组查询中提升目标文档排名的对抗性扰动,而不仅限于单个查询?
- RQ2在基于决策的黑盒设置下,基于强化学习的方法在生成此类主题级对抗样本方面效果如何?
- RQ3使用替代模型是否能有效实现对真实目标模型的攻击迁移,尽管无法访问其内部参数?
- RQ4不同的扰动策略(如在文档不同位置插入触发词或进行词语替换)如何影响攻击成功率与可检测性?
- RQ5当目标模型随时间更新时,攻击是否仍能保持有效性,从而模拟真实世界中的动态部署场景?
主要发现
- 所提出的RELEVANT框架在MS MARCO数据集上使对抗性文档的平均排名达到18.3,显著优于基线方法PAT(31.6)。
- 在文档开头位置生成触发词可获得最佳攻击性能,表明早期标记在查询-文档匹配中起着关键作用。
- 增加替换词语数量可提升攻击成功率,但同时也增加了被检测的风险,凸显了有效性与隐蔽性之间的权衡。
- 黑盒攻击性能可与白盒攻击相媲美,证明替代模型能有效模拟目标模型的行为。
- 该方法在静态与动态两种设置下均具有泛化能力,表现出对攻击过程中模型更新的鲁棒性。
- 该攻击在仅需目标模型硬标签反馈的极简访问条件下仍具有效性,证实其在真实世界黑盒场景中的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。