Skip to main content
QUICK REVIEW

[论文解读] One word at a time: adversarial attacks on retrieval models

Nisarg Raval, Manisha Verma|arXiv (Cornell University)|Aug 5, 2020
Adversarial Robustness in Machine Learning参考文献 16被引用 6
一句话总结

本文提出了一种黑箱对抗性攻击框架,通过仅更改1–3个词元,生成语义相似且最小的扰动,显著降低深度学习排序模型的检索性能。通过用语义相似的替代词替换原词,攻击使相关文档的排名下降数个位置,同时保持语义不变,表明当前最先进排序模型对微小且难以察觉的改动极为敏感。

ABSTRACT

Adversarial examples, generated by applying small perturbations to input features, are widely used to fool classifiers and measure their robustness to noisy inputs. However, little work has been done to evaluate the robustness of ranking models through adversarial examples. In this work, we present a systematic approach of leveraging adversarial examples to measure the robustness of popular ranking models. We explore a simple method to generate adversarial examples that forces a ranker to incorrectly rank the documents. Using this approach, we analyze the robustness of various ranking models and the quality of perturbations generated by the adversarial attacker across two datasets. Our findings suggest that with very few token changes (1-3), the attacker can yield semantically similar perturbed documents that can fool different rankers into changing a document's score, lowering its rank by several positions.

研究动机与目标

  • 评估深度学习排序模型在信息检索中对对抗性攻击的鲁棒性。
  • 开发一种黑箱攻击方法,通过最小且语义连贯的文本更改操纵文档排序。
  • 使用标准指标(如P@5)衡量对抗性扰动对检索有效性的影响。
  • 分析修改查询词或文档词的攻击者中,哪类更具有效性且更难被检测。
  • 在不同攻击策略下,评估原始文档与扰动后文档之间的语义相似度。

提出的方法

  • 攻击框架采用黑箱设置,仅需模型的(查询,文档)对输出,无需内部架构信息。
  • 提出三种攻击变体(A1、A2、A3):A1修改文档词元,A2将更改限制在查询词上,A3避免修改查询词,但仍能降低排名。
  • 通过从词嵌入中替换为语义相似的词来生成扰动,保持整体语义不变。
  • 使用余弦相似度衡量原始文档与扰动后文档之间的语义保留程度。
  • 通过P@5评估模型鲁棒性,即将原始文档得分替换为扰动后得分,并重新计算精确率。
  • 在两个公开数据集MSMarco和WikiQA上评估该方法,使用三种最先进排序模型:DRMM、Duet和KNRM。

实验结果

研究问题

  • RQ1对文档文本进行最小且语义连贯的扰动,是否能显著降低深度学习排序模型中相关文档的排名?
  • RQ2不同攻击策略(如修改文档词元与查询词元)在最小改动下降低文档排名的效率如何?
  • RQ3在对抗性攻击下,原始文档与扰动后文档之间的语义相似度在多大程度上得以保持?
  • RQ4不同排序模型(DRMM、Duet、KNRM)在对抗性扰动下的鲁棒性有何差异?
  • RQ5对抗性扰动对标准检索指标(如P@5)的影响在不同数据集上如何?

主要发现

  • 仅通过一次词元扰动,攻击即可使相关文档在排序列表中下降4至12个位置,如表1所示。
  • 即使仅更改一个词,原始文档与扰动后文档之间的余弦相似度仍保持在约0.97,表明语义保留良好。
  • 对于五词扰动,余弦相似度降至约0.90,显示出扰动规模与语义保真度之间的权衡。
  • A1攻击者(修改文档词元)实现最高排名下降,尤其在DRMM模型上(在MSMarco上仅一次词元更改即导致P@5下降50%)。
  • A3攻击者(避免修改查询词)实现与A1相近的排名下降,但语义相似度损失更小,更具隐蔽性。
  • 基线P@5值更高的模型(如DRMM在MSMarco上的表现)更具鲁棒性,仅在最有效攻击下才出现P@5下降50%,表明模型性能与对抗鲁棒性之间存在相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。