Skip to main content
QUICK REVIEW

[论文解读] Defending Against Disinformation Attacks in Open-Domain Question Answering

Orion Weller, Aleem Ahmed Khan|arXiv (Cornell University)|Dec 20, 2022
Topic Modeling被引用 5
一句话总结

本文提出了一种针对开放域问答(ODQA)中数据 poisoning 攻击的防御方法,通过查询增强技术检索多样化、较少被污染的文本段落,并引入一种新颖的置信度方法——答案冗余置信度(CAR),以提升答案的可靠性。该方法在无需梯度更新的情况下,于不同污染水平下实现了接近20个百分点的准确匹配(exact match)提升,为现有 ODQA 系统提供了一种简单而有效的防御方案。

ABSTRACT

Recent work in open-domain question answering (ODQA) has shown that adversarial poisoning of the search collection can cause large drops in accuracy for production systems. However, little to no work has proposed methods to defend against these attacks. To do so, we rely on the intuition that redundant information often exists in large corpora. To find it, we introduce a method that uses query augmentation to search for a diverse set of passages that could answer the original question but are less likely to have been poisoned. We integrate these new passages into the model through the design of a novel confidence method, comparing the predicted answer to its appearance in the retrieved contexts (what we call Confidence from Answer Redundancy, i.e. CAR). Together these methods allow for a simple but effective way to defend against poisoning attacks that provides gains of nearly 20% exact match across varying levels of data poisoning/knowledge conflicts.

研究动机与目标

  • 为应对开放域问答(ODQA)中日益严重的数据 poisoning 威胁,即恶意攻击者通过操纵维基百科等知识源来降低模型性能。
  • 开发一种实用的、非梯度依赖的防御机制,可无缝集成至现有 ODQA 流水线中,无需重新训练。
  • 通过利用大规模语料中的冗余特性,提升对知识冲突与虚假信息的鲁棒性。
  • 在真实攻击场景下,评估查询增强与新型置信度机制在缓解 poisoning 影响方面的有效性。

提出的方法

  • 提出一种查询增强策略,通过生成多样化的语义相关查询,检索更可能未被污染的替代段落。
  • 引入答案冗余置信度(CAR),一种通过比较不同检索上下文中的答案一致性来评估预测可靠性的置信度评分方法。
  • 利用 CAR 决定是否信任原始查询或增强查询的预测结果,优先选择在多个来源中具有高冗余性的预测。
  • 采用简单的决策策略:若答案在多个增强段落中一致预测,则选择该答案;否则使用原始结果。
  • 将该方法应用于现有 ODQA 模型(如 FiD 和 Atlas),无需模型微调或梯度更新。
  • 使用 GPT-3 生成增强查询,并依赖标准检索与推理步骤,计算开销极低。

实验结果

研究问题

  • RQ1在数据 poisoning 攻击下,查询增强是否有助于检索到替代的、较少被污染的段落?
  • RQ2当证据存在冲突或被污染时,答案冗余置信度(CAR)是否能有效识别出可靠的预测?
  • RQ3大规模语料中的冗余性在多大程度上可提升 ODQA 对虚假信息攻击的鲁棒性?
  • RQ4所提出的防御机制在不同污染水平及不同 ODQA 模型下的表现如何?

主要发现

  • 所提出的防御方法在不同污染水平下,准确匹配(exact match)实现了接近20个百分点的绝对提升,显著优于基线模型。
  • 即使仅使用一个增强查询,性能也已超过基线,且随着增强查询数量的增加,性能增益持续提升。
  • CAR 置信度分数在满足冗余标准的查询与不满足的查询之间展现出约65个百分点的巨大差距,体现在准确匹配率上。
  • 即使有100篇被污染的文章,性能也未降至0%,这表明模型在某些情况下具备固有的鲁棒性,归因于参数化知识与答案字符串别名机制。
  • 当污染仅限于文章级修改时,该方法依然有效,因为此类修改可能影响共享内容的多个段落。
  • 其他答案整合策略(如多数投票或仅使用 CAR 过滤)的表现均不如所提出的基于冗余的决策方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。