Skip to main content
QUICK REVIEW

[论文解读] Benchmarking Robustness of Machine Reading Comprehension Models

Chenglei Si, Ziqing Yang|arXiv (Cornell University)|Apr 29, 2020
Topic Modeling参考文献 36被引用 14
一句话总结

本文提出 AdvRACE,一个面向机器阅读理解(MRC)模型的模型无关基准,用于评估其在 RACE 数据集上面对四种对抗性攻击(AddSent、CharSwap、Distractor Extraction(DE)和 Distractor Generation(DG))时的鲁棒性。尽管最先进模型在标准基准上表现良好,但在这些攻击下性能显著下降,暴露出关键漏洞,凸显了构建更鲁棒 MRC 模型的迫切需求。作者发布了数据集和代码,以支持未来在模型鲁棒性方面的研究。

ABSTRACT

Machine Reading Comprehension (MRC) is an important testbed for evaluating models' natural language understanding (NLU) ability. There has been rapid progress in this area, with new models achieving impressive performance on various benchmarks. However, existing benchmarks only evaluate models on in-domain test sets without considering their robustness under test-time perturbations or adversarial attacks. To fill this important gap, we construct AdvRACE (Adversarial RACE), a new model-agnostic benchmark for evaluating the robustness of MRC models under four different types of adversarial attacks, including our novel distractor extraction and generation attacks. We show that state-of-the-art (SOTA) models are vulnerable to all of these attacks. We conclude that there is substantial room for building more robust MRC models and our benchmark can help motivate and measure progress in this area. We release our data and code at https://github.com/NoviScl/AdvRACE .

研究动机与目标

  • 为解决现有 MRC 基准缺乏鲁棒性评估的问题,这些基准仅关注域内性能,忽略了测试时的扰动。
  • 开发一个全面、可迁移且模型无关的基准,用于评估 MRC 模型在多样化对抗性攻击下的表现。
  • 识别并量化最先进 MRC 模型在真实扰动(包括新型基于干扰项的攻击)下的漏洞。
  • 证明对抗性训练可能因依赖虚假统计线索而非真实理解而高估模型的鲁棒性。

提出的方法

  • 作者通过在 RACE 测试集上应用四种对抗性攻击(AddSent、CharSwap、Distractor Extraction(DE)和 Distractor Generation(DG))构建了 AdvRACE,保留标签的同时修改输入文本。
  • 所有攻击均为模型无关,无需访问模型参数,可对任何 MRC 模型进行相同基准的评估。
  • Distractor Extraction 和 Distractor Generation 是新型攻击,用语义相似但错误的选项替换原始干扰项,从而增加模型推理负担。
  • 该基准构建高效且可迁移,仅需少量修改即可适配其他 MRC 数据集。
  • 通过人工标注的质量控制,确保对抗性样本具有高保真度,语义和标签一致性得以保持。
  • 对单一攻击类型及组合攻击类型进行对抗性训练评估,以衡量鲁棒性提升效果并检测对虚假模式的过拟合。

实验结果

研究问题

  • RQ1最先进 MRC 模型在面对多样化对抗性攻击(包括新型基于干扰项的扰动)时表现如何?
  • RQ2对抗性训练在多种攻击类型下能多大程度提升鲁棒性?其泛化能力如何?
  • RQ3经过对抗性训练的模型是否真正学习了鲁棒表征,还是仅利用了数据中的虚假统计线索?
  • RQ4所提出的 AdvRACE 基准能否有效揭示模型弱点,并指导更鲁棒 MRC 系统的开发?

主要发现

  • 最先进 MRC 模型在四种对抗性攻击下性能显著下降,准确率最高降低达 30%,表明其鲁棒性极差。
  • 仅在单一攻击类型上进行对抗性训练,仅能提升该特定攻击下的性能,通常导致其他攻击类型性能下降。
  • 在 Distractor Extraction(DE)上进行对抗性训练,可提升 AddSent 攻击下的性能,表明模型对词汇匹配的依赖降低。
  • 混合对抗性训练在所有攻击类型下均提升性能,仅在原始测试集上略有下降,表明实现了广泛的鲁棒性增益。
  • 诊断实验表明,经 AddSent 对抗性训练的模型依赖虚假模式(如答案插入)而非真实推理,导致鲁棒性被高估。
  • 仅选项训练实验显示,所有数据集(原始、DE 和 DG)均包含强烈的虚假统计线索,表明高性能可能源于模式利用而非真正理解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。