Skip to main content
QUICK REVIEW

[论文解读] Improving Machine Reading Comprehension via Adversarial Training

Ziqing Yang, Yiming Cui|arXiv (Cornell University)|Nov 9, 2019
Adversarial Robustness in Machine Learning参考文献 33被引用 8
一句话总结

本文提出对抗训练(AT)和虚拟对抗训练(VAT),以提升机器阅读理解(MRC)模型的性能,在基于跨度的和多项选择的MRC任务中均展现出一致的性能提升。AT增强了模型在罕见词汇样本上的泛化能力,VAT则实现了利用跨任务数据的有效半监督学习,但其在知识注入型对抗样本上的鲁棒性未见提升。

ABSTRACT

Adversarial training (AT) as a regularization method has proved its effectiveness in various tasks, such as image classification and text classification. Though there are successful applications of AT in many tasks of natural language processing (NLP), the mechanism behind it is still unclear. In this paper, we aim to apply AT on machine reading comprehension (MRC) and study its effects from multiple perspectives. We experiment with three different kinds of RC tasks: span-based RC, span-based RC with unanswerable questions and multi-choice RC. The experimental results show that the proposed method can improve the performance significantly and universally on SQuAD1.1, SQuAD2.0 and RACE. With virtual adversarial training (VAT), we explore the possibility of improving the RC models with semi-supervised learning and prove that examples from a different task are also beneficial. We also find that AT helps little in defending against artificial adversarial examples, but AT helps the model to learn better on examples that contain more low-frequency words.

研究动机与目标

  • 探究对抗训练(AT)在不同MRC任务中提升机器阅读理解(MRC)模型性能的有效性。
  • 探索虚拟对抗训练(VAT)在MRC中实现半监督学习的潜力,特别是利用来自不同任务的数据。
  • 评估AT是否能提升MRC模型对人工构造的对抗样本(尤其是融合人类知识的样本)的鲁棒性。
  • 分析AT对不同词汇难度样本的影响,特别是包含罕见词汇的样本。

提出的方法

  • 通过在训练过程中扰动词嵌入实施对抗训练(AT),以提升模型的鲁棒性和泛化能力。
  • 利用虚拟对抗训练(VAT)通过从无标签数据中生成对抗样本,实现半监督学习,即使在不同任务之间也能适用。
  • 以BERT-base和BERT-large作为基础模型,通过任务特定的微调策略应用于基于跨度、无答案感知和多项选择的MRC任务。
  • 在SQuAD1.1、SQuAD2.0和RACE数据集上评估模型性能,并对罕见词频率和对抗样本类型进行消融研究。
  • 根据罕见词比例(训练集中频率最低的10,000个词)对样本按词汇难度分组,并对每个组别分析性能表现。
  • 利用外部知识(如WordNet)构造人工对抗样本,以测试模型在无答案问题上的鲁棒性。

实验结果

研究问题

  • RQ1对抗训练是否在不同类型的MRC任务(包括基于跨度和多项选择的阅读理解)中均能持续提升性能?
  • RQ2虚拟对抗训练是否能有效实现MRC中的半监督学习,特别是在使用来自不同任务的数据时?
  • RQ3对抗训练是否能提升MRC模型对融合人类知识的人工生成对抗样本的鲁棒性?
  • RQ4对抗训练如何影响模型在不同词汇复杂度样本上的表现,特别是包含更多罕见词汇的样本?

主要发现

  • 对抗训练在所有评估的MRC任务中均显著提升性能,在SQuAD1.1、SQuAD2.0和RACE上均取得一致的性能增益,证明其具备良好的泛化能力。
  • 虚拟对抗训练实现了有效的半监督学习,使模型能从无标签数据中获益,包括来自不同任务的样本,尤其在无答案问题上的性能提升显著。
  • 对抗训练未能提升对知识注入型对抗样本的鲁棒性;经过AT训练的模型在这些样本上仅表现出中等程度的相对性能提升,表明其防御能力有限。
  • 对抗训练在词汇难度最高的样本上带来最大的相对性能增益,尤其在包含更多罕见词汇的样本中,最困难组别(罕见词比例 >0.05)的提升最为显著。
  • AT在无答案问题上的相对性能提升高于可回答问题,表明在无答案检测任务中对罕见词的敏感性更高。
  • AT在高词汇难度样本上的性能增益最为显著,在最困难组别(难度 >0.05)的相对提升最高可达2.2%,尤其在无答案问题检测任务中表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。