[论文解读] Robust Machine Comprehension Models via Adversarial Training
本文提出 AddSentDiverse,一种新颖的对抗性训练方法,通过变化干扰句位置和动态生成虚假答案,提升对抗性样本的多样性,显著增强机器阅读理解模型的鲁棒性。结合语义关系特征(如同义/反义关系),该方法在对抗性 SQuAD 评估中将 F1 分数提升 36.5%,同时保持原始任务上的性能表现。
It is shown that many published models for the Stanford Question Answering Dataset (Rajpurkar et al., 2016) lack robustness, suffering an over 50% decrease in F1 score during adversarial evaluation based on the AddSent (Jia and Liang, 2017) algorithm. It has also been shown that retraining models on data generated by AddSent has limited effect on their robustness. We propose a novel alternative adversary-generation algorithm, AddSentDiverse, that significantly increases the variance within the adversarial training data by providing effective examples that punish the model for making certain superficial assumptions. Further, in order to improve robustness to AddSent's semantic perturbations (e.g., antonyms), we jointly improve the model's semantic-relationship learning capabilities in addition to our AddSentDiverse-based adversarial training data augmentation. With these additions, we show that we can make a state-of-the-art model significantly more robust, achieving a 36.5% increase in F1 score under many different types of adversarial evaluation while maintaining performance on the regular SQuAD task.
研究动机与目标
- 为解决当前最先进的机器阅读理解模型在对抗性评估下,特别是在 SQuAD 数据集上的脆弱性问题。
- 克服先前对抗性训练方法因对抗性数据中方差较低且存在可被利用的统计相关性而失效的局限性。
- 提升模型对 AddSent 风格攻击(尤其是反义词等语义扰动)的鲁棒性。
- 探究联合增强模型能力(如语义关系学习)与多样化对抗性训练是否能提升鲁棒性。
- 证明所提方法在其他基于插入的问答任务对抗性攻击中的泛化能力。
提出的方法
- 提出 AddSentDiverse,一种对抗性样本生成算法,通过随机化干扰句位置和动态生成多样化虚假答案,提升数据方差。
- 结合固定与动态虚假答案集合,防止模型学习到答案选择中的表面模式。
- 引入基于 WordNet 的同义/反义关系特征作为输入增强,提升模型的语义推理能力。
- 在常规 SQuAD 数据和 AddSentDiverse 生成的对抗性数据上联合训练模型,通过多样化负样本提升鲁棒性。
- 采用双阶段训练策略:先使用多样化对抗样本进行对抗微调,再引入语义关系特征以增强泛化能力。
- 在多个对抗性测试集(AddSent、AddSentPrepend、AddSentMod)上评估模型,以衡量其在不同类型扰动下的鲁棒性。
实验结果
研究问题
- RQ1通过多样化干扰句位置和虚假答案生成提升对抗性训练数据的方差,是否能显著提高模型鲁棒性?
- RQ2联合使用语义关系特征(如同义/反义关系)是否能增强模型在反义词等语义扰动下的性能?
- RQ3为何仅靠对抗性训练无法提升模型在语义扰动下的鲁棒性?如何通过增强模型能力来解决此问题?
- RQ4所提方法是否可泛化至其他基于插入的问答任务对抗性攻击?
- RQ5在结合对抗性训练时,引入语义特征是否能提升模型在原始 SQuAD 任务上的表现?
主要发现
- 基于 AddSentDiverse 的对抗性训练模型,在三个对抗性测试集上的平均 F1 分数相比 AddSent 训练提升 24.22%。
- 使用 AddSentDiverse 和动态虚假答案训练的模型泛化能力更强,在不同虚假答案集的测试数据上均未出现性能下降。
- 在模型中加入语义关系特征(同义/反义关系)后,其在对抗性评估中的 F1 分数相比基线提升 36.46%。
- 经过对抗性训练的 BSAE+SA 模型在原始 SQuAD 验证集上保持性能(F1 为 84.49),而未使用语义特征的 BSAE 模型在对抗性训练下性能下降 1%。
- 错误分析显示,63.7% 的剩余错误出现在原始 SQuAD 验证集中已误分类的问题上,表明鲁棒性提升主要对对抗性扰动有效。
- 模型在命名实体替换型干扰句和意外回答问题的错误格式干扰句上仍表现不佳,凸显当前仍存在的挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。