Skip to main content
QUICK REVIEW

[论文解读] Learning to Ask Unanswerable Questions for Machine Reading Comprehension

Haichao Zhu, Li Dong|arXiv (Cornell University)|Jun 14, 2019
Topic Modeling参考文献 46被引用 4
一句话总结

本文提出一种成对到序列的模型,通过在对应段落的条件下编辑可回答的问题,生成相关联的不可回答问题,从而实现机器阅读理解任务的有效数据增强。该方法通过从词汇相似且上下文相关的不可回答问题中获得判别性训练信号,在使用 BERT-base 和 BERT-large 模型时,分别在 SQuAD 2.0 上将 F1 分数显著提升 1.9 和 1.7 个百分点。

ABSTRACT

Machine reading comprehension with unanswerable questions is a challenging task. In this work, we propose a data augmentation technique by automatically generating relevant unanswerable questions according to an answerable question paired with its corresponding paragraph that contains the answer. We introduce a pair-to-sequence model for unanswerable question generation, which effectively captures the interactions between the question and the paragraph. We also present a way to construct training data for our question generation models by leveraging the existing reading comprehension dataset. Experimental results show that the pair-to-sequence model performs consistently better compared with the sequence-to-sequence baseline. We further use the automatically generated unanswerable questions as a means of data augmentation on the SQuAD 2.0 dataset, yielding 1.9 absolute F1 improvement with BERT-base model and 1.7 absolute F1 improvement with BERT-large model.

研究动机与目标

  • 提升机器阅读理解模型识别不可回答问题的能力,尽管在抽取式任务上表现强劲,但该能力仍是关键挑战。
  • 生成与段落在词汇和上下文中均相关联的不可回答问题,避免生成平凡或无关的示例。
  • 开发一种利用自动生成的不可回答问题进行数据增强的策略,以提升阅读理解模型的泛化能力和鲁棒性。
  • 设计一种训练数据构建方法,通过共享答案片段作为枢纽,对齐可回答问题与不可回答问题。
  • 评估生成的不可回答问题是否可作为有效负样本,以提升模型在 SQuAD 2.0 上的表现。

提出的方法

  • 引入一种成对到序列的模型,联合编码问题与段落,实现基于注意力的交互和上下文感知的表征学习。
  • 模型使用复制机制在生成过程中引入段落中的词汇,提升事实一致性与相关性。
  • 通过共享答案片段对可回答问题与不可回答问题进行对齐,构建基于枢纽的配对数据。
  • 通过词语替换、否定或实体替换等操作,基于段落条件对可回答问题进行编辑,生成不可回答问题。
  • 通过将生成的不可回答问题与原始 SQuAD 2.0 的可回答示例结合,应用数据增强策略,随后在基于 BERT 的模型上进行微调。
  • 该方法利用现有的大规模机器阅读理解数据集,生成大规模、上下文相关的不可回答问题集合用于训练。

实验结果

研究问题

  • RQ1神经网络模型能否生成既在上下文中相关又对阅读理解模型具有判别性的不可回答问题?
  • RQ2通过在段落条件约束下编辑可回答问题来生成不可回答问题,是否能提升模型的泛化能力?
  • RQ3自动生成的不可回答问题在多大程度上能提升 SQuAD 2.0 的性能,特别是对强大的 BERT 基础模型?
  • RQ4与基于 TF-IDF 检索或规则基方法的启发式基线相比,生成的不可回答问题质量如何?
  • RQ5增加生成的不可回答问题数量是否能进一步提升模型性能,是否存在收益递减的临界点?

主要发现

  • 成对到序列的模型在自动评估与人工评估中均优于序列到序列基线,生成的不可回答问题更具相关性与多样性。
  • 在使用 BERT-base 模型时,使用生成的不可回答问题进行数据增强,使 SQuAD 2.0 的 F1 分数提升 1.9 个百分点;在使用 BERT-large 模型时,F1 分数提升 1.7 个百分点。
  • 使用生成的不可回答问题进行数据增强,可在多种模型上提升性能,包括专用架构与 BERT 微调模型。
  • 增加增强数据规模(最多三倍)可进一步提升性能,尤其对 BERT-base 模型效果显著,表明该方法具有可扩展性,并且数据多样性带来实际收益。
  • 基于规则与 TF-IDF 的不可回答问题生成基线方法仅带来微小增益,凸显了所提成对到序列方法的优越性。
  • 该方法有效缓解了数据不平衡问题,并提供了强有力的负样本,增强了模型在无答案时选择不回答的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。