Skip to main content
QUICK REVIEW

[论文解读] Template-Based Question Generation from Retrieved Sentences for Improved Unsupervised Question Answering

Alexander R. Fabbri, Patrick Ng|arXiv (Cornell University)|Apr 24, 2020
Topic Modeling参考文献 11被引用 7
一句话总结

本文提出了一种基于检索和模板的无监督问题生成方法,通过从检索到的语义相关句子而非原始上下文生成合成训练数据,从而提升抽取式问题回答性能。通过将模板应用于包含答案和匹配实体的检索句子,该方法在 SQuAD 上实现了 64.04 的 SOTA F1 分数,在命名实体问题上达到 77.55 的 F1 分数,相比先前的无监督模型实现了 14% 的相对性能提升。

ABSTRACT

Question Answering (QA) is in increasing demand as the amount of information available online and the desire for quick access to this content grows. A common approach to QA has been to fine-tune a pretrained language model on a task-specific labeled dataset. This paradigm, however, relies on scarce, and costly to obtain, large-scale human-labeled data. We propose an unsupervised approach to training QA models with generated pseudo-training data. We show that generating questions for QA training by applying a simple template on a related, retrieved sentence rather than the original context sentence improves downstream QA performance by allowing the model to learn more complex context-question relationships. Training a QA model on this data gives a relative improvement over a previous unsupervised model in F1 score on the SQuAD dataset by about 14%, and 20% when the answer is a named entity, achieving state-of-the-art performance on SQuAD for unsupervised QA.

研究动机与目标

  • 通过使用合成数据实现无监督训练,解决监督式问题回答中标签数据成本高且稀缺的问题。
  • 在简单填空式模板之外,提升用于训练 QA 模型的合成问题质量。
  • 探究从语义相关句子中检索并应用模板是否能提升下游 QA 性能。
  • 评估实体匹配、模板结构和数据规模对模型性能的影响。
  • 发布合成训练数据和代码,以支持无监督 QA 领域的可复现性与进一步研究。

提出的方法

  • 从维基百科语料库中检索一条包含答案实体且与上下文段落共享至少一个额外命名实体的句子。
  • 使用预训练的命名实体识别系统(spaCy)从查询上下文和检索句子中提取命名实体。
  • 应用基于模板的问题生成模块,通过插入答案并根据实体类型使用相应的疑问词(wh-word),将检索句子转换为问题。
  • 构建不同词序(例如,Wh + B + A + ?)和疑问词类型(例如,what, who)的模板,以探索结构对性能的影响。
  • 通过 F1 相似度阈值(≤95%)过滤掉高度相似或抄袭的检索句子,并要求至少存在一个额外的共享实体。
  • 在合成的问题-答案对上微调 BERT-large 模型,并在 SQuAD v1.1 的开发集和测试集上进行评估。

实验结果

研究问题

  • RQ1从检索到的相关句子而非原始上下文生成问题,是否能提升下游 QA 性能?
  • RQ2疑问词选择和模板结构如何影响生成问题的质量及模型性能?
  • RQ3在检索句子与上下文之间要求额外的实体匹配,对模型泛化能力有何影响?
  • RQ4需要多少合成数据才能实现强性能?性能是否会随着数据量增加而饱和或下降?
  • RQ5在低资源场景下,该方法的无监督问题生成能否达到或超越监督基线?

主要发现

  • 所提出的基于模板的方法在 SQuAD 测试集上实现了 64.04 的 F1 分数,相比先前的无监督模型实现了 14% 的相对性能提升。
  • 在命名实体问题(SQuAD-NER)上,该方法实现了 77.55 的 F1 分数,相比先前的无监督模型实现了 20% 的相对性能提升。
  • 使用与实体类型匹配的疑问词(例如,人名使用 who)相比仅使用 'what',性能显著提升。
  • 要求检索句子与上下文之间至少共享一个额外的命名实体,相比无匹配情况,F1 分数提升超过 5 分。
  • 性能在 50,000 个合成样本后趋于饱和,且使用 10,000 个样本的本方法已优于先前无监督模型在 400 万个样本上训练的结果。
  • 该无监督模型在 50,000 个合成样本上的性能,与在仅 3,000 个标注样本上微调的完全监督模型相当。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。