Skip to main content
QUICK REVIEW

[论文解读] End-to-End QA on COVID-19: Domain Adaptation with Synthetic Training

Revanth Gangi Reddy, Bhavani Iyer|arXiv (Cornell University)|Dec 2, 2020
Topic Modeling参考文献 43被引用 17
一句话总结

本文提出了一种用于COVID-19领域的端到端问答任务的零样本领域自适应框架,利用合成生成的训练数据。通过在开放域问答数据上预训练的问题生成器,从领域内CORD-19文本中生成合成的问题-段落-答案三元组,作者微调了神经信息检索(IR)和机器阅读理解(MRC)模型,在多个COVID-19问答基准测试中显著提升了F1分数,优于最先进的开放域基线模型。

ABSTRACT

End-to-end question answering (QA) requires both information retrieval (IR) over a large document collection and machine reading comprehension (MRC) on the retrieved passages. Recent work has successfully trained neural IR systems using only supervised question answering (QA) examples from open-domain datasets. However, despite impressive performance on Wikipedia, neural IR lags behind traditional term matching approaches such as BM25 in more specific and specialized target domains such as COVID-19. Furthermore, given little or no labeled data, effective adaptation of QA systems can also be challenging in such target domains. In this work, we explore the application of synthetically generated QA examples to improve performance on closed-domain retrieval and MRC. We combine our neural IR and MRC systems and show significant improvements in end-to-end QA on the CORD-19 collection over a state-of-the-art open-domain QA baseline.

研究动机与目标

  • 为解决在标注数据稀缺的专用领域(如COVID-19)中神经信息检索和机器阅读理解模型性能不佳的问题。
  • 开发一种在低资源目标领域中生成高质量合成训练样本的方法,适用于信息检索与机器阅读理解任务。
  • 评估合成数据在提升CORD-19语料上端到端问答性能方面相对于开放域基线的有效性。
  • 探究在不同问题风格(如SQuAD与NQ)上训练的合成样例是否能带来更好的领域自适应效果。

提出的方法

  • 在开放域MRC数据集(如SQuAD)上训练合成问题生成器,从领域内CORD-19科学文献中生成问题-段落-答案三元组。
  • 生成器使用top-p和top-k采样技术以提升生成问题的多样性和质量。
  • 利用合成样例微调预训练的密集段落检索器(DPR),以提升目标领域的检索性能。
  • 通过在CORD-19上进行领域内语言建模以及使用合成MRC样例,对独立的MRC模型进行微调,以提升答案抽取性能。
  • 应用往返一致性检查以过滤低质量的合成样例,提升标签可靠性。
  • 通过加权融合IR与MRC得分(IR权重=0.7)组合微调后的IR与MRC模型,评估端到端问答性能。

实验结果

研究问题

  • RQ1从领域内文本生成的合成问答对能否提升低资源领域(如COVID-19)中神经信息检索的性能?
  • RQ2使用合成样例微调MRC模型是否能在特定领域问答数据集上带来可测量的答案抽取准确率提升?
  • RQ3在SQuAD与Natural Questions等不同问题风格下生成的合成样例,其质量有何差异?哪种风格能带来更好的下游性能?
  • RQ4在目标领域进行语言建模与合成数据生成在MRC性能提升方面,其联合贡献程度如何?
  • RQ5所提出的端到端问答系统在零样本自适应到COVID-19领域时,是否显著优于强健的开放域基线?

主要发现

  • 使用合成数据的端到端问答系统在COVID-QA-111测试集上达到47.8的F1分数,较基线(45.9 F1)提升了1.9分。
  • 在COVID-QA-2019数据集上,最终系统达到44.9的F1分数,较基线(41.2 F1)提升了3.7分。
  • 在COVID-QA-2019开发集上,结合合成样例与领域内语言建模后,微调后的MRC模型在EM上提升了3.1分,在F1上提升了2.6分。
  • 使用SQuAD训练的生成器生成的合成样例优于NQ风格生成,表明问题风格对合成数据质量有显著影响。
  • 配对t检验确认,最终端到端系统的性能显著优于基线(p < 0.01)。
  • 合成MRC样例的贡献(EM提升3.1分,F1提升2.6分)超过领域内语言建模的贡献(EM提升1.5分,F1提升0.8分),凸显其更大的影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。