Skip to main content
QUICK REVIEW

[论文解读] End-to-End Synthetic Data Generation for Domain Adaptation of Question Answering Systems

Siamak Shakeri, Cícero Nogueira dos Santos|arXiv (Cornell University)|Oct 12, 2020
Topic Modeling参考文献 32被引用 21
一句话总结

本文提出一种基于微调后的BART编码器-解码器Transformer的端到端单模型方法,用于生成合成问答(QA)数据。该模型从段落中逐 token 生成问题和答案,使用语言模型似然度作为过滤得分,实现在NQ、BioASQ、NewsQA和DuoRC上的最先进领域适应性能,在NQ上EM得分提升超过8分,在其他数据集上提升4分以上。

ABSTRACT

We propose an end-to-end approach for synthetic QA data generation. Our model comprises a single transformer-based encoder-decoder network that is trained end-to-end to generate both answers and questions. In a nutshell, we feed a passage to the encoder and ask the decoder to generate a question and an answer token-by-token. The likelihood produced in the generation process is used as a filtering score, which avoids the need for a separate filtering model. Our generator is trained by fine-tuning a pretrained LM using maximum likelihood estimation. The experimental results indicate significant improvements in the domain adaptation of QA models outperforming current state-of-the-art methods.

研究动机与目标

  • 解决多阶段合成QA数据生成流水线存在的误差传播和高计算成本问题。
  • 通过将答案和问题生成整合到单一端到端模型中,消除对独立跨度检测和问题过滤模块的需求。
  • 通过仅使用一个微调后的变压器模型生成高质量合成QA对,提升QA系统的领域适应能力。
  • 评估语言模型似然度得分是否能有效替代专用过滤模型,用于合成QA数据的筛选。

提出的方法

  • 使用通过最大似然估计微调的单一变压器编码器-解码器模型(BART),基于段落条件生成答案和问题。
  • 训练三种变体:AQGen(先生成答案再生成问题)、QAGen(先生成问题再生成答案)以及QAGen2S(先生成问题,再通过上下文拼接在第二轮中生成答案)。
  • 使用生成序列的对数似然度作为过滤得分,对高质量QA对进行排序和筛选,从而无需额外的过滤模型。
  • 将模型应用于目标领域段落(如NQ、PubMed)生成合成QA对,并使用合成数据与源领域数据(SQuAD)联合微调下游阅读理解模型。
  • 通过比较基于LM的过滤、往返过滤和无过滤三种方式,评估过滤方法的有效性。
  • 对数据集规模和模型容量进行消融研究,评估在小型和大型阅读理解模型上的可扩展性和鲁棒性。

实验结果

研究问题

  • RQ1单一端到端变压器模型是否能在不依赖独立跨度检测或过滤模块的情况下,有效从段落中生成问题和答案?
  • RQ2语言模型似然度得分是否与下游F1存在足够强的相关性,可作为筛选合成QA对的可靠代理指标?
  • RQ3在问答领域的领域适应中,与多阶段流水线相比,端到端合成数据生成在性能和效率方面表现如何?
  • RQ4从源领域(如SQuAD)生成的合成数据在多大程度上能提升在多样化目标领域(如NQ、BioASQ、NewsQA)上的性能?
  • RQ5所提出的方法是否能同时提升小型和大型预训练语言模型(如BERT-base、RoBERTa-large)在低资源领域适应设置下的表现?

主要发现

  • QAGen2S(先生成问题,再通过上下文拼接在第二轮中生成答案)表现最佳,在Natural Questions数据集上相比SQuAD基线EM得分提升8.1分,F1得分提升7.3分。
  • 在BioASQ和NewsQA上,QAGen2S的EM得分提升超过4分,表明其在多样化领域中具有强大的泛化能力。
  • 使用LM似然度作为过滤得分与下游F1存在强相关性,尽管存在噪声,但需设置较高阈值才能获得高质量样本。
  • QAGen2S生成的合成数据使RoBERTa-large在SQuAD开发集上的F1/EM得分分别提升3.1/2.2分,BERT-base-uncased则提升1.0/0.5分。
  • 端到端模型优于三阶段基线方法及其它生成顺序(AQGen、QAGen),证明了联合生成与第二轮双向上下文的有效性。
  • 随着合成数据集规模增大,性能持续提升,尤其在未使用SQuAD数据时更为显著,证实了合成数据在低资源场景下的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。