Skip to main content
QUICK REVIEW

[论文解读] Question Answering through Transfer Learning from Large Fine-grained Supervision Data

Sewon Min, Minjoon Seo|arXiv (Cornell University)|Feb 7, 2017
Topic Modeling参考文献 37被引用 18
一句话总结

本文表明,从大规模、跨度监督的阅读理解数据集(SQuAD)进行迁移学习,能显著提升在句子级阅读理解任务上的性能。通过在SQuAD上预训练的BiDAF模型进行微调,作者在WikiQA上取得了+8.0%的性能提升,在SemEval-2016 Task 3A上取得了+1.0%的提升,表明细粒度监督相比粗粒度监督,能更有效地促进词汇和句法特征的学习。

ABSTRACT

We show that the task of question answering (QA) can significantly benefit from the transfer learning of models trained on a different large, fine-grained QA dataset. We achieve the state of the art in two well-studied QA datasets, WikiQA and SemEval-2016 (Task 3A), through a basic transfer learning technique from SQuAD. For WikiQA, our model outperforms the previous best model by more than 8%. We demonstrate that finer supervision provides better guidance for learning lexical and syntactic information than coarser supervision, through quantitative results and visual analysis. We also show that a similar transfer learning procedure achieves the state of the art on an entailment task.

研究动机与目标

  • 探究是否可以从大规模、跨度监督的阅读理解数据集(如SQuAD)进行迁移学习,以提升在粗粒度、句子级阅读理解任务上的性能。
  • 评估源数据集中细粒度监督是否相比其他数据集的粗粒度监督,能为学习词汇和句法特征提供更好的归纳偏置。
  • 将迁移学习方法扩展至非阅读理解任务,具体为文本蕴涵任务(RTE),以评估其更广泛的应用潜力。
  • 比较不同预训练策略(包括SQuAD、SQuAD-T以及与SNLI的组合)在下游任务中的有效性。

提出的方法

  • 在包含10万条训练样本的大规模跨度级阅读理解数据集SQuAD上预训练BiDAF模型。
  • 在目标句子级阅读理解数据集(WikiQA和SemEval-2016 Task 3A)上微调预训练模型。
  • 创建SQuAD的修改版本SQuAD-T,使其更符合目标任务的监督格式和上下文结构。
  • 利用注意力图和稀疏度分析(通过公式2)可视化并量化模型对问题与上下文词语之间对齐的程度。
  • 将相同的迁移学习流程应用于SICK文本蕴涵数据集,先在SQuAD和/或SNLI上预训练,再在SICK上微调。
  • 使用标准指标评估性能:QA任务使用MAP,RTE任务使用准确率,比较有无预训练的模型表现。

实验结果

研究问题

  • RQ1从大规模、跨度监督的阅读理解数据集(如SQuAD)进行迁移学习,是否能显著提升在句子级阅读理解任务上的性能?
  • RQ2SQuAD中的细粒度监督是否相比其他数据集中较粗的监督,能为学习句法和词汇特征提供更优的指导?
  • RQ3在跨度级阅读理解上预训练的模型,是否能有效泛化到其他NLP任务(如文本蕴涵,RTE)?
  • RQ4源数据集的规模与监督质量如何相互作用,以影响迁移学习的性能?

主要发现

  • 在WikiQA上,SQuAD预训练模型达到79.90的MAP,比之前最佳模型高出8%以上。
  • 在SemEval-2016 Task 3A上,该模型相比之前最先进模型实现了1%的性能提升。
  • SQuAD预训练模型的注意力图稀疏度(0.56)显著低于SQuAD-T预训练模型(0.84),表明其在词级别对齐更精确。
  • 可视化分析显示,SQuAD预训练模型更好地捕捉了语义对应关系,例如'airbus'与'aircraft'或'aerospace'之间的关联。
  • 在SICK蕴涵数据集上,SQuAD+SNLI联合预训练模型达到88.22%的准确率,比之前最先进模型高出2%。
  • 在SQuAD+SNLI上预训练的表现优于仅在SNLI上预训练,表明规模与细粒度监督共同促进了性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。