[论文解读] Unsupervised Domain Adaptation of Language Models for Reading Comprehension
本文提出了一种用于阅读理解无监督域自适应(UDARC)的多任务学习方法,其中基于 BERT 的模型在源域的监督阅读理解数据和目标域的未标注段落上进行联合微调。该方法通过同时保持源域阅读理解能力并获取目标域语言建模知识,在无需任何目标域标注数据的情况下,显著提升了分布外设置下的问答性能——在生物医学领域实现了 EM/F1 分数 4.3/4.2 的提升。
This study tackles unsupervised domain adaptation of reading comprehension (UDARC). Reading comprehension (RC) is a task to learn the capability for question answering with textual sources. State-of-the-art models on RC still do not have general linguistic intelligence; i.e., their accuracy worsens for out-domain datasets that are not used in the training. We hypothesize that this discrepancy is caused by a lack of the language modeling (LM) capability for the out-domain. The UDARC task allows models to use supervised RC training data in the source domain and only unlabeled passages in the target domain. To solve the UDARC problem, we provide two domain adaptation models. The first one learns the out-domain LM and in-domain RC task sequentially. The second one is the proposed model that uses a multi-task learning approach of LM and RC. The models can retain both the RC capability acquired from the supervised data in the source domain and the LM capability from the unlabeled data in the target domain. We evaluated the models on UDARC with five datasets in different domains. The models outperformed the model without domain adaptation. In particular, the proposed model yielded an improvement of 4.3/4.2 points in EM/F1 in an unseen biomedical domain.
研究动机与目标
- 为解决最先进阅读理解模型在分布外数据集上泛化能力差的问题,原因在于缺乏领域特定的语言建模能力。
- 实现在目标域中无需标注问题-答案对的阅读理解领域自适应。
- 探究在未标注目标域段落上进行无监督预训练是否能提升在未见领域上的零样本性能。
- 开发一种方法,既能保留源域阅读理解知识,又能学习目标域语言建模知识,同时避免灾难性遗忘。
- 评估无监督域自适应在多样化领域中的有效性,特别是低资源或专家知识型领域。
提出的方法
- 所提出的方法使用多任务学习,联合优化源域数据上的阅读理解(RC)任务和未标注目标域段落上的语言建模(LM)任务。
- 共享的 BERT 主干网络同时对两个任务进行微调,从而实现在 RC 和 LM 目标之间的知识迁移。
- 模型通过平衡损失进行训练,结合 RC 损失(例如跨度预测)和目标域文本上的掩码语言建模损失。
- 该方法通过在微调过程中同时优化两个任务,避免了遗忘,从而在保持源域 RC 性能的同时适应目标域。
- 将该方法与一种序列适应基线进行比较,该基线首先在目标数据上微调语言建模,然后在源数据上微调阅读理解。
- 该框架在五个涵盖不同领域的数据集上进行了评估,包括生物医学领域(BioASQ)、新闻领域(NewsQA)和通用维基百科领域(SQuAD)。
实验结果
研究问题
- RQ1在未标注目标域段落上进行无监督语言建模,是否能提升在分布外设置下的零样本阅读理解性能?
- RQ2RC 和 LM 的多任务学习是否能防止在自适应过程中源域知识的灾难性遗忘?
- RQ3该方法的性能如何随未标注目标域段落数量的变化而变化?
- RQ4源域选择对自适应性能有何影响?
- RQ5需要多少源域阅读理解数据才能在目标域中实现优异性能?
主要发现
- 所提出的多任务学习模型在从维基百科(SQuAD)迁移到生物医学领域(BioASQ)时,EM/F1 分数分别提升了 4.3/4.2 分,优于无自适应基线。
- 即使在目标域中仅有 500 个未标注段落的情况下,模型仍实现了 EM/F1 3.7/3.3 分的提升,表明其在极小数据量下依然有效。
- 该模型优于序列适应基线,表明联合优化可有效防止源域知识的遗忘。
- 随着源域 RC 数据量的增加,性能持续提升,尤其在训练样本达到 10,000 个之前提升迅速,之后增速放缓。
- 源域选择显著影响性能:在迁移到 BioASQ 时,SQuAD 表现优于 NewsQA,但在 DuoRC 上两者性能相近。
- 语言建模与阅读理解训练步数比(k)的最优值因领域而异,k=10 和 k=100 在不同领域中均表现出色,具体取决于领域与 BERT 预训练分布的距离。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。