[论文解读] Multi-task Learning with Sample Re-weighting for Machine Reading Comprehension
本文提出一种结合样本重加权的多任务学习框架,用于机器阅读理解(MRC),提升了模型在多样化MRC任务中的泛化能力。通过为来自辅助领域(如NewsQA、MS MARCO)的训练样本分配动态、数据驱动的权重,该方法在SQuAD及其他基准测试中显著提升了性能,实现了最先进(SOTA)结果——当结合ELMo嵌入时,在NewsQA上的精确匹配(exact match)指标超越人类表现13.4分。
We propose a multi-task learning framework to learn a joint Machine Reading Comprehension (MRC) model that can be applied to a wide range of MRC tasks in different domains. Inspired by recent ideas of data selection in machine translation, we develop a novel sample re-weighting scheme to assign sample-specific weights to the loss. Empirical study shows that our approach can be applied to many existing MRC models. Combined with contextual representations from pre-trained language models (such as ELMo), we achieve new state-of-the-art results on a set of MRC benchmark datasets. We release our code at https://github.com/xycforgithub/MultiTask-MRC.
研究动机与目标
- 通过利用多样化、多领域训练数据,提升MRC模型的泛化能力。
- 解决在未有效样本加权的情况下组合多个MRC数据集时性能欠佳的挑战。
- 开发一种灵活且可训练的重加权机制,为来自辅助任务的更具信息量或更相似的样本分配更高重要性。
- 证明结合样本重加权的多任务学习可优于单任务学习及现有MTL基线方法。
- 实现在不依赖预训练语言模型或复杂数据增强技术的前提下,实现高效端到端训练。
提出的方法
- 提出一种多任务学习框架MT-SAN,通过共享编码器和任务特定头,联合训练多个MRC数据集(如SQuAD、NewsQA、MS MARCO)。
- 提出一种样本重加权方案,基于语言模型得分和答案长度归一化,计算样本特定的权重,以衡量问题与答案的质量。
- 使用归一化得分(H′_Q 和 H′_A)来估计每个问题-答案对的信息量,得分越高表示与目标任务的相关性越强。
- 应用损失函数,将任务特定损失按这些动态计算的样本权重进行加权,从而增强相关样本的训练信号。
- 采用CED′指标聚合问题与答案质量得分,用于指导重加权过程。
- 引入混合比例基线用于对比,其中来自辅助任务的训练数据按固定超参数比例采样。
实验结果
研究问题
- RQ1在多样化MRC数据集上进行多任务学习是否能提升目标MRC任务的泛化能力与性能?
- RQ2基于问题与答案质量的样本重加权,与固定混合比例采样相比,在多任务MRC训练中表现如何?
- RQ3与基于比例的采样相比,所提出的重加权方案是否能降低对超参数调优的敏感性?
- RQ4当结合上下文嵌入(如ELMo)时,结合样本重加权的多任务框架是否能实现最先进性能?
- RQ5该模型在跨域数据集(如NewsQA和MS MARCO)上的表现如何,尤其是与人类表现相比?
主要发现
- 所提出的样本重加权方法在SQuAD+MARCO上相比朴素数据组合基线,精确匹配(EM)和F1分别提升0.6个百分点,且在全部三个数据集上最高提升达1个百分点。
- 在NewsQA数据集上,模型在精确匹配上超越人类表现13.4分(46.5 vs. 59.9),F1指标提升3.2分(72.6 vs. 69.4)。
- 模型在NewsQA和TriviaQA上均达到最先进性能,展现出强大的跨领域泛化能力。
- 混合比例方法对超参数选择极为敏感,当偏离最优α=0.4时,性能下降约0.5%,凸显了鲁棒重加权的必要性。
- 样本重加权优于任务不确定性加权(Kendall et al., 2018),并消除了对超参数网格搜索的需求,提升了训练效率。
- 该方法与预训练嵌入(如ELMo)正交且互补,两者结合可进一步提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。