[论文解读] Multi-task Learning with Multi-head Attention for Multi-choice Reading Comprehension
本文提出一种基于 ALBERT-xxlarge 与双注意力多头协同注意力(DUMA)模块的多任务学习方法,用于 DREAM 数据集上的多选阅读理解任务。通过在 DREAM 和 RACE 数据集上联合训练,该模型在测试集上取得了 91.8% 的新 SOTA 准确率,尽管上下文格式存在差异(对话式 vs. 段落式),但通过提升泛化能力和知识迁移,显著优于先前方法。
Multiple-choice Machine Reading Comprehension (MRC) is an important and challenging Natural Language Understanding (NLU) task, in which a machine must choose the answer to a question from a set of choices, with the question placed in context of text passages or dialog. In the last a couple of years the NLU field has been revolutionized with the advent of models based on the Transformer architecture, which are pretrained on massive amounts of unsupervised data and then fine-tuned for various supervised learning NLU tasks. Transformer models have come to dominate a wide variety of leader-boards in the NLU field; in the area of MRC, the current state-of-the-art model on the DREAM dataset (see[Sunet al., 2019]) fine tunes Albert, a large pretrained Transformer-based model, and addition-ally combines it with an extra layer of multi-head attention between context and question-answer[Zhuet al., 2020].The purpose of this note is to document a new state-of-the-art result in the DREAM task, which is accomplished by, additionally, performing multi-task learning on two MRC multi-choice reading comprehension tasks (RACE and DREAM).
研究动机与目标
- 提升在 DREAM 数据集上的多选阅读理解任务性能,该数据集相对较小且具有挑战性。
- 探究从更大、相关的多选阅读理解数据集(RACE)中迁移知识,是否能提升在 DREAM 上的泛化能力与性能表现。
- 评估在两种不同上下文格式但相关联的阅读理解任务之间,采用共享模型架构的多任务学习的有效性。
- 验证多头注意力机制(DUMA)是否能在联合训练设置中增强上下文、问题与答案选项之间的推理能力。
提出的方法
- 微调预训练的 ALBERT-xxlarge 模型作为 DREAM 和 RACE 数据集的主编码器。
- 使用双多头协同注意力(DUMA)模块,计算上下文与问题-答案对之间的交叉注意力,实现更深层次的交互。
- 使用 <sep> 标记将上下文、问题和答案选项拼接为单个序列,并输入编码器与 DUMA 层。
- 对两种 DUMA 注意力表示(上下文到 QA 和 QA 到上下文)进行平均池化,并将结果拼接用于分类。
- 使用交叉熵损失与线性分类器对答案选项进行优化,以实现答案预测。
- 通过按数据集大小比例采样 DREAM 和 RACE 的小批量数据,实现多任务学习,共享所有模型组件。
实验结果
研究问题
- RQ1在两个多选阅读理解数据集(DREAM 与 RACE)上进行联合训练,是否能提升在较小 DREAM 数据集上的性能?
- RQ2采用共享模型架构的多任务学习,是否能将在对话式与段落式上下文之间迁移有用的推理模式?
- RQ3双多头协同注意力机制(DUMA)的引入,对多选阅读理解性能有何影响?
- RQ4多任务学习在低资源阅读理解数据集(如 DREAM)上,能在多大程度上缓解过拟合并提升泛化能力?
- RQ5多任务学习带来的性能增益,是否足以抵消 RACE 与 DREAM 之间在领域或格式差异上可能产生的负面干扰?
主要发现
- 所提出的多任务学习模型在 DREAM 数据集上取得了 91.8% 的新 SOTA 测试准确率,超越了 Zhu 等人(2020)的先前最佳结果 90.4%。
- 尽管 DREAM 数据集较小且使用对话式上下文,而 RACE 使用段落式上下文,联合训练仍使模型获得显著收益。
- 单任务设置下的 ALBERT-xxlarge + DUMA 在验证集上达到 90.7%,在测试集上达到 88.6%,表明基线性能已非常强劲。
- 与单任务基线及先前 SOTA 方法相比,多任务学习设置在验证集和测试集上均实现了性能提升。
- 结果表明,多任务学习能有效在相似但不完全相同的阅读理解任务之间迁移推理模式,即使上下文格式不同。
- 模型性能的提升证明了利用更大、相关数据集通过共享表征学习来改进低资源阅读理解任务的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。