[论文解读] MMM: Multi-stage Multi-task Learning for Multi-choice Reading Comprehension
本文提出MMM,一种多阶段多任务学习框架,通过在域外自然语言蕴含(NLI)数据集上进行粗调,随后在大规模域内多选题阅读理解(MCQA)数据集(RACE)上通过多任务学习进行微调,从而提升多选题阅读理解性能。该方法实现了最先进性能,在四个MCQA数据集上将基于BERT的模型准确率绝对提升至少7%,相较于先前最先进方法最高提升达16%,尤其在推理和算术类问题上表现突出。
Machine Reading Comprehension (MRC) for question answering (QA), which aims to answer a question given the relevant context passages, is an important way to test the ability of intelligence systems to understand human language. Multiple-Choice QA (MCQA) is one of the most difficult tasks in MRC because it often requires more advanced reading comprehension skills such as logical reasoning, summarization, and arithmetic operations, compared to the extractive counterpart where answers are usually spans of text within given passages. Moreover, most existing MCQA datasets are small in size, making the learning task even harder. We introduce MMM, a Multi-stage Multi-task learning framework for Multi-choice reading comprehension. Our method involves two sequential stages: coarse-tuning stage using out-of-domain datasets and multi-task learning stage using a larger in-domain dataset to help model generalize better with limited data. Furthermore, we propose a novel multi-step attention network (MAN) as the top-level classifier for this task. We demonstrate MMM significantly advances the state-of-the-art on four representative MCQA datasets.
研究动机与目标
- 解决多选题阅读理解(MCQA)中标签数据有限的挑战,其中现有数据集规模较小且需要高级推理能力。
- 通过有效的迁移学习策略,提升基于BERT的模型在低资源MCQA数据集上的泛化能力。
- 探究是否可以联合利用域外NLI数据集和域内大规模MCQA数据集的知识以提升性能。
- 设计一种新型顶层分类器——多步注意力网络(MAN),以更好地捕捉MCQA中的复杂推理模式。
- 证明两阶段训练策略——先在NLI数据集上粗调,再在RACE和目标数据集上进行多任务微调——在MCQA基准上表现更优。
提出的方法
- 采用两阶段训练策略:首先在域外NLI数据集(如MNLI)上对模型进行粗调,以学习通用推理和文本蕴涵能力。
- 然后在RACE大规模域内数据集与目标MCQA数据集(如DREAM、MCTest、TOEFL、SemEval)的组合上进行多任务微调,以在数据稀缺条件下提升泛化能力。
- 引入多步注意力网络(MAN)作为顶层分类器,替代标准全连接层,以建模篇章、问题和答案选项之间的复杂注意力流。
- 使用BERT或RoBERTa作为基础编码器,表示篇章、问题和候选答案的拼接输入。
- 使用交叉熵损失对多类分类任务在答案选项上进行端到端优化。
- 利用领域特定的数据增强和知识蒸馏技术进一步提升模型的鲁棒性和性能。
实验结果
研究问题
- RQ1在域外NLI数据集上进行粗调是否能提升基于BERT的模型在低资源MCQA任务中的推理能力?
- RQ2在大规模域内MCQA数据集(RACE)上结合目标数据集进行多任务微调,是否能比标准微调带来更好的泛化性能?
- RQ3与标准前馈分类器相比,所提出的多步注意力网络(MAN)在捕捉MCQA中复杂推理模式方面的有效性如何?
- RQ4两阶段训练策略相较于单阶段微调或其它迁移学习方法,在MCQA基准上表现更优的程度如何?
- RQ5该模型在不同问题类型(如逻辑推理、算术、常识)上的表现如何?其失败模式是什么?
主要发现
- MMM框架在所有四个MCQA数据集(DREAM、MCTest、TOEFL、SemEval)上,将BERT-base模型的准确率绝对提升至少7%,相较于先前最先进方法最高提升达16%。
- 两阶段训练策略——先在NLI上粗调,再在RACE和目标数据集上进行多任务微调——被证明是最优方法,显著优于单阶段微调。
- 多步注意力网络(MAN)相比标准全连接分类器表现更优,尤其在复杂推理和匹配类问题上。
- 模型在具有挑战性的问题类型上表现出显著提升:算术类问题的准确率提升至73.7%(相较于基线),在匹配类问题上的改进尤为显著。
- 尽管算术类问题准确率较高,但模型对问题或篇章的微小扰动较为脆弱,表明其可能并非真正执行数学推理,而是依赖于模式匹配。
- 错误分析显示,与BERT-base基线相比,该模型显著减少了常见错误预测类型,尤其在逻辑推理和常识推理方面。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。