Skip to main content
QUICK REVIEW

[论文解读] MRQA 2019 Shared Task: Evaluating Generalization in Reading Comprehension

Adam Fisch, Alon Talmor|arXiv (Cornell University)|Oct 22, 2019
Topic Modeling参考文献 35被引用 21
一句话总结

本论文介绍了 MRQA 2019 共享任务,该任务评估了抽取式阅读理解模型在多样化、分布外数据集上的泛化能力。通过将 18 个问答数据集统一为一种通用格式,并在 12 个保留的数据集上进行评估,最佳系统在平均 F1 得分上达到 72.5,比基于 BERT 的基线高出 10.7 分,表明通过多任务学习、对抗性训练和模型集成等技术,跨领域泛化能力取得了显著进展。

ABSTRACT

We present the results of the Machine Reading for Question Answering (MRQA) 2019 shared task on evaluating the generalization capabilities of reading comprehension systems. In this task, we adapted and unified 18 distinct question answering datasets into the same format. Among them, six datasets were made available for training, six datasets were made available for development, and the final six were hidden for final evaluation. Ten teams submitted systems, which explored various ideas including data sampling, multi-task learning, adversarial training and ensembling. The best system achieved an average F1 score of 72.5 on the 12 held-out datasets, 10.7 absolute points higher than our initial baseline based on BERT.

研究动机与目标

  • 评估阅读理解模型在训练数据分布之外的分布外数据上的泛化能力。
  • 通过将 18 个多样化问答数据集统一为一种通用格式,建立提取式问答中泛化的标准化基准。
  • 评估多种技术(如多任务学习、对抗性训练和模型集成)在提升跨领域性能方面的有效性。
  • 将领域内微调性能与分布外泛化性能进行对比,以分离数据分布偏移与模型容量限制带来的局限性。
  • 提供对模型在多样化领域中失败与成功原因的洞察,为未来构建鲁棒、可泛化的 NLP 系统提供指导。

提出的方法

  • 将 18 个不同的问答数据集统一为包含问题、上下文和答案跨度的单一抽取式 QA 格式,以实现一致的评估。
  • 将数据集划分为训练集(6 个)、开发集(6 个)和隐藏测试集(6 个),以模拟真实世界的分布外泛化场景。
  • 使用基于 BERT 的模型作为基线,在训练数据上进行微调,并在宏平均 F1 和精确匹配(EM)得分上进行评估。
  • 应用多种技术,如与自然语言推理(NLI)任务结合的多任务学习、使用领域判别器的对抗性领域自适应,以及通过加权 logit 平均实现的模型集成。
  • 实现了一种专家混合(mixture-of-experts)层,根据输入动态组合模型预测,通过自适应集成提升泛化能力。
  • 在每个测试数据集上进行领域内微调实验,以比较性能提升,并评估性能限制是由数据稀缺性还是模型泛化能力不足所致。

实验结果

研究问题

  • RQ1预训练语言模型在未在训练中见过的分布外问答数据集上,其泛化能力能达到何种程度?
  • RQ2哪些架构与训练技术(如对抗性训练、多任务学习或模型集成)最有效地提升跨领域泛化能力?
  • RQ3仅使用新分布中少量领域内样本对通用模型进行微调,能带来多大性能提升?
  • RQ4为何某些模型即使接触了有限的领域内数据仍无法泛化,这揭示了模型泛化能力的哪些本质限制?
  • RQ5不同数据分布(如维基百科、新闻、网页片段)如何影响模型性能与泛化行为?

主要发现

  • 最佳系统 D-Net 在 12 个保留的测试数据集上取得了 72.5 的平均 F1 得分,比初始的 BERT 基线高出 10.7 个百分点。
  • 对抗性训练在 12 个数据集中的 9 个上提升了性能,相比 BERT-Base 基线提升了 +1.9 的 F1 得分,但在更强的 BERT-Large 模型上提升较小。
  • 模型集成技术(包括模型平均和专家混合)在多个提交结果中均带来了适度但稳定的性能增益。
  • 与 NLI 任务结合的多任务学习在 Split II 开发集上带来了 +0.7 的 F1 提升,但其他提交未发现益处,表明其效果对任务兼容性敏感。
  • 领域内微调使基线整体提升了 4.6 的 F1 得分,但仅在 RelationExtraction 数据集中完全弥合了性能差距,表明 D-Net 的成功源于更强的归纳偏置或更好的泛化能力,而非单纯的数据多样性。
  • 尽管进行了领域内微调,大多数数据集上仍存在显著性能差距,表明泛化限制并非仅由数据稀缺性导致,还源于模型的归纳偏置或分布偏移的根本性挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。