Skip to main content
QUICK REVIEW

[论文解读] Enhancing Answer Boundary Detection for Multilingual Machine Reading Comprehension

Fei Yuan, Linjun Shou|arXiv (Cornell University)|Apr 29, 2020
Topic Modeling参考文献 29被引用 6
一句话总结

本文提出两种辅助任务——混合多语言机器阅读理解(mixMRC)和语言无关知识掩码(LAKM)——以提升多语言机器阅读理解中的答案边界检测性能,尤其针对低资源语言。通过利用跨语言的问题-段落对及网络挖掘的知识短语,该方法在西班牙语和德语上的F1值最高提升4.7%,相较于BERT和XLM基线模型,在低资源语言上表现显著提升。

ABSTRACT

Multilingual pre-trained models could leverage the training data from a rich source language (such as English) to improve performance on low resource languages. However, the transfer quality for multilingual Machine Reading Comprehension (MRC) is significantly worse than sentence classification tasks mainly due to the requirement of MRC to detect the word level answer boundary. In this paper, we propose two auxiliary tasks in the fine-tuning stage to create additional phrase boundary supervision: (1) A mixed MRC task, which translates the question or passage to other languages and builds cross-lingual question-passage pairs; (2) A language-agnostic knowledge masking task by leveraging knowledge phrases mined from web. Besides, extensive experiments on two cross-lingual MRC datasets show the effectiveness of our proposed approach.

研究动机与目标

  • 为解决多语言预训练模型在跨度抽取型MRC任务中迁移性能差的问题,特别是针对低资源语言。
  • 提升答案边界检测性能,该任务对抽取型MRC至关重要,但其表现仍逊于句子级任务。
  • 缩小英语与非英语MRC性能之间的差距,尤其在F1值指标上。
  • 引入辅助监督信号,以增强跨语言的短语级对齐与知识感知表示学习。

提出的方法

  • 提出一种混合MRC任务,通过在微调阶段将问题或段落翻译为其他语言,构建跨语言的问题-段落对。
  • 引入一种语言无关的知识掩码(LAKM)任务,利用从网络中挖掘的知识短语提供短语级监督。
  • 采用语言无关的方法生成每种语言的知识短语,重点关注语言特定的短语,如实体和名词短语。
  • 将多语言模型(如M-BERT、XLM)同时以mixMRC和LAKM作为辅助任务进行微调,以提升答案跨度边界检测性能。
  • 采用掩码策略,在预训练阶段将知识短语替换为[MASK]标记,以促使模型学习更精确的跨度边界。
  • 联合训练mixMRC和LAKM任务,同时利用跨语言对齐与知识感知监督。

实验结果

研究问题

  • RQ1通过混合语言MRC对构建的跨语言数据增强是否能提升多语言MRC中的答案边界检测性能?
  • RQ2通过掩码任务引入语言无关的知识短语是否能提升低资源语言的性能?
  • RQ3所提出的辅助任务对不同答案类型的影响如何,特别是对命名实体和数值跨度?
  • RQ4当仅使用英语数据时,LAKM任务在零样本或少样本MRC设置下能多大程度上提升性能?

主要发现

  • 与M-BERT基线相比,mixMRC与LAKM联合使用在MLQA数据集上使西班牙语的F1值提升1.7%,德国语提升4.7%。
  • 仅使用LAKM时,XLM模型在西班牙语上F1值提升1.8%,德国语提升3.2%,而英语仅提升0.5%,表明在低资源语言上增益更显著。
  • 在仅使用英语数据的零样本设置下,LAKM在MTQA数据集上使英语F1值提升2.0%,法语提升3.3%,德国语提升3.8%。
  • LAKM在所有语言上均优于随机n-gram掩码,F1值提升0.2%至0.87%,证明知识感知掩码的必要性。
  • 对于与实体相关的答案类型(如'full_name'和'animal'),LAKM分别实现14.3%和9.1%的F1值提升,优于mixMRC,归因于对命名实体的更好覆盖。
  • 数值类答案类型(如'money'、'numeric')在mixMRC与LAKM之间表现相近,表明此类跨度的跨语言迁移相对容易。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。