Skip to main content
QUICK REVIEW

[论文解读] BERT Based Multilingual Machine Comprehension in English and Hindi

Somil Gupta, Nilesh Khade|arXiv (Cornell University)|Jun 2, 2020
Topic Modeling参考文献 14被引用 16
一句话总结

本文提出了一种基于多语言 BERT 的模型,用于英语-印地语机器阅读理解,表明在单语和跨语言问答数据上微调 m-BERT 可显著提升性能,超越先前的最先进水平。作者将 m-BERT 确立为英语-印地语 MMC 的新 SOTA,并提出了一个扩展的、人工翻译的 XQuAD 基准,以供未来研究使用。

ABSTRACT

Multilingual Machine Comprehension (MMC) is a Question-Answering (QA) sub-task that involves quoting the answer for a question from a given snippet, where the question and the snippet can be in different languages. Recently released multilingual variant of BERT (m-BERT), pre-trained with 104 languages, has performed well in both zero-shot and fine-tuned settings for multilingual tasks; however, it has not been used for English-Hindi MMC yet. We, therefore, present in this article, our experiments with m-BERT for MMC in zero-shot, mono-lingual (e.g. Hindi Question-Hindi Snippet) and cross-lingual (e.g. English QuestionHindi Snippet) fine-tune setups. These model variants are evaluated on all possible multilingual settings and results are compared against the current state-of-the-art sequential QA system for these languages. Experiments show that m-BERT, with fine-tuning, improves performance on all evaluation settings across both the datasets used by the prior model, therefore establishing m-BERT based MMC as the new state-of-the-art for English and Hindi. We also publish our results on an extended version of the recently released XQuAD dataset, which we propose to use as the evaluation benchmark for future research.

研究动机与目标

  • 评估 m-BERT 在英语和印地语(一种低资源语言对)的多语言机器阅读理解中的表现。
  • 解决英语-印地语 MMC 缺乏标准化、公开可用的评估基准的问题。
  • 通过在零样本、单语和跨语言设置下对 m-BERT 进行微调,将性能提升至超越先前最先进序列模型的水平。
  • 提出 XQuAD 数据集的扩展版本,包含跨语言的问答对(例如,英语问题,印地语答案),作为新的评估基准。
  • 分析 m-BERT 在多语言环境中处理回指、逆指以及推理类问题的能力。

提出的方法

  • 在从 SQuAD 和印地语 SQuAD 子集翻译而来的多语言问答数据集上微调 m-BERT。
  • 在三种设置下评估 m-BERT:零样本(无印地语微调)、单语印地语问答微调,以及使用英语问题搭配印地语篇章的跨语言增强。
  • 使用类 SQuAD 的合成格式构建训练数据,包含单语和跨语言配对。
  • 通过创建新的跨语言变体(例如,英语问题,印地语答案)扩展 XQuAD 数据集,以作为基准。
  • 通过利用 m-BERT 在 104 种语言上的预训练,实现迁移学习,以提升零样本和少样本性能。
  • 对模型行为进行定性和定量分析,包括回指解析以及事实类与描述类问题的表现。

实验结果

研究问题

  • RQ1m-BERT 是否能在不进行任务特定架构修改的情况下,实现在英语-印地语多语言机器阅读理解中的最先进性能?
  • RQ2在单语或跨语言问答数据上微调 m-BERT 是否能在所有多语言评估设置中提升性能?
  • RQ3考虑到训练数据分布的偏差,m-BERT 在推理类和描述类问题上的表现与事实类问题相比如何?
  • RQ4一个由人工翻译的、扩展的 XQuAD 基准,包含跨语言变体,能否作为未来研究的可靠且标准化的评估基准?
  • RQ5m-BERT 在多语言环境中处理句法和语义指代(例如,回指、逆指)的能力如何?

主要发现

  • 在单语印地语问答数据上微调的 m-BERT 在所有评估设置下均显著优于先前的最先进序列模型,确立了其在英语-印地语 MMC 领域的新 SOTA 地位。
  • 跨语言微调(例如,英语问题搭配印地语篇章)提升了跨语言评估任务的性能,但略微降低了单语结果,表明泛化能力存在权衡。
  • m-BERT 的零样本性能低于基线,但仅在 10.5K 个实例的多语言数据上进行微调即可带来显著提升,表明其在更大数据集下具有良好的可扩展性。
  • 模型在解析回指和逆指方面表现出色,能正确识别先行词(如 'Pumban Island')而非代词 'It',并倾向于使用完整名词短语而非代词。
  • 事实类问题在所有情况下均以精确匹配回答,而描述类问题则表现出部分或改写后的回答,表明由于数据稀缺,其推理能力有限。
  • 模型在多语言环境中改写问题的能力表明其具备稳健的语义理解能力,但在推理任务中仍显不足,凸显了需要更多样化的训练数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。