Skip to main content
QUICK REVIEW

[论文解读] One Question Answering Model for Many Languages with Cross-lingual Dense Passage Retrieval

Akari Asai, Xinyan Yu|arXiv (Cornell University)|Jul 26, 2021
Topic Modeling被引用 31
一句话总结

CORA 是一个统一的多语言多对多开放式问答模型,能够在跨语言检索证据并使用单一跨语言检索器生成目标语言的答案,无需翻译或语言特定模块。它通过迭代数据挖掘扩展训练数据,在 26 种语言上达到最先进的结果。

ABSTRACT

We present Cross-lingual Open-Retrieval Answer Generation (CORA), the first unified many-to-many question answering (QA) model that can answer questions across many languages, even for ones without language-specific annotated data or knowledge sources. We introduce a new dense passage retrieval algorithm that is trained to retrieve documents across languages for a question. Combined with a multilingual autoregressive generation model, CORA answers directly in the target language without any translation or in-language retrieval modules as used in prior work. We propose an iterative training method that automatically extends annotated data available only in high-resource languages to low-resource ones. Our results show that CORA substantially outperforms the previous state of the art on multilingual open QA benchmarks across 26 languages, 9 of which are unseen during training. Our analyses show the significance of cross-lingual retrieval and generation in many languages, particularly under low-resource settings.

研究动机与目标

  • 解决没有语言特定管道或翻译式错误传播的多语言开放问答。
  • 为从多语言段落中回答任意目标语言的问题,开发一个单一跨语言检索器和一个多语言生成器。
  • 通过迭代训练和维基百科语言链接,自动跨语言扩展训练数据。
  • 在多语种环境下进行评估,以展示跨语言检索与生成的优势,尤其在低资源场景。

提出的方法

  • 将 Dense Passage Retrieval 扩展为多语言设置(mDPR),使用 mBERT 编码段落与问题,并通过内积检索前若干段落。
  • 使用多语言序列到序列生成器(mGEN,如 mT5)在检索段落的条件下以目标语言生成答案。
  • 通过迭代数据挖掘训练数据,利用维基百科语言链接和模型预测扩展数据,而不需要额外人工注释或 MT。
  • 在生成时向问题附加语言标签以指示目标语言。
  • 避免仅翻译的数据增强;由生成器产生的合成答案用于训练。
  • 推理时,CORA 可以从任意语言检索并使用单一的 mDPR/mGEN 对在目标语言生成。

实验结果

研究问题

  • RQ1单一的跨语言检索器和生成器能否在没有语言特定管道的情况下实现多语言开放式问答?
  • RQ2跨语言检索对低资源语言的答案质量有何影响?
  • RQ3迭代数据挖掘在多语言扩展训练数据和提升跨语言问答性能方面能达到何种程度?
  • RQ4与翻译式或抽取式方法相比,多语言生成是否能提升答案质量?

主要发现

  • CORA 在 26 种语言上显著优于先前的多语言开放问答方法,在 Xor-TyDi QA 和 MKQA 基准上有显著提升。
  • 在 Xor-TyDi QA 中,CORA 相较于以前的 SOTA 最高提升达到 23.4 F1 点。
  • 在 MKQA 中,CORA 的提升最高达 4.7 F1 点,即使不使用 MKQA 数据进行训练。
  • CORA 受益于跨语言检索和生成,尤其在低资源设置以及训练中未见语言的场景。
  • 从非英语来源检索能回答部分在英语证据缺失时被视为不可回答的问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。