Skip to main content
QUICK REVIEW

[论文解读] XOR QA: Cross-lingual Open-Retrieval Question Answering

Akari Asai, Jungo Kasai|arXiv (Cornell University)|Oct 22, 2020
Topic Modeling参考文献 45被引用 5
一句话总结

本文提出了 Xor QA,一个跨语言开放检索问答基准,支持使用多语言维基百科文档回答非英文问题。该框架基于来自 7 种语言类型差异显著的语言的 40,000 个母语问题构建,包含三项任务——XOR-Retrieve、Xor-EnglishSpan 和 Xor-Full——用于评估跨语言检索与答案生成。最佳基线在 Xor-Full 任务上达到 18.7 的 F1 分数,凸显了该任务的挑战性以及其在推动多语言问答系统发展方面的潜力。

ABSTRACT

Multilingual question answering tasks typically assume answers exist in the same language as the question. Yet in practice, many languages face both information scarcity -- where languages have few reference articles -- and information asymmetry -- where questions reference concepts from other cultures. This work extends open-retrieval question answering to a cross-lingual setting enabling questions from one language to be answered via answer content from another language. We construct a large-scale dataset built on questions from TyDi QA lacking same-language answers. Our task formulation, called Cross-lingual Open Retrieval Question Answering (XOR QA), includes 40k information-seeking questions from across 7 diverse non-English languages. Based on this dataset, we introduce three new tasks that involve cross-lingual document retrieval using multi-lingual and English resources. We establish baselines with state-of-the-art machine translation systems and cross-lingual pretrained models. Experimental results suggest that XOR QA is a challenging task that will facilitate the development of novel techniques for multilingual question answering. Our data and code are available at https://nlp.cs.washington.edu/xorqa.

研究动机与目标

  • 通过允许从与问题不同语言的文档中检索答案,解决多语言问答中的信息匮乏与文化偏见问题。
  • 创建一个大规模、以母语者为导向的数据集,反映超越以英语为中心偏见的真实世界多语言信息需求。
  • 建立一个新基准——Xor-TyDi QA——涵盖 7 种语言的 40,000 个问题,包含跨语言检索与答案生成任务。
  • 利用多语言维基百科作为文档源,实现对跨语言检索与答案生成的系统性评估。
  • 提供基线模型与“模型在环”标注框架,以减少错误并提升多语言问答数据的质量。

提出的方法

  • 该数据集通过继承 TyDi QA 中的无法回答问题,并将其专业翻译为英文,形成查询目标。
  • 采用“模型在环”标注框架,为翻译后的查询查找相关英文维基百科段落,最大限度减少人为错误。
  • 标注人员在检索到的英文文档中识别答案片段,并在翻译回原始目标语言前进行验证。
  • 该框架支持三项任务:XOR-Retrieve(跨语言文档检索)、Xor-EnglishSpan(最小答案片段提取)和 Xor-Full(目标语言端到端答案生成)。
  • 基线模型通过使用跨语言编码器,并从英文和目标语言维基百科中检索,将最先进的开放检索问答模型(如 DPR)适配至多语言设置。
  • 实施了广泛的质控与验证步骤,以最大限度减少错误或偏见答案,特别是针对敏感或文化特定内容。

实验结果

研究问题

  • RQ1系统能否有效从英文维基百科中检索到与低资源非英文语言问题相关的文档?
  • RQ2当问题使用不同语言时,模型在英文文档中识别最小答案片段的能力如何?
  • RQ3通过查阅英文和目标语言维基百科资源,端到端模型在目标语言中生成准确答案的能力有多大?
  • RQ4现有问答基准中的文化与语言偏见如何影响模型泛化能力?Xor QA 是否能缓解这一问题?
  • RQ5跨语言检索与答案生成中的关键失败模式是什么?如何通过分阶段任务进行诊断?

主要发现

  • Xor-TyDi QA 数据集包含来自七种语言类型差异显著的语言的 40,000 个信息查询类问题,答案来自多语言维基百科源。
  • 最佳基线模型在 Xor-Full 任务上达到 18.7 的 F1 分数,表明在端到端跨语言答案生成方面仍存在重大挑战。
  • “模型在环”标注框架相比传统纯人工标注,有效减少了标注错误并提升了数据质量。
  • Xor QA 引入了一种新颖的设置,要求系统在事前决定答案所在语言,比以往的跨语言基准更真实地模拟多语言检索场景。
  • 该数据集通过优先采用母语问题与文化多样性主题,解决了多语言问答中长期存在的偏见问题,减少了以英语为中心的偏见。
  • Xor QA 在规模、语言多样性与现实适用性方面优于以往基准(如 QA@CLEF),尤其得益于其大规模训练数据与开放检索设置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。