[论文解读] Cross-Lingual Open-Domain Question Answering with Answer Sentence Generation
本文提出 CrossGenQA,一种跨语言生成式问答系统,即使问题使用不同语言,也能利用多语言段落候选生成完整句子的答案。该研究构建了 Gen-TyDiQA,一个包含阿拉伯语、孟加拉语、英语、日语和俄语的多语言数据集,提供流畅且完整的答案,并证明 CrossGenQA 在五种语言中的三种(尤其是需要跨语言信息的问答)上优于答案句子选择基线模型和单语处理流程。
Open-Domain Generative Question Answering has achieved impressive performance in English by combining document-level retrieval with answer generation. These approaches, which we refer to as GenQA, can generate complete sentences, effectively answering both factoid and non-factoid questions. In this paper, we extend GenQA to the multilingual and cross-lingual settings. For this purpose, we first introduce GenTyDiQA, an extension of the TyDiQA dataset with well-formed and complete answers for Arabic, Bengali, English, Japanese, and Russian. Based on GenTyDiQA, we design a cross-lingual generative model that produces full-sentence answers by exploiting passages written in multiple languages, including languages different from the question. Our cross-lingual generative system outperforms answer sentence selection baselines for all 5 languages and monolingual generative pipelines for three out of five languages studied.
研究动机与目标
- 解决缺乏高质量、多语言、生成式问答数据集的问题,尤其在非英语语言中缺少完整、流畅的答案。
- 将生成式问答(GenQA)扩展至跨语言设置,使模型能够利用多种语言的信息来回答问题。
- 通过生成完整句子答案而非抽取词片段,提升答案的流畅性和可理解性。
- 评估跨语言检索与生成在多语言问答中的有效性,特别是针对文化特定或非英语中心的问题。
- 通过使用人工生成的参考答案建立可靠的评估协议,以提高标注一致性。
提出的方法
- 扩展 TyDiQA 数据集,构建 Gen-TyDiQA,一个包含阿拉伯语、孟加拉语、英语、日语和俄语的人工标注、流畅且自包含的答案的多语言问答数据集。
- 设计三阶段流程:文档检索、答案句子选择(AS2)和使用跨语言模型生成答案。
- 训练一个跨语言生成模型(CrossGenQA),从多种语言的候选句子中生成完整句子答案,包括与问题语言不同的语言。
- 在评估中使用参考答案,显著提升标注者间一致性,Fleiss’ Kappa 从 0.1387 提升至 0.5071。
- 采用标准的 BM25 检索器和多语言编码器进行跨语言句子编码,实现跨语言边界的检索与生成。
- 使用精确匹配和 F1 分数评估性能,对比 CrossGenQA 与单语 GenQA 及 AS2 基线在五种语言中的表现。
实验结果
研究问题
- RQ1跨语言生成式问答系统是否能在多语言开放域问答中优于答案句子选择基线模型?
- RQ2使用多语言段落候选是否能提升答案生成性能,尤其是在答案不存在于问题语言中的情况下?
- RQ3使用人工生成的参考答案在评估生成式问答系统时,如何影响标注一致性?
- RQ4为何 CrossGenQA 在英语问题上的表现低于单语 GenQA?这一现象在文化上非英语中心的问题中是否依然成立?
- RQ5生成式问答系统的性能在多大程度上受限于检索器和答案句子选择组件的质量?
主要发现
- CrossGenQA 在全部五种语言(阿拉伯语、孟加拉语、英语、日语、俄语)上均优于答案句子选择(AS2)基线模型,证明了生成方法相较于抽取方法的优势。
- CrossGenQA 在阿拉伯语、俄语和日语上优于单语 GenQA 流程,表明跨语言信息整合能提升性能。
- 使用人工生成的参考答案使标注者间一致性从 Fleiss’ Kappa 0.1387 提升至 0.5071,显著提高了标注可靠性。
- 单语 GenQA 在阿拉伯语、孟加拉语、英语和俄语上优于抽取式 QA 系统,证实了完整句子生成的优势。
- CrossGenQA 在英语问题上的表现低于单语 GenQA,可能是因为问题具有文化特定性,使用英语来源能更好回答。
- 在测试文化特定的日本语问题时,CrossGenQA 表现优于单语 GenQA,表明当答案非英语中心时,跨语言生成是有效的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。