[论文解读] Mintaka: A Complex, Natural, and Multilingual Dataset for End-to-End Question Answering
Mintaka 是一个大规模、多语言且自然获取的问答数据集,包含九种语言的18万个样本,其中包含20,000个英文问题及其翻译,并用Wikidata实体进行标注。最佳基线模型在英文上的hits@1达到38%,多语言设置下为31%,表明在处理复杂多语言问答任务方面仍有巨大提升空间。
We introduce Mintaka, a complex, natural, and multilingual dataset designed for experimenting with end-to-end question-answering models. Mintaka is composed of 20,000 question-answer pairs collected in English, annotated with Wikidata entities, and translated into Arabic, French, German, Hindi, Italian, Japanese, Portuguese, and Spanish for a total of 180,000 samples. Mintaka includes 8 types of complex questions, including superlative, intersection, and multi-hop questions, which were naturally elicited from crowd workers. We run baselines over Mintaka, the best of which achieves 38% hits@1 in English and 31% hits@1 multilingually, showing that existing models have room for improvement. We release Mintaka at https://github.com/amazon-research/mintaka.
研究动机与目标
- 为解决复杂问答任务中缺乏大规模、自然获取且多语言的数据集的问题。
- 通过包含八类复杂问题(如多跳、比较和最高级查询)来创建一个反映现实世界复杂性的基准。
- 通过提供高质量的翻译和与Wikidata标注的问答对,支持多语言端到端问答研究。
- 实现对多种语言和复杂推理类型模型的评估,超越简单的事实查找任务。
- 发布一个公开可用的数据集,并提供标准化的训练/开发/测试划分,以促进多语言问答研究的可复现性。
提出的方法
- 从众包工作者处收集20,000个基于真实用户查询模式的自然复杂英文问题。
- 为每个问题和答案标注Wikidata实体ID,以链接到结构化知识图谱。
- 使用专业翻译人员将20,000个英文问题翻译成八种其他语言(阿拉伯语、法语、德语、印地语、意大利语、日语、葡萄牙语、西班牙语)。
- 构建一个包含180,000个样本的平衡数据集,确保语言和语义在不同语言间的一致性。
- 设计数据集以包含八种复杂性类型:最高级、交集、多跳、比较、聚合、时间、数值和否定问题。
- 在 https://github.com/amazon-research/mintaka 上发布数据集,并提供预定义的训练集(14,000)、开发集(2,000)和测试集(4,000)划分。
实验结果
研究问题
- RQ1现有的端到端问答模型能否泛化到需要超越单条事实查找的复杂多语言问题?
- RQ2在多语言问答设置中,模型从英语迁移到其他语言时性能会如何下降?
- RQ3在没有外部知识源的情况下,语言模型在处理比较、计数或排序等复杂操作时的处理能力如何?
- RQ4在面对复杂自然语言问题时,基于知识图谱的模型在结构化数据推理方面的有效性如何?
- RQ5当前模型在处理多跳推理或数值运算等复杂推理任务时的主要失败模式是什么?
主要发现
- 表现最佳的基线模型(微调后的T5用于闭卷问答)在英文测试集上达到38%的hits@1,表明仍有巨大改进空间。
- 多语言性能略有下降,最佳模型在全部九种语言上的hits@1为31%,显示出不同语言间的性能差距。
- 基于DPR的检索模型在多语言设置下达到31%的hits@1,但在检索段落中未明确包含推理步骤时表现不佳。
- 基于知识图谱的模型(如Rigel)仅达到20%的hits@1,主要受限于处理排序或过滤等复杂操作的能力,尽管实体路径遍历正确。
- 仅使用语言模型的模型常生成看似合理但错误的答案(例如,将第二部MCU电影错误预测为'Thor: The Dark World'而非'Iron Man'),显示出推理失败。
- 英语与其他语言之间的性能差距部分源于多语言模型的局限性(如MT5与T5对比)以及多语言编码器的低效性(如XLM-RoBERTa与RoBERTa对比)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。