[论文解读] Making a MIRACL: Multilingual Information Retrieval Across a Continuum of Languages
本论文介绍了 MIRACL,这是一个多语言信息检索数据集,包含跨 18 种语言的 70 万余条人工标注的相关性判断,涵盖高资源语言和低资源语言。该数据集支持单语即席检索任务,并提供了基于 BM25、mDPR 和混合模型的基线方法,使研究人员能够跨多样化的语言谱系评估和开发多语言检索系统。
MIRACL (Multilingual Information Retrieval Across a Continuum of Languages) is a multilingual dataset we have built for the WSDM 2023 Cup challenge that focuses on ad hoc retrieval across 18 different languages, which collectively encompass over three billion native speakers around the world. These languages have diverse typologies, originate from many different language families, and are associated with varying amounts of available resources -- including what researchers typically characterize as high-resource as well as low-resource languages. Our dataset is designed to support the creation and evaluation of models for monolingual retrieval, where the queries and the corpora are in the same language. In total, we have gathered over 700k high-quality relevance judgments for around 77k queries over Wikipedia in these 18 languages, where all assessments have been performed by native speakers hired by our team. Our goal is to spur research that will improve retrieval across a continuum of languages, thus enhancing information access capabilities for diverse populations around the world, particularly those that have been traditionally underserved. This overview paper describes the dataset and baselines that we share with the community. The MIRACL website is live at http://miracl.ai/.
研究动机与目标
- 解决缺乏覆盖多样化语言家族和资源水平的高质量多语言检索数据集的问题。
- 支持在涵盖低资源语言和代表性不足语言的广泛语言连续体上开展单语即席检索研究。
- 提供一个标准化基准,包含人工标注的相关性判断,以提升多语言信息检索中模型评估与可复现性的可靠性。
- 通过 WSDM 2023 Cup 挑战赛促进社区参与,提供公开测试集和排行榜,实现竞争性评估。
- 通过提升非英语、低资源语言的检索系统性能,改善全球信息获取,弥补这些语言在 NLP 研究中长期被忽视的现状。
提出的方法
- 使用 18 种语言的维基百科段落和查询构建多语言数据集,覆盖 10 个语言家族和 11 种书写系统。
- 通过母语标注者收集超过 70 万条查询-段落相关性判断,确保高质量、语言特定的评估结果。
- 采用两阶段流程:首先使用神经模型集成(BM25 和 mDPR)生成候选段落,然后由母语标注者评估相关性。
- 对于在前 10 名候选段落中未找到相关段落的查询,将其标记为“无效”,以确保每个查询至少存在一个相关段落。
- 在 Pyserini 中实现三种基线模型:BM25、mDPR 和一种将 BM25 与 mDPR 分数以相等权重(α=0.5)结合的混合模型。
- 通过 MIRACL GitHub 仓库提供代码、文档和基线复现说明,以支持可复现研究。
实验结果
研究问题
- RQ1在涵盖 18 种高资源与低资源语言的多样化语言集合中,标准检索模型(如 BM25 和 mDPR)在单语检索任务中的有效性如何?
- RQ2结合稀疏表示(BM25)与稠密表示(mDPR)的混合检索模型在多种语言中性能提升的幅度有多大?
- RQ3母语者人工标注的相关性判断在多语言 IR 评估中是否能提升可靠性与公平性?
- RQ4在相关性未出现在前 10 名候选段落中的情况下,为低资源语言构建多语言 IR 数据集面临哪些挑战?
- RQ5社区驱动的挑战赛和共享基准(如 WSDM 2023 Cup)如何加速多语言信息检索领域的进展?
主要发现
- MIRACL 数据集包含超过 70 万条人工标注的相关性判断,覆盖 7.7 万个查询,涉及 18 种语言,评估由母语者完成。
- 该数据集涵盖 10 个语言家族和 11 种书写系统,包括高资源语言(如英语、中文)和低资源语言(如斯瓦希里语、泰卢固语、泰语)。
- BM25 基线在 18 种语言上的平均 nDCG@10 为 0.68,Recall@100 为 0.82,展现出强大的零样本性能。
- mDPR 基线在 18 种语言上的平均 nDCG@10 为 0.71,Recall@100 为 0.85,表明稠密检索在多语言场景中的有效性。
- 结合 BM25 与 mDPR 的混合模型在 18 种语言上的平均 nDCG@10 为 0.73,Recall@100 为 0.87,优于大多数语言中的单一模型。
- 数据集包含两种未提前公布的“意外”语言,旨在测试模型在低资源条件下的泛化能力与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。