[论文解读] mMARCO: A Multilingual Version of the MS MARCO Passage Ranking Dataset
本文介绍了 mMARCO,即通过机器翻译将 MS MARCO 文档排序数据集多语言化后的版本,覆盖13种语言。作者证明,在 mMARCO 上微调多语言模型可提升在 Mr. TyDi 上的零样本性能,且翻译质量与检索效果正相关,验证了高质量翻译在多语言信息检索中的有效性。
The MS MARCO ranking dataset has been widely used for training deep learning models for IR tasks, achieving considerable effectiveness on diverse zero-shot scenarios. However, this type of resource is scarce in languages other than English. In this work, we present mMARCO, a multilingual version of the MS MARCO passage ranking dataset comprising 13 languages that was created using machine translation. We evaluated mMARCO by finetuning monolingual and multilingual reranking models, as well as a multilingual dense retrieval model on this dataset. We also evaluated models finetuned using the mMARCO dataset in a zero-shot scenario on Mr. TyDi dataset, demonstrating that multilingual models finetuned on our translated dataset achieve superior effectiveness to models finetuned on the original English version alone. Our experiments also show that a distilled multilingual reranker is competitive with non-distilled models while having 5.4 times fewer parameters. Lastly, we show a positive correlation between translation quality and retrieval effectiveness, providing evidence that improvements in translation methods might lead to improvements in multilingual information retrieval. The translated datasets and finetuned models are available at https://github.com/unicamp-dl/mMARCO.
研究动机与目标
- 解决除英语外神经信息检索模型在训练和评估数据上的稀缺性问题。
- 通过机器翻译将原始 MS MARCO 数据集翻译成13种语言,创建高质量的多语言文档排序数据集。
- 评估在翻译后的数据集上微调的单语和多语言模型在零样本和域内设置下的有效性。
- 研究翻译质量对下游检索性能的影响,以验证翻译数据的可靠性。
- 通过公开发布 mMARCO 数据集和微调后的模型,为多语言信息检索提供基准。
提出的方法
- 使用神经机器翻译模型将 MS MARCO 的训练集和测试集翻译成13种语言(如葡萄牙语、西班牙语、德语、中文、俄语)。
- 采用 Helsinki-NLP 翻译模型进行翻译,并使用 Tatoeba 数据集上的 BLEU 分数评估翻译质量。
- 在翻译后的 mMARCO 数据集上微调基于 Transformer 的单语和多语言模型(如 mMiniLM、mT5、mBERT),用于密集检索和重排序任务。
- 在 Mr. TyDi 基准测试中以零样本跨语言设置评估微调模型的性能,以评估其迁移能力。
- 训练一个蒸馏后的多语言重排序模型(mMiniLM),以与更大模型在效率和性能上进行比较。
- 分析翻译质量(BLEU)与检索效果(MRR@10)在不同语言间的相关性。
实验结果
研究问题
- RQ1机器翻译的 MS MARCO 数据在多大程度上能有效支持多语言信息检索模型的微调?
- RQ2与单语微调相比,在 mMARCO 上微调多语言模型是否能提升在未见语言上的零样本性能?
- RQ3翻译质量(以 BLEU 衡量)与多语言信息检索中的检索效果之间是否存在相关性?
- RQ4在 mMARCO 上微调后,蒸馏后的多语言模型是否能实现与大模型相当的性能?
- RQ5与单语微调相比,mMARCO 上的多语言微调是否能带来更好的性能,尤其是在低资源语言上?
主要发现
- 在 mMARCO 上微调的多语言模型在 Mr. TyDi 基准测试的零样本评估中,表现优于仅在原始英文 MS MARCO 数据集上微调的模型。
- 在包含英文和葡萄牙语的多语言 mMARCO 上微调的 mT5 模型,在葡萄牙语 MS MARCO 子集上取得了 MRR@10 为 0.728 的成绩,优于单语模型。
- 蒸馏后的 mMiniLM 重排序模型在参数量仅为非蒸馏版本的 1/5.4 的情况下,实现了具有竞争力的性能。
- 翻译质量(BLEU)与检索效果(MRR@10)之间存在弱但正向的相关性(R² ≈ 0.33),表明更高质量的翻译能带来更好的信息检索结果。
- 对于非拉丁字母脚本(如中文、俄语),商业翻译模型的表现优于开源模型,表明语言特定的翻译质量会影响信息检索性能。
- 在 mMARCO 上进行多语言微调后,模型在英文和葡萄牙语上的表现几乎与单语微调模型相当,证明了翻译数据的稳健性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。