Skip to main content
QUICK REVIEW

[论文解读] IndicXNLI: Evaluating Multilingual Inference for Indian Languages

Divyanshu Aggarwal, Vivek Gupta|arXiv (Cornell University)|Apr 19, 2022
Natural Language Processing Techniques被引用 5
一句话总结

本文提出了 IndicXNLI,一个针对11种主要印度语言的多语言自然语言推理(NLI)基准,通过使用开源的 IndicTrans 模型对英文 XNLI 数据集进行高质量机器翻译构建而成。该研究评估了跨语言迁移、多语言微调以及在不同印度语言中的零样本性能,揭示了低资源环境下模型行为与语言泛化能力的关键见解。

ABSTRACT

While Indic NLP has made rapid advances recently in terms of the availability of corpora and pre-trained models, benchmark datasets on standard NLU tasks are limited. To this end, we introduce IndicXNLI, an NLI dataset for 11 Indic languages. It has been created by high-quality machine translation of the original English XNLI dataset and our analysis attests to the quality of IndicXNLI. By finetuning different pre-trained LMs on this IndicXNLI, we analyze various cross-lingual transfer techniques with respect to the impact of the choice of language models, languages, multi-linguality, mix-language input, etc. These experiments provide us with useful insights into the behaviour of pre-trained models for a diverse set of languages.

研究动机与目标

  • 解决印度语言在低资源环境下高质量 NLI 基准数据集稀缺的问题。
  • 为不同印度语系(印度-雅利安语系与德拉维达语系)的多语言模型提供标准化评估框架。
  • 研究多语言模型(如 mBERT、XLM-RoBERTa 及印度语专用模型,例如 IndicBERT、MuRIL)在未见印度语言上的跨语言迁移性能。
  • 评估英语数据增强、多语言预训练以及混合语言输入对印度语言 NLI 性能的影响。
  • 将 IndicXNLI 集成至 IndicGLUE 基准,以支持印度语言更广泛的 NLP 研究。

提出的方法

  • 通过使用 IndicTrans 模型将英文 XNLI 数据集(训练集:392,702;开发集:2,490;测试集:5,010)翻译成11种印度语言,构建了 IndicXNLI。
  • 采用 IndicTrans,一种基于 Transformer 的先进开源序列到序列模型,其在 Samanantar 平行语料库上进行了训练。
  • 通过人工标注(每种语言2名标注员)和 BERTScore 验证翻译质量,实现了高一致性(皮尔逊相关系数 r > 0.73,斯皮尔曼等级相关系数 r > 0.75)。
  • 使用多种训练策略(包括零样本和少样本设置)在 IndicXNLI 上微调多语言模型(mBERT、XLM-RoBERTa、IndicBERT、MuRIL)。
  • 评估了印度语言之间的跨语言迁移性能,并测试了混合语言(代码混合)输入下的表现。
  • 对比不同模型与训练方式的性能,分析语言覆盖范围、多语言预训练以及数据增强的影响。

实验结果

研究问题

  • RQ1从英语到低资源印度语言(如阿萨姆语和奥里亚语)在 NLI 任务中的跨语言迁移效果如何?
  • RQ2印度语专用模型(如 IndicBERT、MuRIL)与通用多语言模型(如 mBERT、XLM-RoBERTa)在印度语言 NLI 中的表现有何差异?
  • RQ3多语言预训练与英语数据增强对印度语言中零样本和少样本 NLI 性能有何影响?
  • RQ4多语言模型在前提与假设来自不同印度语言的跨语言 NLI 任务中泛化能力如何?
  • RQ5混合语言输入(如英语-印度语混合)在 NLI 任务中对模型性能的影响有多大?

主要发现

  • IndicXNLI 展现出高度的语言与语义保真度,多数语言的人工标注标签一致性分数超过 0.85,证实了翻译质量。
  • 印度语专用模型(如 MuRIL 和 IndicBERT)在低资源印度语言的零样本评估中优于通用多语言模型(如 mBERT、XLM-RoBERTa)。
  • 在关系密切的印度-雅利安语系语言(如印地语、马拉地语、旁遮普语)之间,跨语言迁移性能显著高于不同语系之间(如德拉维达语系与印度-雅利安语系)。
  • 在未见印度语言上,通过英语 XNLI 进行微调可显著提升零样本性能,尤其在结合多语言预训练时效果更佳。
  • 与单一语言输入相比,混合语言输入(如英语-印度语混合)会降低模型性能,表明需要具备代码混合感知能力的训练。
  • 该数据集可实现可靠的跨语言 NLI 评估,各类模型表现出一致的性能趋势,验证了其作为基准的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。