Skip to main content
QUICK REVIEW

[论文解读] L3Cube-IndicSBERT: A simple approach for learning cross-lingual sentence representations using multilingual BERT

Samruddhi Deode, Janhavi Gadre|arXiv (Cornell University)|Apr 22, 2023
Natural Language Processing Techniques被引用 5
一句话总结

该论文提出 L3Cube-IndicSBERT,一种针对 10 种印度语言的多语言句子嵌入模型,通过使用从翻译后的 NLI 和 STS 数据集生成的合成单语平行数据对通用多语言 BERT 进行微调。该方法在跨语言和单语言语义相似性任务上实现了最先进性能,优于 LaBSE 和 paraphrase-multilingual-mpnet-base-v2 等模型。

ABSTRACT

The multilingual Sentence-BERT (SBERT) models map different languages to common representation space and are useful for cross-language similarity and mining tasks. We propose a simple yet effective approach to convert vanilla multilingual BERT models into multilingual sentence BERT models using synthetic corpus. We simply aggregate translated NLI or STS datasets of the low-resource target languages together and perform SBERT-like fine-tuning of the vanilla multilingual BERT model. We show that multilingual BERT models are inherent cross-lingual learners and this simple baseline fine-tuning approach without explicit cross-lingual training yields exceptional cross-lingual properties. We show the efficacy of our approach on 10 major Indic languages and also show the applicability of our approach to non-Indic languages German and French. Using this approach, we further present L3Cube-IndicSBERT, the first multilingual sentence representation model specifically for Indian languages Hindi, Marathi, Kannada, Telugu, Malayalam, Tamil, Gujarati, Odia, Bengali, and Punjabi. The IndicSBERT exhibits strong cross-lingual capabilities and performs significantly better than alternatives like LaBSE, LASER, and paraphrase-multilingual-mpnet-base-v2 on Indic cross-lingual and monolingual sentence similarity tasks. We also release monolingual SBERT models for each of the languages and show that IndicSBERT performs competitively with its monolingual counterparts. These models have been evaluated using embedding similarity scores and classification accuracy.

研究动机与目标

  • 解决低资源印度地区语言缺乏高质量多语言句子嵌入模型的问题。
  • 开发一种稳健且可扩展的方法,以在不依赖平行单语语料库或复杂训练方案的情况下提升跨语言迁移能力。
  • 证明在合成翻译单语 STS 和 NLI 数据上进行简单微调,可显著增强通用多语言 BERT 的跨语言能力。
  • 发布针对 10 种主要印度语言的多语言和单语言 SBERT 模型,以支持低资源环境下的自然语言处理研究与应用。

提出的方法

  • 使用由 10 种印度语言的翻译 NLI 和 STS 数据集组成的混合合成语料,对预训练的多语言 BERT(MuRIL)进行微调。
  • 采用 SBERT 中典型的孪生网络架构,以学习针对语义文本相似性的句子嵌入。
  • 在微调过程中使用对比损失函数,以促使语义相似的句子对在共享向量空间中具有更接近的嵌入。
  • 将多个目标语言的翻译单语数据聚合到一个统一的混合训练集中,以实现联合跨语言学习。
  • 通过应用最小程度、任务特定的微调,利用多语言 BERT 的内在跨语言能力,而无需显式的跨语言预训练。
  • 训练多语言和单语言 SBERT 变体,其中多语言模型作为所有 10 种印度语言和英语的统一编码器。

实验结果

研究问题

  • RQ1在合成单语翻译数据上进行简单微调,是否能显著提升通用多语言 BERT 的跨语言性能?
  • RQ2所得到的多语言 SBERT 模型(L3Cube-IndicSBERT)在跨语言语义相似性任务上与现有最先进模型(如 LaBSE 和 paraphrase-multilingual-mpnet-base-v2)相比表现如何?
  • RQ3该微调方法在真实世界下游 NLP 任务(如文本分类)中的泛化能力如何?
  • RQ4相同的微调方法能否生成性能优于对应通用 BERT 的竞争性单语言 SBERT 模型?
  • RQ5当该方法应用于非德拉维蒂语言(如德语和法语)时,是否仍保持有效性,表明其在印度语言之外也具有广泛适用性?

主要发现

  • L3Cube-IndicSBERT 在 10 种印度语言的跨语言语义文本相似性(STS)任务上实现了最先进性能,平均优于 LaBSE 和 paraphrase-multilingual-mpnet-base-v2。
  • 多语言模型在跨语言 STS 任务上的平均 STS 得分为 0.71,其中印地语(0.82)和孟加拉语(0.82)表现尤为突出。
  • 每种印度语言的单语言 SBERT 变体在单语言 STS 基准测试中的嵌入相似性表现优于其对应的通用 BERT 模型。
  • 在真实世界文本分类数据集上,微调后的模型泛化能力良好,展现出强大的零样本迁移能力至未见过但相关的任务。
  • 即使在低资源语言如奥里亚语和马拉雅拉姆语上,该模型也表现出高精度,STS 得分分别为 0.70 和 0.74,表明其具备强大鲁棒性。
  • 该方法可迁移至非德拉维蒂语言:德语和法语也取得了具有竞争力的结果,验证了该方法在印度语言之外的通用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。