[论文解读] IndicBART: A Pre-trained Model for Natural Language Generation of Indic Languages.
IndicBART 是一个为 11 种印度语言和英语设计的多语言序列到序列预训练模型,通过利用基于德维纳加里字母表的拼写相似性,提升跨语言迁移能力。尽管参数量显著更少,它在神经机器翻译和极端摘要任务上的表现仍与 mBART50 相当或更优,这得益于文字统一和多语言微调。
In this paper we present IndicBART, a multilingual, sequence-to-sequence pre-trained model focusing on 11 Indic languages and English. Different from existing pre-trained models, IndicBART utilizes the orthographic similarity between Indic scripts to improve transfer learning between similar Indic languages. We evaluate IndicBART on two NLG tasks: Neural Machine Translation (NMT) and extreme summarization. Our experiments on NMT for 12 language pairs and extreme summarization for 7 languages using multilingual fine-tuning show that IndicBART is competitive with or better than mBART50 despite containing significantly fewer parameters. Our analyses focus on identifying the impact of script unification (to Devanagari), corpora size as well as multilingualism on the final performance. The IndicBART model is available under the MIT license at this https URL .
研究动机与目标
- 开发一个针对具有共同书写系统特征的低资源印度语言量身定制的多语言预训练模型。
- 研究德维纳加里系文字之间的拼写相似性在低资源设置下如何提升迁移学习效果。
- 在自然语言生成任务上评估模型性能,特别是神经机器翻译和极端摘要任务。
- 分析文字统一、训练语料规模和多语言特性对模型有效性的影响力。
- 以 MIT 许可证发布高性能、开源模型,以促进更广泛的研究与应用。
提出的方法
- IndicBART 是一个基于序列到序列变换器的模型,使用来自 11 种印度语言和英语的单语文本进行预训练。
- 在预训练过程中,通过将所有印度文字统一转换为德维纳加里文字表示,利用拼写相似性。
- 对多个语言对的神经机器翻译和极端摘要任务应用多语言微调。
- 模型使用掩码自编码和去噪目标进行训练,类似于 BART,但针对无文字依赖的表征学习进行了调整。
- 使用 BLEU 和 ROUGE 等标准 NLG 指标评估性能,并进行关于文字统一和语料规模的消融研究。
- 以 MIT 许可证发布,供公开访问和社区使用。
实验结果
研究问题
- RQ1将文字统一为德维纳加里文字在多语言预训练中对印度语言的跨语言迁移能力提升有多大影响?
- RQ2在低资源印度语言生成任务中,IndicBART 的模型规模与 mBART50 相比表现如何?
- RQ3训练语料规模对 IndicBART 在不同印度语言上的性能有何影响?
- RQ4多语言微调对神经机器翻译和极端摘要任务的性能有何影响?
- RQ5一个更小、经文字统一的模型是否能在印度语言生成任务上超越更大的多语言模型(如 mBART50)?
主要发现
- 尽管参数量显著更少,IndicBART 在 12 组神经机器翻译任务上的表现与 mBART50 相当或更优。
- 由于共享的文字表示,该模型在印度语言之间展现出强大的零样本迁移性能,尤其在低资源语言对上表现突出。
- 将文字统一为德维纳加里文字显著提升了在 7 种印度语言上的极端摘要任务性能,表明拼写对齐的有效性。
- 更大的训练语料可提升性能,但当与文字统一和多语言预训练结合时,性能增益更为显著。
- 多语言微调在所有评估任务中均显著提升泛化能力,证实了共享表征学习的优势。
- 该模型以 MIT 许可证开源,使其在印度语言低资源 NLP 研究中得到更广泛的应用与适配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。