Skip to main content
QUICK REVIEW

[论文解读] RUBERT: A Bilingual Roman Urdu BERT Using Cross Lingual Transfer Learning

Usama Khalid, Mirza Omer Beg|arXiv (Cornell University)|Feb 22, 2021
Natural Language Processing Techniques参考文献 52被引用 7
一句话总结

该论文提出 RUBERT,一种通过在新型 5400 万词的罗马乌尔都语推文语料上进行额外预训练而构建的双语罗马乌尔都语 BERT 模型,利用来自英语 BERT 的跨语言迁移。RUBERT 在单语和多语言基线模型中表现最佳,实现最高的掩码语言建模(MLM)准确率(0.23)和下一句预测(NSP)准确率(0.95),表明从强大的单语基础模型进行双语微调,相较于多语言预训练,对低资源语言(如罗马乌尔都语)更具优势。

ABSTRACT

In recent studies, it has been shown that Multilingual language models underperform their monolingual counterparts. It is also a well-known fact that training and maintaining monolingual models for each language is a costly and time-consuming process. Roman Urdu is a resource-starved language used popularly on social media platforms and chat apps. In this research, we propose a novel dataset of scraped tweets containing 54M tokens and 3M sentences. Additionally, we also propose RUBERT a bilingual Roman Urdu model created by additional pretraining of English BERT. We compare its performance with a monolingual Roman Urdu BERT trained from scratch and a multilingual Roman Urdu BERT created by additional pretraining of Multilingual BERT. We show through our experiments that additional pretraining of the English BERT produces the most notable performance improvement.

研究动机与目标

  • 通过从抓取的推文中构建包含 300 万句子和 5400 万个词的新语料,解决大规模公开可用的罗马乌尔都语 NLP 资源稀缺的问题。
  • 通过利用跨语言迁移学习,提升罗马乌尔都语的语言建模性能,该语言是南亚社交媒体中广泛使用的低资源语言。
  • 探究在单语英语 BERT 模型上进行额外预训练,是否能比从零开始训练或在多语言模型上进行额外预训练,为罗马乌尔都语带来更好的性能。
  • 证明双语语言建模——即使用预训练的单语模型在新语言上进行训练——在低资源语言上的表现可优于多语言预训练。

提出的方法

  • 作者从公开的 Twitter 数据中收集并整理了一个大规模的罗马乌尔都语数据集,包含 3,040,153 个句子和 54,622,490 个词,构建了一个用于低资源语言建模的新语料库。
  • 他们对预训练的英语 BERT base 模型在罗马乌尔都语语料上进行了额外预训练,保留了原始英语 BERT 的架构和初始嵌入,同时调整了词汇表并针对新语言进行训练。
  • 比较了三种不同的预训练方法:(1) 从零开始训练单语罗马乌尔都语 BERT,(2) 在多语言 BERT (mBERT) 上进行额外预训练,(3) 在单语英语 BERT 上进行额外预训练(即 RUBERT)。
  • 使用原始 BERT 预训练中采用的相同掩码语言建模(MLM)和下一句预测(NSP)任务对模型进行评估,并使用独立的验证集来衡量性能。
  • 该方法通过利用英语和罗马乌尔都语之间共享的拉丁字母脚本和代码切换模式,实现跨语言迁移,从而促进更好的上下文表征学习。
  • 所有模型的超参数保持一致(10,000 个训练步骤,初始起始学习率为 2e-5),但单语模型使用了更高的 1e-4 学习率以稳定从零开始的训练。

实验结果

研究问题

  • RQ1在单语英语 BERT 模型上进行额外预训练是否能为罗马乌尔都语带来比从零开始训练或在多语言模型上进行额外预训练更好的性能?
  • RQ2尽管语言结构存在差异,但基于共享的拉丁字母脚本和词汇重叠,从英语 BERT 到罗马乌尔都语的跨语言迁移是否依然有效?
  • RQ3双语罗马乌尔都语-英语模型在下游预训练任务上的表现与单语和多语言基线相比如何?
  • RQ4当在多语言模型上对低资源语言(如罗马乌尔都语)进行预训练时,'多语言性诅咒'在多大程度上影响了性能?

主要发现

  • 通过在单语英语 BERT 上进行额外预训练构建的 RUBERT 模型,实现了最高的掩码语言建模(MLM)准确率(0.23),显著优于单语基线(0.02)和多语言基线(0.11)。
  • RUBERT 同样实现了最高的下一句预测(NSP)准确率(0.95),表明其在句子级理解方面优于单语模型(0.53)和多语言模型(0.91)。
  • 从零开始训练的单语罗马乌尔都语 BERT 表现欠佳,MLM 准确率仅为 0.02,凸显了从零开始为低资源语言训练有效语言模型的困难。
  • 在罗马乌尔都语上微调的多语言 BERT 表现中等(MLM 准确率为 0.11),但仍显著落后于双语 RUBERT,表明多语言模型在低资源语言上存在容量稀释问题。
  • 结果证实,通过高资源语言(英语)进行跨语言迁移的双语预训练,比多语言预训练更适用于低资源语言(如罗马乌尔都语)。
  • 本研究证明,源语言与目标语言之间共享的脚本和词汇重叠(如代码切换)是低资源环境下成功实现跨语言迁移的关键因素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。