[论文解读] L3Cube-HindBERT and DevBERT: Pre-Trained BERT Transformer models for Devanagari based Hindi and Marathi Languages
本论文提出了 L3Cube-HindBERT 和 DevBERT,这两个是分别在大规模天城文文本语料上预训练的单语 BERT 模型,分别针对印地语和马拉地语。分别在 18 亿和 25 亿个词符上进行训练后,这些模型在印地语和马拉地语的文本分类与命名实体识别任务上优于多语言模型(如 MuRIL、XLM-R 和 IndicBERT),表明当拥有足够单语数据时,单语预训练可获得更优性能。
The monolingual Hindi BERT models currently available on the model hub do not perform better than the multi-lingual models on downstream tasks. We present L3Cube-HindBERT, a Hindi BERT model pre-trained on Hindi monolingual corpus. Further, since Indic languages, Hindi and Marathi share the Devanagari script, we train a single model for both languages. We release DevBERT, a Devanagari BERT model trained on both Marathi and Hindi monolingual datasets. We evaluate these models on downstream Hindi and Marathi text classification and named entity recognition tasks. The HindBERT and DevBERT-based models show significant improvements over multi-lingual MuRIL, IndicBERT, and XLM-R. Based on these observations we also release monolingual BERT models for other Indic languages Kannada, Telugu, Malayalam, Tamil, Gujarati, Assamese, Odia, Bengali, and Punjabi. These models are shared at https://huggingface.co/l3cube-pune .
研究动机与目标
- 解决现有单语印地语 BERT 模型在下游 NLP 任务中性能低于多语言模型的问题。
- 利用印地语和马拉地语共用天城文脚本的特性,训练一个统一的 BERT 模型(DevBERT)以支持两种语言。
- 通过提供高质量的单语预训练模型,提升低资源印度语言 NLP 任务的性能。
- 通过发布另外九种印度语言(包括卡纳达语、泰卢固语和泰米尔语)的单语 BERT 模型,扩展该方法的应用范围。
- 通过 Hugging Face 模型中心公开发布,为从事印度语言 NLP 的研究人员和实践者提供一个公共、可访问的资源。
提出的方法
- 使用 BERT 架构和掩码语言建模方法,在 18 亿词符的单语印地语文本上预训练 L3Cube-HindBERT。
- 在合并的印地语和马拉地语单语文本(共 25 亿词符)上预训练 DevBERT,充分利用其共用的天城文脚本和语言相似性。
- 使用标准 NLP 基准数据集,在下游分类和命名实体识别任务上对模型进行微调。
- 通过 Hugging Face 发布模型,确保架构和分词器设计一致,以提升互操作性和使用便捷性。
- 使用自定义分词器和大规模单语语料,从头开始训练另外九种印度语言的单语 BERT 模型。
- 在标准数据集上,将性能与多语言模型(MuRIL、XLM-R、IndicBERT)以及现有单语模型(MahaBERT)进行对比评估。
实验结果
研究问题
- RQ1在大规模印地语语料上预训练的单语印地语 BERT 模型,是否能在印地语 NLP 任务中超越现有的多语言模型?
- RQ2鉴于印地语和马拉地语共用天城文脚本,是否可以通过在两种语言数据上联合训练一个 BERT 模型(DevBERT)来实现对两种语言的竞争力性能?
- RQ3L3Cube-HindBERT 和 DevBERT 在印地语和马拉地语下游任务中的表现,与 SOTA 多语言模型(如 MuRIL、XLM-R 和 IndicBERT)相比如何?
- RQ4能否有效训练并发布其他低资源印度语言(如卡纳达语、泰卢固语、马拉雅拉姆语)的单语 BERT 模型,以提升 NLP 性能?
- RQ5当拥有充足的单语数据时,对单个语言微调单语模型是否比使用多语言模型获得更好的结果?
主要发现
- L3Cube-HindBERT 在 IITP 印地语电影评论分类数据集上达到 69.00% 的准确率,优于 MuRIL(66.00%)、XLM-R(67.00%)和 IndicBERT(65.00%)。
- DevBERT 在 L3Cube-MahaNER 马拉地语命名实体识别数据集上达到 88.31% 的宏平均 F1 分数,超过 MahaBERT(88.00%)和其他多语言模型。
- 在印地语 WikiAnn 命名实体识别任务中,DevBERT 达到 85.00% 的宏平均 F1 分数,优于 MuRIL(84.90%)、XLM-R(83.04%)和 IndicBERT(82.65%)。
- 在印地语文本分类任务中,L3Cube-HindBERT 相较于表现最佳的多语言模型(XLM-R)实现了 2.00 个百分点的准确率提升。
- DevBERT 在 L3Cube-MahaSent 马拉地语情感分类任务中达到 85.00% 的准确率,优于 MuRIL(84.30%)和 XLM-R(82.00%)。
- 作者发布了另外九种印度语言(卡纳达语、泰卢固语、马拉雅拉姆语、泰米尔语、古吉拉特语、阿萨姆语、奥里亚语、孟加拉语、旁遮普语)的单语 BERT 模型,所有模型均已通过 Hugging Face 向公众开放。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。