[论文解读] L3Cube-MahaCorpus and MahaBERT: Marathi Monolingual Corpus, Marathi BERT Language Models, and Resources
本文介绍了 L3Cube-MahaCorpus,这是一个从多样化互联网来源收集的 2480 万句、2.89 亿词的马拉地语单语语料库,并提出了 MahaBERT、MahaAlBERT、MahaRoBERTa 和 MahaGPT——基于多语言 BERT 的语言模型以及一个生成式 GPT 模型,所有模型均在完整的 7.52 亿词马拉地语语料库上进行预训练。这些模型在马拉地语下游任务中取得了最先进性能,在文本分类和命名实体识别任务中优于多语言基线模型。
We present L3Cube-MahaCorpus a Marathi monolingual data set scraped from different internet sources. We expand the existing Marathi monolingual corpus with 24.8M sentences and 289M tokens. We further present, MahaBERT, MahaAlBERT, and MahaRoBerta all BERT-based masked language models, and MahaFT, the fast text word embeddings both trained on full Marathi corpus with 752M tokens. We show the effectiveness of these resources on downstream Marathi sentiment analysis, text classification, and named entity recognition (NER) tasks. We also release MahaGPT, a generative Marathi GPT model trained on Marathi corpus. Marathi is a popular language in India but still lacks these resources. This work is a step forward in building open resources for the Marathi language. The data and models are available at https://github.com/l3cube-pune/MarathiNLP .
研究动机与目标
- 通过从非新闻类互联网来源扩展现有数据集,新增 2480 万句和 2.89 亿词,以应对大规模、多样化马拉地语单语语料库稀缺的问题。
- 开发高性能的单语 BERT 基础语言模型(MahaBERT、MahaAlBERT、MahaRoBERTa)以及一个生成式 MahaGPT 模型,用于马拉地语自然语言处理。
- 在完整马拉地语语料库上训练并发布 MahaFT,一个 fastText 词嵌入模型,用于下游自然语言处理任务。
- 评估这些资源在马拉地语特定自然语言处理任务中的有效性,包括文本分类、情感分析和命名实体识别(NER)。
- 提供开源、高质量的马拉地语自然语言处理资源,以支持低资源印度语言自然语言处理的研究与开发。
提出的方法
- 从多个互联网来源(包括非新闻内容)抓取并筛选出多样化马拉地语单语语料库(L3Cube-MahaCorpus),以减少数据偏差。
- 将 L3Cube-MahaCorpus 与现有的公开马拉地语语料库(如 IndicNLP、OSCAR、CC-100)结合,形成一个 7.52 亿词的训练数据集。
- 使用掩码语言建模(MLM)和下一句预测目标,在完整语料库上预训练三种基于 BERT 的模型——MahaBERT、MahaAlBERT 和 MahaRoBERTa。
- 在下游任务上微调 BERT 模型:文本分类(新闻文章、标题)、情感分析(L3CubeMahaSent),以及在最终 token 嵌入表示上添加 CRF 层进行命名实体识别。
- 使用 skip-gram 架构在完整马拉地语语料库上训练 MahaFT fastText 词嵌入模型,并使用 KNN 分类器在句子级任务上评估其性能。
- 发布 MahaGPT,一个基于自回归语言建模目标在完整马拉地语语料库上训练的生成式语言模型。
实验结果
研究问题
- RQ1与现有通常受新闻影响的语料库相比,大规模、多样化的马拉地语单语语料库是否能提升下游自然语言处理任务的性能?
- RQ2在大规模、多样化马拉地语语料库上微调的单语 BERT 模型是否在马拉地语特定自然语言处理任务中优于多语言 BERT 模型?
- RQ3在完整马拉地语语料库上训练的 fastText 嵌入模型(MahaFT)在马拉地语文本分类任务中的表现是否优于现有替代方案(如 Facebook 的 FB-FT、IndicNLP 的 INLP-FT)?
- RQ4在单语语料库中包含非新闻内容在多大程度上能增强马拉地语自然语言处理模型的鲁棒性和泛化能力?
- RQ5能否在大规模、精心筛选的马拉地语语料库上成功训练一个生成式马拉地语语言模型(MahaGPT),以支持生成任务?
主要发现
- MahaRoBERTa 在马拉地语命名实体识别任务中取得了 64.34 的最高宏平均 F1 分数,优于多语言模型 mBERT(58.35)和 XLM-R(62.32)。
- MahaAlBERT 在 L3CubeMahaSent 情感分析数据集上取得了 83.7% 的最高分类准确率,超过 mBERT(80.4%)和 XLM-R(82.0%)。
- 在完整马拉地语语料库上训练的 fastText 嵌入模型 MahaFT 在命名实体识别任务中取得了 91.2 的宏平均 F1 分数,优于 FB-FT(88.8)和 INLP-FT(90.7)。
- 所有分类和命名实体识别基准测试中,单语 BERT 变体(MahaBERT、MahaAlBERT、MahaRoBERTa)均持续优于其多语言对应模型(mBERT、XLM-R、indicBERT)。
- MahaGPT 模型——一个生成式 Transformer 模型——已成功在完整马拉地语语料库上训练,并作为开源自然语言处理套件的一部分发布。
- L3Cube-MahaCorpus 与现有语料库的结合形成了一个 7.52 亿词的马拉地语单语数据集,显著扩展了低资源马拉地语自然语言处理的资源基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。