[论文解读] BanglaBERT: Language Model Pretraining and Benchmarks for Low-Resource Language Understanding Evaluation in Bangla
本文介绍了 BanglaBERT,一种在 27.5 GB 经筛选的孟加拉语网络文本('Bangla2B+')上预训练的基于 BERT 的语言模型,以及 BanglishBERT,一种在孟加拉语和英语上共同预训练的多语言变体。作者建立了首个孟加拉语语言理解基准(BLUB),涵盖四个 NLU 任务——情感分类、自然语言推理(NLI)、命名实体识别(NER)和问答(QA)——并证明 BanglaBERT 在所有四个任务中分别比多语言模型 mBERT 和 XLM-R(base)高出 6.8 和 4.3 BLUB 分,且在零样本迁移任务中表现优异。
In this work, we introduce BanglaBERT, a BERT-based Natural Language Understanding (NLU) model pretrained in Bangla, a widely spoken yet low-resource language in the NLP literature. To pretrain BanglaBERT, we collect 27.5 GB of Bangla pretraining data (dubbed `Bangla2B+') by crawling 110 popular Bangla sites. We introduce two downstream task datasets on natural language inference and question answering and benchmark on four diverse NLU tasks covering text classification, sequence labeling, and span prediction. In the process, we bring them under the first-ever Bangla Language Understanding Benchmark (BLUB). BanglaBERT achieves state-of-the-art results outperforming multilingual and monolingual models. We are making the models, datasets, and a leaderboard publicly available at https://github.com/csebuetnlp/banglabert to advance Bangla NLP.
研究动机与目标
- 为解决孟加拉语这一拥有三亿多使用者的低资源语言缺乏高质量、大规模预训练数据的问题。
- 开发一种单语孟加拉语 NLU 模型 BanglaBERT,使其在下游任务中优于现有多语言模型。
- 引入两个全新的孟加拉语自然语言推理和问答数据集,此前在孟加拉语 NLP 领域尚未被探索。
- 建立首个涵盖多样化 NLU 任务的综合性孟加拉语语言理解基准(BLUB)。
- 通过在孟加拉语和英语上联合预训练多语言模型 BanglishBERT,实现零样本跨语言迁移。
提出的方法
- 通过 Alexa 排名选取 110 个热门孟加拉语网站进行爬取,收集 35 GB 原始文本,经过滤与清洗后获得 27.5 GB 高质量、无冒犯内容的孟加拉语文本。
- 通过去重、移除 HTML/JS 标签以及语言分类等预处理步骤,分离出孟加拉语内容。
- 基于清洗后的语料库训练一个 32k 词汇量的 WordPiece 分词器,支持语言混用和罗马化孟加拉语。
- 在 718 万个样本(共 21.8B 个 token)上,使用掩码语言建模(MLM)和下一句预测(NSP)目标对 BanglaBERT 进行预训练。
- 将 BanglishBERT 在孟加拉语和英语数据上联合预训练,以支持零样本跨语言迁移。
- 在四个下游任务(情感分类、NLI、NER 和 QA)上评估模型,使用新引入的 BLUB 基准。
实验结果
研究问题
- RQ1单语、语言特定的 BERT 模型是否能在孟加拉语 NLU 任务中超越多语言模型?
- RQ2使用类似 BanglishBERT 的多语言模型,从英语到孟加拉语的零样本跨语言迁移效果如何?
- RQ3在有限标注数据上微调时,样本效率对孟加拉语等低资源 NLP 模型(如 BanglaBERT)有何影响?
- RQ4与 OSCAR 或 CCNet 等噪声较大的开源数据集相比,使用经筛选的大规模孟加拉语语料库进行预训练有何优势?
- RQ5新基准(BLUB)在多大程度上能标准化并推动孟加拉语 NLP 研究的发展?
主要发现
- 在所有四个任务的监督微调中,BanglaBERT 分别比 mBERT 和 XLM-R(base)高出 6.8 和 4.3 BLUB 分。
- 在零样本跨语言迁移中,BanglishBERT 分别比 mBERT 和 XLM-R(base)高出 15.8 和 10.8 BLUB 分。
- 在有限训练数据(≤1,000 个样本)下,BanglaBERT 在情感分类任务中比 XLM-R(large)高出 2–9% 准确率,在 NLI 任务中高出 6–10%,且 p < 0.05。
- BanglaBERT 展现出更优的计算效率,微调时所需时间比更小的 sahajBERT 模型少 2–3.5 倍,内存消耗少 2.4–3.33 倍。
- 作者成功整理并发布了不侵犯版权的预训练数据集,以及两个全新的高质量下游数据集(用于 NLI 和 QA)。
- 模型与基准以非商业许可发布,通过质量受控的人工翻译流程确保数据集可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。