[论文解读] Mono vs Multilingual BERT for Hate Speech Detection and Text Classification: A Case Study in Marathi
本研究比较了用于马拉地语文本分类的单语与多语 BERT 模型,评估了 MahaBERT、MahaALBERT 和 MahaRoBERTa 与 mBERT、indicBERT 和 xlm-RoBERTa 在仇恨言论检测和情感分析任务上的表现。单语模型始终优于多语模型,其中 MahaRoBERTa 在 HASOC-2021 数据集上达到 89.0% 的准确率,MahaAlBERT 在 Articles 数据集上达到 94.5% 的准确率,显示出在马拉地语自然语言处理任务中更优的性能和更丰富的句子嵌入。
Transformers are the most eminent architectures used for a vast range of Natural Language Processing tasks. These models are pre-trained over a large text corpus and are meant to serve state-of-the-art results over tasks like text classification. In this work, we conduct a comparative study between monolingual and multilingual BERT models. We focus on the Marathi language and evaluate the models on the datasets for hate speech detection, sentiment analysis and simple text classification in Marathi. We use standard multilingual models such as mBERT, indicBERT and xlm-RoBERTa and compare with MahaBERT, MahaALBERT and MahaRoBERTa, the monolingual models for Marathi. We further show that Marathi monolingual models outperform the multilingual BERT variants on five different downstream fine-tuning experiments. We also evaluate sentence embeddings from these models by freezing the BERT encoder layers. We show that monolingual MahaBERT based models provide rich representations as compared to sentence embeddings from multi-lingual counterparts. However, we observe that these embeddings are not generic enough and do not work well on out of domain social media datasets. We consider two Marathi hate speech datasets L3Cube-MahaHate, HASOC-2021, a Marathi sentiment classification dataset L3Cube-MahaSent, and Marathi Headline, Articles classification datasets.
研究动机与目标
- 评估单语和多语 BERT 模型在马拉地语特定自然语言处理任务(如仇恨言论检测和情感分析)中的表现。
- 评估在大规模马拉地语语料库上进行单语预训练是否能为低资源印度语言提供优于多语预训练的表示。
- 比较不同模型的冻结 BERT 编码器生成的句子嵌入,并评估其在不同领域中的泛化能力。
- 为单语言下游任务中单语模型的优越性提供实证证据,尤其针对马拉地语等资源匮乏的语言。
- 通过在标准化数据集上基准测试最先进模型,为自然语言处理社区提供马拉地语自然语言处理的模型选择指导。
提出的方法
- 在包括 L3Cube-MahaHate、HASOC-2021、L3Cube-MahaSent 和马拉地语新闻标题/文章在内的马拉地语数据集上,微调单语马拉地语 BERT 变体(MahaBERT、MahaALBERT 和 MahaRoBERTa)。
- 与标准多语模型(mBERT、indicBERT 和 xlm-RoBERTa)进行比较,所有模型均在相同马拉地语数据集上进行微调。
- 实施两种训练方案:完全微调(非冻结)和仅微调分类器头而冻结 BERT 编码器层。
- 通过冻结 BERT 编码器并使用 [CLS] token 表示进行下游分类,评估句子嵌入。
- 使用大规模单语语料库(包括 L3Cube-MahaCorpus,共 75200 万词)预训练单语模型。
- 在仇恨言论检测、情感分析和文本分类任务中,执行五项独立的下游分类实验。
实验结果
研究问题
- RQ1在大规模马拉地语语料库上预训练的单语 BERT 模型是否在马拉地语文本分类任务中优于多语 BERT 模型?
- RQ2单语和多语 BERT 模型生成的句子嵌入在马拉地语自然语言处理任务中的判别能力如何比较?
- RQ3冻结的 BERT 编码器层在多大程度上能为不同马拉地语文本分类数据集生成通用且可迁移的句子表示?
- RQ4在马拉地语仇恨言论检测和情感分类任务中,哪种模型架构(MahaBERT、MahaALBERT 或 MahaRoBERTa)表现最佳?
- RQ5尽管多语模型专为跨语言迁移而设计,为何单语模型仍表现出更优性能?
主要发现
- MahaRoBERTa 在 HASOC-2021 恶意言论检测数据集上达到最高准确率 89.0%,优于所有多语模型。
- MahaAlBERT 在马拉地语 Articles 分类数据集上达到 94.5% 的准确率,为所有测试模型中的最佳表现。
- 在所有五项下游任务中,单语模型均持续优于多语模型,其中 MahaBERT 在非冻结微调设置下的仇恨言论检测任务中达到 88.3% 的准确率。
- 冻结 BERT 编码器层导致性能显著下降(例如,MahaBERT 在 L3Cube-MahaHate 数据集上准确率为 82.4%),表明冻结模型生成的句子嵌入通用性较差。
- 单语模型(如 MahaBERT 和 MahaAlBERT)生成的句子嵌入比多语模型更具表现力,尤其在微调后表现更优。
- 尽管单语嵌入具有更优的表示能力,但其在跨领域社交媒体数据集上的泛化能力有限,表明需要开发领域自适应的句子嵌入模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。