[论文解读] BERTifying Sinhala -- A Comprehensive Analysis of Pre-trained Language Models for Sinhala Text Classification
本文对预训练语言模型在僧伽罗语文本分类中的表现进行了全面评估,提出了两种基于 RoBERTa 的单语僧伽罗语模型(SinBERT-small 和 SinBERT-large),并在更大语料库上进行了训练。结果表明,尽管 XLM-R-large 作为强基线模型表现最佳,但 SinBERT 模型在标注数据有限的情况下优于 XLM-R-base,为四个僧伽罗语文本分类任务建立了新的最先进基线。
This research provides the first comprehensive analysis of the performance of pre-trained language models for Sinhala text classification. We test on a set of different Sinhala text classification tasks and our analysis shows that out of the pre-trained multilingual models that include Sinhala (XLM-R, LaBSE, and LASER), XLM-R is the best model by far for Sinhala text classification. We also pre-train two RoBERTa-based monolingual Sinhala models, which are far superior to the existing pre-trained language models for Sinhala. We show that when fine-tuned, these pre-trained language models set a very strong baseline for Sinhala text classification and are robust in situations where labeled data is insufficient for fine-tuning. We further provide a set of recommendations for using pre-trained models for Sinhala text classification. We also introduce new annotated datasets useful for future research in Sinhala text classification and publicly release our pre-trained models.
研究动机与目标
- 评估现有多语言预训练模型(XLM-R、LaBSE、LASER)以及新训练的单语模型在僧伽罗语文本分类中的性能。
- 解决在低资源僧伽罗语(一类语言,NLP 资源有限)上对预训练模型缺乏实证评估的问题。
- 通过微调预训练模型,为僧伽罗语文本分类建立强大且公开可用的基线。
- 发布新的标注数据集和预训练模型,以支持僧伽罗语 NLP 领域的未来研究。
提出的方法
- 在比先前模型更大的僧伽罗语语料库上,训练了两个基于 RoBERTa 的单语僧伽罗语语言模型(SinBERT-small 和 SinBERT-large)。
- 在四个文本分类任务上评估了性能:情感分析、新闻来源分类、新闻类别分类和写作风格分类。
- 在不同大小的标注数据集上微调预训练模型,以评估在数据稀缺情况下的鲁棒性。
- 在所有任务中,将单语模型(SinBERT)与多语言模型(XLM-R、LaBSE、LASER)的性能进行比较。
- 以宏平均 F1 分数为主要评估指标,并分析了不同数据集大小下模型的行为表现。
- 通过 Hugging Face 和 Hugging Face Datasets 公开发布预训练模型、微调后的模型、标注数据集和训练代码。
实验结果
研究问题
- RQ1在包含僧伽罗语的多语言模型中,哪一种预训练语言模型在僧伽罗语文本分类任务中表现最佳?
- RQ2新训练的单语僧伽罗语模型在僧伽罗语文本分类任务中的性能,与现有多语言和单语模型相比如何?
- RQ3在不同大小的标注微调数据下,模型性能如何变化?
- RQ4当标注数据稀缺时,单语僧伽罗语模型能否优于多语言模型?
- RQ5在僧伽罗语文本分类中,最有效的模型配置和超参数是什么?
主要发现
- XLM-R-large 在情感分析任务中取得了 68.1 的最高宏平均 F1 分数,确立了新的强基线。
- 当在小规模数据集上微调时,SinBERT-small 在情感分析任务中取得了 53.85 的宏平均 F1 分数,优于 XLM-R-base。
- SinBERT-large 在写作风格分类任务中取得了 95.49 的宏平均 F1 分数,优于所有其他模型。
- XLM-R-large 模型在所有四个任务中均持续优于其他所有模型,确立了新的最先进基线。
- 在极小规模的标注数据集上,SinBERT-small 和 SinBERT-large 显著优于 XLM-R-base,表现出更好的数据效率。
- 新发布的僧伽罗语新闻来源分类、新闻类别分类和写作风格分类数据集对公众开放,可供未来研究使用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。