[论文解读] WangchanBERTa: Pretraining transformer-based Thai Language Models
本论文介绍了 WangchanBERTa,一个基于 RoBERTa-base 架构的泰语语言模型,其在 78GB 经过筛选、去重和清洗的泰语文本上进行预训练,数据来源涵盖社交媒体、新闻和公共数据集。通过将空格保留为句子和词块的边界,并使用 SentencePiece 分词,WangchanBERTa-base-att-spm-uncased 在单语泰语上下文下的序列分类和词元分类任务中,优于强基线模型(NBSVM、CRF、ULMFit)和多语言模型(XLM-R、mBERT)。
Transformer-based language models, more specifically BERT-based architectures have achieved state-of-the-art performance in many downstream tasks. However, for a relatively low-resource language such as Thai, the choices of models are limited to training a BERT-based model based on a much smaller dataset or finetuning multi-lingual models, both of which yield suboptimal downstream performance. Moreover, large-scale multi-lingual pretraining does not take into account language-specific features for Thai. To overcome these limitations, we pretrain a language model based on RoBERTa-base architecture on a large, deduplicated, cleaned training set (78GB in total size), curated from diverse domains of social media posts, news articles and other publicly available datasets. We apply text processing rules that are specific to Thai most importantly preserving spaces, which are important chunk and sentence boundaries in Thai before subword tokenization. We also experiment with word-level, syllable-level and SentencePiece tokenization with a smaller dataset to explore the effects on tokenization on downstream performance. Our model wangchanberta-base-att-spm-uncased trained on the 78.5GB dataset outperforms strong baselines (NBSVM, CRF and ULMFit) and multi-lingual models (XLMR and mBERT) on both sequence classification and token classification tasks in human-annotated, mono-lingual contexts.
研究动机与目标
- 为解决高质量单语泰语语言模型可用性有限的问题,创建大规模、领域多样的预训练数据集。
- 通过训练专用的单语模型,克服多语言模型(如 mBERT、XLM-R)在泰语自然语言处理任务中表现不佳的问题。
- 研究不同分词策略(词级别、音节级别和 SentencePiece)对泰语自然语言处理下游任务性能的影响。
- 通过在子词分词过程中保留空格作为句法边界,提升泰语自然语言处理性能,这一特征在泰语中具有关键语言学意义。
- 通过在大规模、清洗过的数据集上进行预训练并公开发布模型,建立泰语自然语言处理的新 SOTA 基准。
提出的方法
- 在来自社交媒体(Wisesight、Pantip)、新闻(Thairath、Prachathai)和维基百科的 78GB 清洗、去重后的泰语文本上,预训练 RoBERTa-base 架构。
- 应用针对泰语的文本预处理方法,在子词分词前保留空格作为句子和词块的边界。
- 使用可学习词汇表的 SentencePiece 子词分词方法,以处理未登录词并提升鲁棒性。
- 训练并比较五种变体:一种在完整 78GB 数据集上训练的模型(WangchanBERTa-base-att-spm-uncased),以及四种仅使用维基百科数据并采用不同分词器(SentencePiece、词级别、音节级别、SEFR)的模型。
- 使用人工标注的数据集,在序列分类(多类和多标签)和词元分类(命名实体识别)任务上评估性能。
- 在 Hugging Face 上发布预训练和微调后的模型,并在 GitHub 上开源训练代码。
实验结果
研究问题
- RQ1与现有基线模型和多语言模型相比,在大规模、多样化且清洗过的数据集上预训练单语泰语 BERT 模型,是否能提升下游自然语言处理任务的性能?
- RQ2在分词过程中保留空格作为句法边界的策略,对泰语语言模型性能有何影响?
- RQ3不同分词策略(词级别、音节级别和 SentencePiece)对泰语序列分类和词元分类性能的相对影响是什么?
- RQ4大规模单语泰语语言模型是否能在泰语特定基准上超越 mBERT 和 XLM-R 等多语言模型?
- RQ5分词器的选择如何影响模型在多样化泰语文本领域中的泛化能力?
主要发现
- 在 ThaiNER LST20 数据集上,WangchanBERTa-base-att-spm-uncased 在多类和多标签序列分类任务中均优于 NBSVM、CRF 和 ULMFit,宏 F1 分数达到 0.8155。
- 在同一数据集上,该模型在词性标注任务中取得 0.8586 的宏 F1 分数,在命名实体识别任务中取得 0.7519 的宏 F1 分数,显著优于 mBERT 和 XLM-R。
- 在完整 78GB 数据集上使用 SentencePiece 分词训练的模型表现最佳,证明了大规模、领域多样化的预训练的有效性。
- 与 mBERT 和 XLM-R 相比,WangchanBERTa 在 ThaiNER LST20 所有命名实体类型中均取得更高的 F1 分数,包括 PER 类的 0.9132 和 TITL 类的 0.9682。
- 消融研究显示,词级别和音节级别分词器在未登录词和罕见词上的表现均逊于 SentencePiece,凸显了子词建模在低资源场景中的重要性。
- 该模型在多样化领域中表现稳健,无论是在社交媒体文本还是正式新闻文本上均取得优异结果,表明其具备出色的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。