[论文解读] PhayaThaiBERT: Enhancing a Pretrained Thai Language Model with Unassimilated Loanwords
本文提出 PhayaThaiBERT,这是对 WangchanBERTa 的微调与词汇增强版本,通过从 XLM-R 迁移并利用更大规模的 156.5GB 数据集进行预训练,扩展分词器词汇以提升对未同化外来词(尤其是英文术语)的理解能力。该模型在下游任务中表现优异,尤其在未同化外来词比例较高的序列标注任务中,显著提升了准确率,证明了在对外来词理解至关重要的场景下具有显著优势。
While WangchanBERTa has become the de facto standard in transformer-based Thai language modeling, it still has shortcomings in regard to the understanding of foreign words, most notably English words, which are often borrowed without orthographic assimilation into Thai in many contexts. We identify the lack of foreign vocabulary in WangchanBERTa's tokenizer as the main source of these shortcomings. We then expand WangchanBERTa's vocabulary via vocabulary transfer from XLM-R's pretrained tokenizer and pretrain a new model using the expanded tokenizer, starting from WangchanBERTa's checkpoint, on a new dataset that is larger than the one used to train WangchanBERTa. Our results show that our new pretrained model, PhayaThaiBERT, outperforms WangchanBERTa in many downstream tasks and datasets.
研究动机与目标
- 为解决 WangchanBERTa 在理解泰语文本中拼写上未同化的外来词(尤其是英文术语)方面的局限性。
- 提升模型在涉及代码切换或外源词密集型泰语文本的下游 NLP 任务中的性能。
- 通过从 XLM-R 的分词器迁移外源词子词单元,扩展 WangchanBERTa 的词汇表。
- 在比 WangchanBERTa 原始训练数据大一倍的 156.5GB 数据集上对增强后的模型进行预训练,以提升泛化能力。
- 评估增强的外源词理解能力是否能在多样化的泰语 NLP 基准测试中带来可测量的性能提升。
提出的方法
- 通过从 XLM-R 的预训练分词器迁移外源词子词单元,扩展 WangchanBERTa 的 SentencePiece unigram 分词器。
- 使用 WangchanBERTa 的检查点初始化新模型,以保留其学习到的表征,同时适应新词汇表。
- 在 156.5GB 的数据集上对模型进行预训练,数据量为 WangchanBERTa 原始训练数据的两倍,使用相同的掩码语言建模目标。
- 应用空格保留与重复字符归一化等技术,以保持与泰语特有语言特征的兼容性。
- 在多个下游 NLP 任务(包括序列分类与 token 分类)上对最终的 PhayaThaiBERT 模型进行微调。
- 使用标准指标在多样化数据集上评估性能,并与 WangchanBERTa 和 XLM-R 进行比较。
实验结果
研究问题
- RQ1通过在外源词上扩展分词器词汇表,是否能提升泰语语言模型对外来未同化词的理解能力?
- RQ2在更大规模数据集上进行预训练,能在多大程度上提升模型在下游泰语 NLP 任务中的表现?
- RQ3在涉及高比例未同化英文外来词的任务中(尤其是 token 分类任务),是否存在可测量的性能提升?
- RQ4在多样化数据集上,PhayaThaiBERT 与 WangchanBERTa 和 XLM-R 在零样本与微调性能方面相比如何?
- RQ5词汇扩展与更大规模预训练是否能缓解现有泰语模型在处理代码切换或外源影响型泰语文本时的局限性?
主要发现
- PhayaThaiBERT 在多个下游任务中优于 WangchanBERTa,其中在未同化外来词比例高的 token 分类数据集上表现最为突出。
- 在包含 38.54% 未同化英文词的 Thai_NNER 数据集中,PhayaThaiBERT 相较于 WangchanBERTa 实现了 +4.95% 的 F1 分数提升。
- 在完全为英文的 Yelp Review Full 数据集中,PhayaThaiBERT 实现了 +9.86% 的 F1 分数提升,表明其在外源语言内容上的强大表现。
- 在仅含英文的 Yelp 数据集中,模型实现了 +6.72% 的 F1 分数提升,证实了对外源词处理能力的增强可直接提升此类场景下的性能。
- 对于中等比例外来词存在的序列分类任务(如 wisesight_sentiment 中的 27.59%),PhayaThaiBERT 实现了 +1.8% 的 F1 分数提升,表明其改进具有持续性。
- 尽管性能有所提升,PhayaThaiBERT 在 generated_reviews_enth 数据集上仍未超越 XLM-R,表明其在处理机器翻译内容方面仍存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。