Skip to main content
QUICK REVIEW

[论文解读] Training Multilingual Pre-trained Language Model with Byte-level Subwords

Victor Junqiu Wei, Qun Liu|arXiv (Cornell University)|Jan 23, 2021
Topic Modeling参考文献 28被引用 10
一句话总结

本文提出使用字节级 BPE(BBPE)进行子词分词,以训练多语言预训练语言模型,通过操作 UTF-8 字节序列提升了词汇效率并减少了未登录词(OOV)数量。实验表明,采用 BBPE 的 NEZHA 模型在多个多语言 NLU 任务中优于多语言 BERT 和标准 NEZHA 模型,尤其在低资源语言上表现更优。

ABSTRACT

The pre-trained language models have achieved great successes in various natural language understanding (NLU) tasks due to its capacity to capture the deep contextualized information in text by pre-training on large-scale corpora. One of the fundamental components in pre-trained language models is the vocabulary, especially for training multilingual models on many different languages. In the technical report, we present our practices on training multilingual pre-trained language models with BBPE: Byte-Level BPE (i.e., Byte Pair Encoding). In the experiment, we adopted the architecture of NEZHA as the underlying pre-trained language model and the results show that NEZHA trained with byte-level subwords consistently outperforms Google multilingual BERT and vanilla NEZHA by a notable margin in several multilingual NLU tasks. We release the source code of our byte-level vocabulary building tools and the multilingual pre-trained language models.

研究动机与目标

  • 为解决多语言 BERT 中字符级词汇表的局限性,例如稀有子词比例过高以及持续存在的未知 token([UNK])问题。
  • 探索字节级子词分词作为多语言预训练语言模型更鲁棒、更高效的一种替代方案。
  • 通过增强跨语言的子词共享与表征学习,提升模型在低资源语言上的性能。
  • 证明字节级 BPE(BBPE)可生成更高频次的子词,并通过在词汇表中编码全部 256 个字节来消除 [UNK] token。

提出的方法

  • 该方法采用字节级 BPE(BBPE),先将文本转换为 UTF-8 字节序列,再对字节序列应用 BPE 以构建子词词汇表。
  • 词汇表基于 UTF-8 编码序列构建,确保包含全部 256 种可能的字节,从而彻底消除 [UNK] token。
  • 该方法通过特殊标记(如 '##' 表示后续子词)显式建模子词类型,并引入可学习的子词类型嵌入,以区分起始子词、后续子词和完整词子词。
  • 模型架构采用 NEZHA 作为主干网络,在包含 14 种语言的多语言 NLU 基准(如 XNLI、MLQA)上进行微调。
  • 训练过程通过低资源语言的过采样实现数据平衡,并在 11 种和 14 种语言设置下进行评估,以检验模型的可扩展性。
  • 该方法对比了多种变体:是否启用词边界处理、是否使用子词类型嵌入、是否显式建模子词类型。

实验结果

研究问题

  • RQ1与字符级词汇表相比,字节级子词分词是否能减少稀有子词数量并消除 [UNK] token?
  • RQ2BBPE 分词方式对多语言模型性能有何影响,尤其在多样化的语言中,特别是低资源语言?
  • RQ3显式子词类型建模(如 '##' 前缀或可学习嵌入)对下游 NLU 任务准确率有何影响?
  • RQ4BBPE 训练的模型在多语言基准上与 mBERT 和原始 NEZHA 相比表现如何?

主要发现

  • 在 XNLI 基准的 8 种语言上,采用 BBPE 训练的 NEZHA 模型平均性能比 Google 的多语言 BERT 提高 1.6 个百分点(77.1 vs. 75.5)。
  • 在 14 种语言的 XNLI 任务中,BBPE 模型相比原始 NEZHA 提升 2.0 个百分点(77.1 vs. 77.5),在德语、泰语和中文中提升尤为显著。
  • BBPE 词汇表在 14 种语言中均无频率低于 10,000 的子词,而 mBERT 的词汇表中约有 30% 的子词频率低于 100。
  • 移除词边界处理(WBL)导致平均性能下降 4.0 个百分点(74.21 vs. 77.1),表明显式建模子词结构至关重要。
  • BBPE 模型在高资源语言(如英语、俄语)中减少了冗余子词,同时显著提升了低资源语言(如阿拉伯语、马来语、泰语)的词元覆盖率。
  • 即使不使用子词类型嵌入(STE)的变体,其性能仍优于仅启用 WBL 的模型,表明显式建模子词类型可有效增强表征学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。