[论文解读] Training Multilingual Pre-trained Language Model with Byte-level Subwords
本文提出使用字节级 BPE(BBPE)进行子词分词,以训练多语言预训练语言模型,通过操作 UTF-8 字节序列提升了词汇效率并减少了未登录词(OOV)数量。实验表明,采用 BBPE 的 NEZHA 模型在多个多语言 NLU 任务中优于多语言 BERT 和标准 NEZHA 模型,尤其在低资源语言上表现更优。
The pre-trained language models have achieved great successes in various natural language understanding (NLU) tasks due to its capacity to capture the deep contextualized information in text by pre-training on large-scale corpora. One of the fundamental components in pre-trained language models is the vocabulary, especially for training multilingual models on many different languages. In the technical report, we present our practices on training multilingual pre-trained language models with BBPE: Byte-Level BPE (i.e., Byte Pair Encoding). In the experiment, we adopted the architecture of NEZHA as the underlying pre-trained language model and the results show that NEZHA trained with byte-level subwords consistently outperforms Google multilingual BERT and vanilla NEZHA by a notable margin in several multilingual NLU tasks. We release the source code of our byte-level vocabulary building tools and the multilingual pre-trained language models.
研究动机与目标
- 为解决多语言 BERT 中字符级词汇表的局限性,例如稀有子词比例过高以及持续存在的未知 token([UNK])问题。
- 探索字节级子词分词作为多语言预训练语言模型更鲁棒、更高效的一种替代方案。
- 通过增强跨语言的子词共享与表征学习,提升模型在低资源语言上的性能。
- 证明字节级 BPE(BBPE)可生成更高频次的子词,并通过在词汇表中编码全部 256 个字节来消除 [UNK] token。
提出的方法
- 该方法采用字节级 BPE(BBPE),先将文本转换为 UTF-8 字节序列,再对字节序列应用 BPE 以构建子词词汇表。
- 词汇表基于 UTF-8 编码序列构建,确保包含全部 256 种可能的字节,从而彻底消除 [UNK] token。
- 该方法通过特殊标记(如 '##' 表示后续子词)显式建模子词类型,并引入可学习的子词类型嵌入,以区分起始子词、后续子词和完整词子词。
- 模型架构采用 NEZHA 作为主干网络,在包含 14 种语言的多语言 NLU 基准(如 XNLI、MLQA)上进行微调。
- 训练过程通过低资源语言的过采样实现数据平衡,并在 11 种和 14 种语言设置下进行评估,以检验模型的可扩展性。
- 该方法对比了多种变体:是否启用词边界处理、是否使用子词类型嵌入、是否显式建模子词类型。
实验结果
研究问题
- RQ1与字符级词汇表相比,字节级子词分词是否能减少稀有子词数量并消除 [UNK] token?
- RQ2BBPE 分词方式对多语言模型性能有何影响,尤其在多样化的语言中,特别是低资源语言?
- RQ3显式子词类型建模(如 '##' 前缀或可学习嵌入)对下游 NLU 任务准确率有何影响?
- RQ4BBPE 训练的模型在多语言基准上与 mBERT 和原始 NEZHA 相比表现如何?
主要发现
- 在 XNLI 基准的 8 种语言上,采用 BBPE 训练的 NEZHA 模型平均性能比 Google 的多语言 BERT 提高 1.6 个百分点(77.1 vs. 75.5)。
- 在 14 种语言的 XNLI 任务中,BBPE 模型相比原始 NEZHA 提升 2.0 个百分点(77.1 vs. 77.5),在德语、泰语和中文中提升尤为显著。
- BBPE 词汇表在 14 种语言中均无频率低于 10,000 的子词,而 mBERT 的词汇表中约有 30% 的子词频率低于 100。
- 移除词边界处理(WBL)导致平均性能下降 4.0 个百分点(74.21 vs. 77.1),表明显式建模子词结构至关重要。
- BBPE 模型在高资源语言(如英语、俄语)中减少了冗余子词,同时显著提升了低资源语言(如阿拉伯语、马来语、泰语)的词元覆盖率。
- 即使不使用子词类型嵌入(STE)的变体,其性能仍优于仅启用 WBL 的模型,表明显式建模子词类型可有效增强表征学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。