[论文解读] Neural Machine Translation with Byte-Level Subwords
本文提出字节级 BPE(BBPE),一种以 UTF-8 字节作为基本单位的子词分词方法,在保持相近翻译性能的同时,将词表大小减少至字符级 BPE 的 1/8。通过使用卷积或循环层对 BBPE 表示进行上下文建模,该模型实现了高效、无需 OOV(未登录词)的翻译,并支持字符集无重叠语言之间的迁移学习,显著提升了零样本适应能力。
Almost all existing machine translation models are built on top of character-based vocabularies: characters, subwords or words. Rare characters from noisy text or character-rich languages such as Japanese and Chinese however can unnecessarily take up vocabulary slots and limit its compactness. Representing text at the level of bytes and using the 256 byte set as vocabulary is a potential solution to this issue. High computational cost has however prevented it from being widely deployed or used in practice. In this paper, we investigate byte-level subwords, specifically byte-level BPE (BBPE), which is compacter than character vocabulary and has no out-of-vocabulary tokens, but is more efficient than using pure bytes only is. We claim that contextualizing BBPE embeddings is necessary, which can be implemented by a convolutional or recurrent layer. Our experiments show that BBPE has comparable performance to BPE while its size is only 1/8 of that for BPE. In the multilingual setting, BBPE maximizes vocabulary sharing across many languages and achieves better translation quality. Moreover, we show that BBPE enables transferring models between languages with non-overlapping character sets.
研究动机与目标
- 解决在低资源语言及汉字丰富的语言(如日语和中文)中,字符级子词分词导致的效率低下与词表膨胀问题。
- 探索字节级子词分词作为字符级 BPE 的更紧凑、语言无关的替代方案。
- 通过消除未登录词,实现字符集无重叠语言之间的模型迁移。
- 在双语、多语言及零样本迁移学习设置下,评估 BBPE 的性能与效率。
提出的方法
- 该方法使用 UTF-8 编码将文本表示为字节序列(0–255),构成基础词表。
- 在字节序列上学习字节级 BPE(BBPE),生成可变长度的字节 n-gram 作为子词单元。
- 通过深度可分离卷积层或双向 GRU 对 BBPE 表示进行上下文建模,以提升表征学习效果。
- 采用基于动态规划的解码算法,从字节序列中恢复出有效的 Unicode 字符,确保输出正确性。
- 模型采用 Transformer 架构进行训练,结合 BBPE 分词与上下文化嵌入。
- 通过在无任何字符重叠的源词表语言(僧伽罗语)上微调多语言 BBPE 模型,评估迁移学习效果。
实验结果
研究问题
- RQ1字节级子词分词能否在减少词表大小的同时,实现与字符级 BPE 相当的翻译质量?
- RQ2通过卷积或 RNN 对 BBPE 嵌入进行上下文建模,是否能提升模型性能?
- RQ3基于 BBPE 的模型能否有效迁移到字符集无重叠的语言上?
- RQ4在多语言翻译设置下,BBPE 相较于字符级 BPE 的表现如何?
- RQ5由于输入序列更短,BBPE 对训练与推理效率有何影响?
主要发现
- BBPE 在保持与 BPE 相当 BLEU 分数的同时,将词表大小减少至 1/8,BBPE 4K 在英德翻译任务中表现等同于 BPE 8K。
- 在多语言 X-En 设置下,BBPE 在完整测试集(16.5 万个样本)上达到 31.61 的 BLEU 分数,优于 BPE,且在平均语言与低资源语言上的表现均更优。
- 从多语言 X-En 模型迁移至僧伽罗语-英语(Si-En)任务,BLEU 分数提升 0.9–1.8,证明了在字符集无重叠语言间实现有效零样本适应。
- 采用 BiGRU 或深度可分离卷积进行上下文建模的 BBPE 模型,性能优于原始 BBPE 嵌入,证实了上下文建模的必要性。
- BBPE 相较于字符级分词,显著缩短了序列长度,从而因更短的输入序列而实现更快的训练与推理速度。
- 推理过程中无效 UTF-8 输出极为罕见,且动态规划解码算法能成功恢复出唯一有效的字符序列。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。