[论文解读] Vocabulary Manipulation for Neural Machine Translation
本文提出了一种神经机器翻译(NMT)的句子级词表操作技术,通过为每句话动态选择并使用较小的目标词表,显著降低了计算成本。该词表由词/短语翻译模型和高频目标词生成。该方法在保持高性能的同时,将推理时间和内存使用显著减少,并在大词表NMT系统的基础上实现了1.0 BLEU的性能提升,每句话的平均输出词表大小仅为202个词。
In order to capture rich language phenomena, neural machine translation models have to use a large vocabulary size, which requires high computing time and large memory usage. In this paper, we alleviate this issue by introducing a sentence-level or batch-level vocabulary, which is only a very small sub-set of the full output vocabulary. For each sentence or batch, we only predict the target words in its sentence-level or batch-level vocabulary. Thus, we reduce both the computing time and the memory usage. Our method simply takes into account the translation options of each word or phrase in the source sentence, and picks a very small target vocabulary for each sentence based on a word-to-word translation model or a bilingual phrase library learned from a traditional machine translation model. Experimental results on the large-scale English-to-French task show that our method achieves better translation performance by 1 BLEU point over the large vocabulary neural machine translation system of Jean et al. (2015).
研究动机与目标
- 为解决大词表神经机器翻译(NMT)系统存在的高计算成本和内存占用问题。
- 通过利用短语转换模型中的词对词和短语对短语翻译模型,引入翻译歧义性以提升翻译质量。
- 在不损失覆盖范围或性能的前提下,减小每句话的输出词表大小。
- 通过使用小而句子特定的输出词表替代完整的目标词表,实现更快的训练和推理速度。
- 通过词表剪枝,结合传统SMT(快速规则提取)与端到端NMT(高质量翻译)的优势。
提出的方法
- 对于每个源句子,句子级输出词表 $V_o$ 由三部分组成:(1) 来自词/短语翻译模型的目标词,(2) 最常见的2,000个目标词,以及(3) 来自参考翻译的词。
- 在训练过程中,通过合并每个批次中各句子的句子级词表,形成小批量级别的词表,并仅更新与这些词相关的参数。
- 训练过程在每个周期开始时对句子进行洗牌,使每个句子在不同周期中看到不同的词表,从而提升泛化能力。
- 在推理(束搜索)中,对每个句子应用相同的词表构建方法,但不包含参考词部分,因为参考译文不可用。
- 该方法使用标准的注意力机制NMT架构,但在每个预测步骤中,用较小的、动态的 $V_o$ 替代完整的输出词表 $V_y$。
- softmax计算仅在 $V_o$ 上进行,从而大幅降低每步预测的计算成本。
实验结果
研究问题
- RQ1通过动态选择的小型句子级输出词表,是否能在不降低翻译质量的前提下提升NMT效率?
- RQ2通过SMT衍生的词/短语模型引入翻译歧义性,对NMT性能有何影响?
- RQ3在句子级词表中,应包含多少个最频繁的目标词(即top-k)才能达到最优效果?
- RQ4词表操作是否能减少训练和推理时间,同时保持或提升BLEU得分?
- RQ5词表的动态、周期性洗牌对模型泛化能力和性能有何影响?
主要发现
- 所提方法在大词表NMT基线基础上实现了1.0 BLEU的性能提升,经UNK替换后在英法测试集上达到35.11 BLEU。
- 句子级输出词表 $V_o$ 的平均大小降低至202个词,比先前工作中使用的30,000词基线小了14.5倍。
- 即使仅使用前50个最频繁的目标词,$V_o$ 的平均大小仍可降至202,且开发集上仅损失0.1 BLEU。
- 训练速度显著提升:当批量词表大小增至30,000时,训练速度比本方法慢1.5倍。
- 当 $V_o$ 的三个组成部分(词/短语翻译、前2,000个高频词、参考词)全部使用时,模型性能最佳,单独消融实验的BLEU得分分别为34.20和34.23。
- 学习曲线显示模型在第7个周期时已收敛,第5个周期固定词嵌入后无显著性能提升,表明本方法具有稳定的训练过程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。