[论文解读] Generative Neural Machine Translation
本文提出生成式神经机器翻译(GNMT),一种通过语言无关语义表征(z)联合建模源句与目标句的潜在变量模型,提升了翻译鲁棒性,尤其在缺失词汇情况下表现更优,并实现了多语言与半监督学习,且无需增加参数量。GNMT在未见语言对上取得了最先进(SOTA)的BLEU得分,在长序列与不完整输入翻译任务中也优于基线模型。
We introduce Generative Neural Machine Translation (GNMT), a latent variable architecture which is designed to model the semantics of the source and target sentences. We modify an encoder-decoder translation model by adding a latent variable as a language agnostic representation which is encouraged to learn the meaning of the sentence. GNMT achieves competitive BLEU scores on pure translation tasks, and is superior when there are missing words in the source sentence. We augment the model to facilitate multilingual translation and semi-supervised learning without adding parameters. This framework significantly reduces overfitting when there is limited paired data available, and is effective for translating between pairs of languages not seen during training.
研究动机与目标
- 开发一种神经机器翻译模型,显式学习句子语义的解耦、语言无关的语义表征。
- 通过利用潜在语义表征,提升在源句包含缺失词汇时的翻译鲁棒性。
- 通过共享参数实现多语言翻译与半监督学习,且无需增加模型参数。
- 通过类别化语言指示符在不同语言间共享参数,减少低资源场景下的过拟合。
- 评估通过共享潜在变量建模源句与目标句的联合分布,是否能带来优于条件模型的语义泛化能力。
提出的方法
- GNMT建模联合概率 $ p_{\theta}(\mathbf{x}, \mathbf{y}, \mathbf{z}) = p(\mathbf{z}) p_{\theta}(\mathbf{x}|\mathbf{z}) p_{\theta}(\mathbf{y}|\mathbf{x}, \mathbf{z}) $,其中 $ \mathbf{z} $ 为标准正态先验 $ \mathcal{N}(\mathbf{0}, \mathbf{I}) $,作为共享的语义表征。
- 源句 $ \mathbf{x} $ 通过基于 $ \mathbf{z} $ 和前序词的LSTM自回归生成,隐藏状态计算为 $ \mathbf{h}^{x}_{t} = \mathrm{LSTM}(\mathbf{h}^{x}_{t-1}, \mathbf{z}, \mathbf{e}(x_{t-1})) $。
- 目标句 $ \mathbf{y} $ 通过注意力增强的LSTM解码器生成,该解码器关注 $ \mathbf{x} $ 的双向编码器状态,上下文向量通过软注意力机制在编码器状态上计算。
- 为支持多语言翻译,引入两个类别变量以指示源语言与目标语言,实现跨语言对的参数共享。
- 在半监督学习中,通过将源语言与目标语言设为相同值,利用单语数据,使模型在训练期间可利用未配对的单语句。
- 训练通过随机变分推断进行,目标为最大化联合分布对数似然的变分下界。
实验结果
研究问题
- RQ1共享的、语言无关的潜在变量 $ \mathbf{z} $ 是否能有效表征多语言中句子的语义含义?
- RQ2通过 $ \mathbf{z} $ 建模联合分布 $ p(\mathbf{x}, \mathbf{y}) $ 是否优于条件建模 $ p(\mathbf{y}|\mathbf{x}) $,尤其在数据稀缺情况下?
- RQ3当源句不完整或存在缺失词汇时,潜在表征 $ \mathbf{z} $ 是否能提升翻译鲁棒性?
- RQ4通过类别化语言指示符在语言间共享参数,是否能减少过拟合并提升对未见语言对的零样本翻译性能?
- RQ5能否有效利用单语数据进行半监督学习,以进一步提升低资源翻译任务的性能?
主要发现
- GNMT在WMT'14英语到德语翻译任务中取得33.23的BLEU得分,优于基线VNMT模型(26.99 BLEU),并在长句翻译中表现强劲。
- 当源句中存在缺失词汇时,GNMT生成的翻译显著优于VNMT,定性示例显示GNMT能正确推断缺失内容。
- GNMT-Multi通过跨语言共享参数,在未见的英西翻译任务中取得36.72的BLEU得分,优于VNMT(35.58)与标准GNMT(35.35)。
- GNMT-Multi-SSL通过利用单语数据,在未见英西翻译任务中取得38.80的BLEU得分,显著优于所有其他模型,证明了半监督学习的有效性。
- 消融实验证明,模型严重依赖潜在变量 $ \mathbf{z} $,移除 $ \mathbf{z} $ 导致性能急剧下降,确认其在语义表征中的核心作用。
- 替代因子分解 $ p(\mathbf{x}, \mathbf{y}, \mathbf{z}) = p(\mathbf{z}) p_{\theta}(\mathbf{x}|\mathbf{z}) p_{\theta}(\mathbf{y}|\mathbf{z}) $ 会产生语法不连贯的翻译,表明将 $ \mathbf{y} $ 条件化于 $ \mathbf{x} $ 对于生成连贯翻译至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。