Skip to main content
QUICK REVIEW

[论文解读] An Efficient Character-Level Neural Machine Translation

Shenjian Zhao, Zhihua Zhang|arXiv (Cornell University)|Aug 16, 2016
Natural Language Processing Techniques参考文献 17被引用 5
一句话总结

本文提出一种基于下采样器(decimator)和插值器(interpolator)的深层字符级神经机器翻译模型,通过下采样源序列和重采样解码输出,实现在无需大规模词表的情况下高效训练。该模型在BLEU得分上优于词级别模型,能正确翻译拼写错误的词汇,并学习到语义相似词汇的有意义词向量表示。

ABSTRACT

Neural machine translation aims at building a single large neural network that can be trained to maximize translation performance. The encoder-decoder architecture with an attention mechanism achieves a translation performance comparable to the existing state-of-the-art phrase-based systems on the task of English-to-French translation. However, the use of large vocabulary becomes the bottleneck in both training and improving the performance. In this paper, we propose an efficient architecture to train a deep character-level neural machine translation by introducing a decimator and an interpolator. The decimator is used to sample the source sequence before encoding while the interpolator is used to resample after decoding. Such a deep model has two major advantages. It avoids the large vocabulary issue radically; at the same time, it is much faster and more memory-efficient in training than conventional character-based models. More interestingly, our model is able to translate the misspelled word like human beings.

研究动机与目标

  • 通过在字符级别进行建模,解决词级别神经机器翻译中固有的未登录词(OOV)问题。
  • 克服传统字符级别模型因长序列和大上下文窗口导致的计算效率低下和训练困难问题。
  • 在不依赖词级别监督或词级别词表的前提下,实现深层循环网络在字符级别翻译中的端到端训练。
  • 在保留处理未知词或拼写错误词能力的同时,实现与最先进词级别模型相当或更优的翻译性能。
  • 证明字符级别建模能够学习到类似词级别模型的、语义上聚集的有意义词表示。

提出的方法

  • 提出一种基于改进GRU的下采样器,通过在词边界(如空格)处采样源字符序列,减少编码前的序列长度。
  • 应用一种基于改进GRU的插值器,按顺序生成目标字符,直至产生分隔符,从而实现无需词级别分词的自然解码。
  • 使用标准注意力机制,上下文向量由编码后的源表示计算得出,与Bahdanau等人(2014)的方法类似。
  • 通过时间反向传播端到端训练整个模型,将下采样器和插值器集成到RNN流程中,以保持梯度流动。
  • 利用语言的分层结构(以词为单位),通过分隔符作为控制点实现序列压缩与生成。
  • 应用t-SNE可视化分析学习到的词表示,显示语义相似词汇在向量空间中聚集,且拼写错误变体彼此接近。

实验结果

研究问题

  • RQ1字符级别神经机器翻译模型能否在避免大规模词表的前提下,实现与词级别模型相当或更优的性能?
  • RQ2所提出的下采样器-插值器架构能否显著降低标准字符级别模型的训练时间与内存消耗?
  • RQ3该模型能否在不依赖词级别查找或<unk>标记的情况下,成功翻译未登录词(OOV)和拼写错误的词汇?
  • RQ4通过该架构进行字符级别建模是否能保留词汇之间的语义关系,表现为嵌入空间中语义相似词汇的聚类?
  • RQ5随着循环网络深度的增加,该模型的性能提升程度如何?与Ling等人(2015b)等先前的字符级别方法相比表现如何?

主要发现

  • 所提出的DCNMT模型在WMT 2014英语到法语翻译任务上取得38.7的BLEU得分,优于词级别模型(37.8 BLEU)和Ling等人(2015b)的字符级别模型。
  • 该模型能正确翻译拼写错误的词汇,如“responisble”和“exrecise”,生成准确的法语翻译,且无需依赖<unk>标记。
  • t-SNE可视化显示,语义相似词汇如“exercise”和“exrecise”在向量空间中彼此靠近,表明模型具备语义学习能力。
  • “April”、“February”、“January”、“June”和“July”等词汇在嵌入空间中聚类在一起,证明模型能从字符级别模式中学习到语义相似性。
  • 下采样器显著减少了有效输入序列长度,使训练速度明显快于标准字符级别模型,且内存效率更高。
  • 即使使用更深的GRU网络,该模型仍保持高性能,表明其具备可扩展性,并且在更深架构下仍有进一步提升的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。