Skip to main content
QUICK REVIEW

[论文解读] Novel Applications of Factored Neural Machine Translation

Patrick Wilken, Evgeny Matusov|arXiv (Cornell University)|Oct 9, 2019
Natural Language Processing Techniques参考文献 21被引用 9
一句话总结

本文通过使用目标端因子来预测词性大小写、子词分段和操作序列NMT(OSNMT)中的特殊标记,提出了因子化神经机器翻译(FNMT)的新应用。该方法在不损失翻译质量的前提下提升了解码效率,并有效处理了OOV词,由于序列长度减少,在OSNMT中实现了显著的BLEU提升,同时在英德和英土翻译任务中保持了速度与性能。

ABSTRACT

In this work, we explore the usefulness of target factors in neural machine translation (NMT) beyond their original purpose of predicting word lemmas and their inflections, as proposed by Garcìa-Martìnez et al., 2016. For this, we introduce three novel applications of the factored output architecture: In the first one, we use a factor to explicitly predict the word case separately from the target word itself. This allows for information to be shared between different casing variants of a word. In a second task, we use a factor to predict when two consecutive subwords have to be joined, eliminating the need for target subword joining markers. The third task is the prediction of special tokens of the operation sequence NMT model (OSNMT) of Stahlberg et al., 2018. Automatic evaluation on English-to-German and English-to-Turkish tasks showed that integration of such auxiliary prediction tasks into NMT is at least as good as the standard NMT approach. For the OSNMT, we observed a significant improvement in BLEU over the baseline OSNMT implementation due to a reduced output sequence length that resulted from the introduction of the target factors.

研究动机与目标

  • 将因子化NMT的应用从词干和词形标注扩展到神经机器翻译中的辅助预测任务。
  • 通过在每一步解码中利用目标因子预测多个目标词元,减少序列长度,提升推理速度。
  • 通过显式共享不同词性变体之间的信息,缓解低资源设置下的数据稀疏问题。
  • 通过将特殊控制标记因子化,改进操作序列NMT(OSNMT)模型,减少序列长度并提升性能。

提出的方法

  • 一种因子化解码器架构在每一步解码中生成两个输出:主目标词元和用于辅助预测(如大小写或分段)的因子。
  • 词性大小写因子使用独立的softmax层,基于解码器状态和主词元嵌入预测大写/小写变体。
  • 分段因子预测两个连续子词是否应合并,从而消除子词分词中对'@@'等合并标记的依赖。
  • 在OSNMT中,一个因子用于预测特殊操作标记(如'SRC_POP'),实现每步预测多个操作,减少解码步数。
  • 模型通过主输出与因子输出的联合交叉熵损失进行端到端训练,束搜索算法被调整以同时考虑两个输出。
  • 该方法在英德与英土翻译任务上通过BLEU、TER和解码速度指标进行评估。

实验结果

研究问题

  • RQ1目标端因子能否有效用于预测词性大小写,从而在不增加推理成本的前提下提升泛化能力?
  • RQ2使用因子预测子词合并决策是否能改善复合词的翻译,尤其是未见复合词?
  • RQ3因子化NMT能否通过每步预测多个操作来减少OSNMT中的序列长度,从而实现更快的解码与更好的性能?
  • RQ4在低资源设置下,因子化NMT与标准NMT和Truecasing相比,在词性大小写预测中表现如何?
  • RQ5通过因子化整合辅助预测任务,是否仅提升序列效率,还是也提升了翻译质量?

主要发现

  • 大小写因子在英德newstest2019上达到37.9%的BLEU得分,与使用真大小写子词的基线持平,表明翻译质量未下降。
  • 分段因子显著改善了未见复合词的翻译效果——例如'@show-jumping stadium'和'technology legend',基线模型会原样复制这些词。
  • 因子化OSNMT模型减少了输出序列长度,并在BLEU上显著优于非因子化基线,证明了联合预测控制标记的益处。
  • 因子化后解码速度几乎保持不变,因为第二因子的输出空间较小,且主词表减少,抵消了计算成本。
  • 在低资源设置下,大小写因子相比基线表现出可测量的改进,表明通过共享表示更好地缓解了数据稀疏问题。
  • 该模型在两种语言对上均保持了稳定的性能,证实辅助因子化不会损害翻译质量,同时实现了结构上的优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。