Skip to main content
QUICK REVIEW

[论文解读] Fill in the Blanks: Imputing Missing Sentences for Larger-Context Neural Machine Translation

Sébastien Jean, Ankur Bapna|arXiv (Cornell University)|Oct 30, 2019
Natural Language Processing Techniques参考文献 31被引用 5
一句话总结

本文提出通过随机上下文、部分复制启发式方法或语言模型生成的上下文来填补文档级神经机器翻译中的缺失上下文。复制启发式方法显著提升了词汇连贯性和长距离现象的处理能力,而随机上下文尽管BLEU分数相似,却损害了性能,后翻译则同时提升了BLEU分数和挑战集表现。

ABSTRACT

Most neural machine translation systems still translate sentences in isolation. To make further progress, a promising line of research additionally considers the surrounding context in order to provide the model potentially missing source-side information, as well as to maintain a coherent output. One difficulty in training such larger-context (i.e. document-level) machine translation systems is that context may be missing from many parallel examples. To circumvent this issue, two-stage approaches, in which sentence-level translations are post-edited in context, have recently been proposed. In this paper, we instead consider the viability of filling in the missing context. In particular, we consider three distinct approaches to generate the missing context: using random contexts, applying a copy heuristic or generating it with a language model. In particular, the copy heuristic significantly helps with lexical coherence, while using completely random contexts hurts performance on many long-distance linguistic phenomena. We also validate the usefulness of tagged back-translation. In addition to improving BLEU scores as expected, using back-translated data helps larger-context machine translation systems to better capture long-range phenomena.

研究动机与目标

  • 解决在平行数据中仅部分上下文可用时,训练文档级神经机器翻译所面临的挑战。
  • 评估不同上下文补全技术对模型性能的影响,超越BLEU分数的衡量。
  • 验证带标签后翻译在提升文档级翻译中长距离语言现象建模方面的有效性。
  • 证明即使BLEU分数保持相似,数据补全技术对特定语言现象的模型行为仍有显著影响。

提出的方法

  • 使用随机句子对作为基线,填补缺失的源端上下文。
  • 应用部分复制启发式方法,将同一源-目标对的多个副本与随机句子结合,以提升词汇连贯性。
  • 使用语言模型生成目标端上下文,并通过后翻译获得源端上下文。
  • 从训练数据中检索相似的句子对,作为缺失样本的上下文。
  • 在原始数据和补全数据上训练上下文感知模型,使用后翻译增强训练集。
  • 在针对特定长距离现象(如指示代词、词汇连贯性和省略)的挑战集上评估模型。

实验结果

研究问题

  • RQ1在标准BLEU分数之外,填补缺失上下文如何影响文档级机器翻译的性能?
  • RQ2在随机、复制启发式和语言模型生成这三种上下文补全技术中,哪一种在长距离语言现象上的表现最佳?
  • RQ3带标签后翻译在多大程度上改善了文档级翻译中跨句依赖关系的建模?
  • RQ4为何在使用随机上下文时,BLEU分数未能反映性能下降,尽管挑战集上已明显出现负面影响?
  • RQ5简单的复制启发式方法是否能在捕捉词汇连贯性方面超越更复杂的上下文生成方法?

主要发现

  • 部分复制启发式方法在词汇连贯性准确率上达到90.1%,显著优于随机上下文和基线模型。
  • 使用随机上下文使挑战集上的平均性能下降3.65%,尽管对BLEU分数影响微乎其微。
  • 后翻译在所有四个挑战集上均提升了性能,当与上下文增强结合时,所有测试集的准确率均达到86.1%或以上。
  • 使用复制启发式方法训练的上下文感知模型在词汇连贯性上学习更快且泛化能力更强,优于使用随机或生成上下文的模型。
  • DocRepair模型(后编辑方法)在指示代词挑战集上表现优于所有单次通过模型(91.8% vs. 89.6%),但单次通过模型在词汇连贯性和动词短语省略任务上仍表现更优。
  • 即使使用更大的模型和后翻译,基于随机上下文训练的模型在挑战集上仍表现欠佳,表明数据质量对长距离现象至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。