Skip to main content
QUICK REVIEW

[论文解读] A Comparison of Approaches to Document-level Machine Translation

Zhiyi Ma, Sergey Edunov|arXiv (Cornell University)|Jan 26, 2021
Natural Language Processing Techniques参考文献 40被引用 7
一句话总结

本文评估了多种文档级机器翻译方法,发现一种简单的方法——对单语文档级数据进行回译——在自动指标和人工评估中均表现不亚于或优于复杂、计算密集型模型(如DocRepair和NoisyChannelDoc)。其主要贡献在于确立了对文档级单语数据进行回译作为未来研究的强大且高效的基线方法。

ABSTRACT

Document-level machine translation conditions on surrounding sentences to produce coherent translations. There has been much recent work in this area with the introduction of custom model architectures and decoding algorithms. This paper presents a systematic comparison of selected approaches from the literature on two benchmarks for which document-level phenomena evaluation suites exist. We find that a simple method based purely on back-translating monolingual document-level data performs as well as much more elaborate alternatives, both in terms of document-level metrics as well as human evaluation.

研究动机与目标

  • 在标准化基准上系统比较最先进的文档级机器翻译方法。
  • 评估单语数据增强技术(尤其是回译)在提升文档级连贯性方面的有效性。
  • 评估复杂架构和解码算法是否能为简单、数据增强基线带来显著性能提升。
  • 验证文档级一致性指标和人工评估在区分上下文感知翻译系统与句子级模型方面的实用性。
  • 为未来文档级机器翻译研究建立一个强大且简洁的基线。

提出的方法

  • 作者在通过将目标语单语文档回译为源语言而生成的合成平行数据上,训练标准的序列到序列模型,该方法使用文档级单语数据进行回译。
  • 将该方法(DocBT)与更复杂的模型进行比较,包括DocRepair(用于不一致修正的往返翻译)和NoisyChannelDoc(结合文档级语言模型的神经噪声信道建模)。
  • 评估包括标准BLEU分数、文档级一致性指标(如代词共指)、以及对100个随机抽取的测试样本进行的人工偏好判断。
  • 研究使用两个基准数据集:WMT17英语到德语数据集和用于代词选择的对比性测试集。
  • 结果在多种指标上进行分析,包括在正向翻译测试集上的BLEU分数和用于缓解与人工判断相关性问题的反向BLEU分数。
  • 人工评估聚焦于DocBT与句子级基线(Sent)及更复杂模型(NoisyChannelDoc)之间的偏好比较。

实验结果

研究问题

  • RQ1与复杂、定制化架构相比,对文档级单语数据进行回译是否能产生具有竞争力的文档级翻译性能?
  • RQ2文档级一致性指标与人工评估在区分上下文感知模型与句子级模型方面表现如何?
  • RQ3相较于简单的数据增强方法,额外的单语数据和复杂解码策略能在多大程度上提升性能?
  • RQ4BLEU是否是评估文档级翻译的可靠指标,尤其是在正向翻译测试集上?
  • RQ5像DocBT这样简单高效的模型是否能在人工偏好研究中超越更复杂的模型(如NoisyChannelDoc和DocRepair)?

主要发现

  • DocBT方法(即对文档级单语数据进行回译)在WMT17英语到德语翻译任务中,BLEU分数与NoisyChannelDoc和DocRepair等更复杂模型相当或更优。
  • 在对比性代词选择任务中,DocBT的一致性得分为0.81,优于句子级基线(0.50),并与DocRepair(0.80)表现相当。
  • 在人工偏好评估中,DocBT显著优于句子级基线(p=0.05),且在偏好度上也明显优于NoisyChannelDoc,首次评估中62%的评分者偏好DocBT,第二次评估中为60%。
  • 在Doc2Doc模型中加入单语文档数据(Doc2Doc + DocBT)提升了性能,但进一步增加单语数据并未使DocBT性能超过其基础水平。
  • NoisyChannelDoc在一致性指标(0.62)和人工评估(32%偏好)中表现较差,表明其从句子级模型生成n-best列表存在局限性。
  • 在德语-英语newstest2019上的反向BLEU分数确认,DocBT和DocBT + Doc2Doc均取得最高分,表明在正向翻译数据上表现强劲,而标准BLEU在此类数据上可靠性较低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。