Skip to main content
QUICK REVIEW

[论文解读] Extract and Edit: An Alternative to Back-Translation for Unsupervised Neural Machine Translation

Jiawei Wu, Xin Wang|arXiv (Cornell University)|Apr 4, 2019
Natural Language Processing Techniques参考文献 38被引用 4
一句话总结

本文提出了一种名为 Extract-Edit 的新型无监督神经机器翻译方法,该方法通过从真实目标语句中提取并编辑句子来替代后翻译(back-translation),从而生成高质量的训练信号。通过引入一种对比性翻译损失,使模型的翻译结果相对于这些真实句子对进行优化,该方法在四个语言对上均取得了当前最优性能,相比先前方法的 BLEU 分数提升了 2.0 至 3.63 分。

ABSTRACT

The overreliance on large parallel corpora significantly limits the applicability of machine translation systems to the majority of language pairs. Back-translation has been dominantly used in previous approaches for unsupervised neural machine translation, where pseudo sentence pairs are generated to train the models with a reconstruction loss. However, the pseudo sentences are usually of low quality as translation errors accumulate during training. To avoid this fundamental issue, we propose an alternative but more effective approach, extract-edit, to extract and then edit real sentences from the target monolingual corpora. Furthermore, we introduce a comparative translation loss to evaluate the translated target sentences and thus train the unsupervised translation systems. Experiments show that the proposed approach consistently outperforms the previous state-of-the-art unsupervised machine translation systems across two benchmarks (English-French and English-German) and two low-resource language pairs (English-Romanian and English-Russian) by more than 2 (up to 3.63) BLEU points.

研究动机与目标

  • 为解决无监督 NMT 中后翻译的根本性局限,即由于低质量伪平行句导致的翻译错误累积,从而降低模型性能。
  • 开发一种利用单语目标语料中真实、高质量句子对来引导无监督训练的方法,避免分布漂移。
  • 提出一种对比性翻译损失,基于与提取并编辑后的真实句子的相对相似性来评估翻译结果,从而提升对齐性和泛化能力。
  • 实现在无需平行语料的情况下完全无监督训练,使该方法适用于低资源语言对。

提出的方法

  • 利用源句与目标句之间的语义相似性,从目标单语语料中提取潜在的平行句候选对。
  • 应用编辑机制对提取的句子进行修订,使其在语义上与源句对齐,从而提升流畅度和相关性。
  • 制定一种对比性翻译损失,使模型的翻译结果相对于其他候选句,与提取并编辑后的最佳目标句相似度最大化。
  • 仅使用单语语料,以端到端、完全无监督的方式,联合训练提取-编辑模块与 NMT 模型。
  • 在提取过程中使用双注意力机制对齐源句与目标句,确保语义一致性。
  • 利用语言建模和初始化技术(如双语词典映射)在缺乏平行数据的情况下稳定训练。

实验结果

研究问题

  • RQ1能否从单语目标语料中提取的真实句子对,作为无监督 NMT 中比后翻译生成的伪句对更可靠的训练信号?
  • RQ2与标准重建损失相比,基于多个提取并编辑后的候选句相对评估的对比性翻译损失是否能提升模型性能?
  • RQ3该提取-编辑框架在包括英语-罗马尼亚语和英语-俄语等低资源语言对在内的多种语言对上表现如何?
  • RQ4该方法在多大程度上缓解了后翻译中因错误累积导致的分布漂移问题?
  • RQ5该提取-编辑方法能否推广到机器翻译之外的无监督学习任务?

主要发现

  • Extract-Edit 方法在所有评估的语言对上均持续优于先前的无监督 NMT 最先进系统(Lample et al., 2018b)。
  • 在英语-法语和英语-德语基准上,该方法实现了超过 2.0 BLEU 分的提升,最高达 3.63 BLEU 分。
  • 该方法在低资源语言对(如英语-罗马尼亚语和英语-俄语)上表现出强大的泛化能力,尽管平行数据有限,但性能提升显著。
  • 对比性翻译损失有效引导模型生成与真实高质量目标句更一致的翻译,而非与伪句对更接近。
  • 该方法通过依赖真实目标句,避免了后翻译中固有的错误累积,从而减少了分布漂移。
  • 实证结果证实,无论在高资源还是低资源设置下,Extract-Edit 均比后翻译更有效,验证了其鲁棒性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。