Skip to main content
QUICK REVIEW

[论文解读] When and Why is Unsupervised Neural Machine Translation Useless?

Yunsu Kim, Graça, Miguel|arXiv (Cornell University)|Apr 22, 2020
Natural Language Processing Techniques参考文献 51被引用 10
一句话总结

本文研究了无监督神经机器翻译(NMT)在实际应用中何时以及为何会失败,表明当单语数据在语言和领域上存在显著差异时,其性能会严重下降。即使采用最先进的模型,仅使用50,000对双语句子的监督和半监督基线模型在低资源设置下也始终优于无监督系统,这使得无监督NMT在最需要它的场景下基本无效。

ABSTRACT

This paper studies the practicality of the current state-of-the-art unsupervised methods in neural machine translation (NMT). In ten translation tasks with various data settings, we analyze the conditions under which the unsupervised methods fail to produce reasonable translations. We show that their performance is severely affected by linguistic dissimilarity and domain mismatch between source and target monolingual data. Such conditions are common for low-resource language pairs, where unsupervised learning works poorly. In all of our experiments, supervised and semi-supervised baselines with 50k-sentence bilingual data outperform the best unsupervised results. Our analyses pinpoint the limits of the current unsupervised NMT and also suggest immediate research directions.

研究动机与目标

  • 评估无监督NMT在多样化语言对和数据设置下的实际有效性。
  • 识别无监督NMT在低资源和真实场景中的关键失败因素。
  • 确定当存在少量双语数据时,无监督NMT是否仍具可行性。
  • 为实践者提供关于何时使用无监督与监督/半监督方法的可操作指导。
  • 提出未来研究方向,以解决当前无监督NMT的核心局限。

提出的方法

  • 在五种语言对(德语-英语、俄语-英语、中文-英语、哈萨克语-英语和古吉拉特语-英语)上开展10项翻译任务。
  • 通过不同数量的双语数据(从50,000句话起)比较无监督NMT与监督及半监督基线模型的性能。
  • 改变单语数据的规模和领域,以评估在不同数据分布不匹配下的鲁棒性。
  • 使用共享的序列到序列模型,结合双向训练和通过去噪自编码器目标实现的回译。
  • 使用跨语言语言模型(LM)进行模型初始化,并分析初始化质量对最终性能的影响。
  • 对翻译输出进行定性分析,以诊断诸如输入词直接复制和错误数字映射等失败模式。

实验结果

研究问题

  • RQ1在何种数据和语言条件下,无监督NMT无法生成有意义的翻译?
  • RQ2源语言与目标语言之间的语言距离在多大程度上影响无监督NMT的性能?
  • RQ3单语源语料与目标语料之间的领域不匹配在多大程度上会降低无监督NMT的结果?
  • RQ4少量双语数据(例如50,000句话)是否能始终优于大规模无监督NMT系统?
  • RQ5初始跨语言语言模型的质量在多大程度上决定了最终翻译性能?

主要发现

  • 在所有实验中,仅使用50,000对双语句子的监督和半监督基线模型,其性能均优于最佳无监督NMT系统。
  • 单语语料之间的语言差异和领域不匹配是无监督NMT失败的主要原因,尤其在低资源设置下更为显著。
  • 无监督NMT的性能与初始跨语言语言模型的质量密切相关,后者是决定最终结果的关键因素。
  • 模型经常将输入词原样复制到输出中,尤其是在跨语言编码器未能有效隐藏输入语言身份时,这一问题在初始化不佳时尤为严重。
  • 即使使用了回译,模型在处理同音词或语境模糊词(例如“Four”与“Eight”)时仍表现不佳,原因在于对模糊语境的预训练不足。
  • 在编码器中使用语言嵌入会加剧复制问题;移除这些嵌入后,俄语-英语翻译的BLEU分数从4.3%提升至11.9%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。