Skip to main content
QUICK REVIEW

[论文解读] Machine Translation at Booking.com: Journey and Lessons Learned

Pavel Levin, Nishikant Dhanuka|arXiv (Cornell University)|Jul 25, 2017
Natural Language Processing Techniques参考文献 11被引用 8
一句话总结

本文介绍了Booking.com从统计机器翻译(SMT)系统向神经机器翻译(NMT)系统的迁移,通过自动评估和人工评估对两者进行了比较。NMT系统显著优于SMT系统和通用引擎,尤其在流畅性和充分性方面表现更优,且在两种系统中,句子长度对翻译质量均有可测量的负面影响,尽管NMT对长输入更具鲁棒性。

ABSTRACT

We describe our recently developed neural machine translation (NMT) system and benchmark it against our own statistical machine translation (SMT) system as well as two other general purpose online engines (statistical and neural). We present automatic and human evaluation results of the translation output provided by each system. We also analyze the effect of sentence length on the quality of output for SMT and NMT systems.

研究动机与目标

  • 评估新开发的神经机器翻译(NMT)系统与现有统计机器翻译(SMT)系统及两种通用在线翻译引擎的性能表现。
  • 分析句子长度对SMT和NMT系统中翻译质量的影响。
  • 通过自动评估和人工评估指标,提供全面的比较。
  • 记录在生产环境中部署NMT时遇到的实际挑战与经验教训。

提出的方法

  • 为Booking.com特定领域内容量身定制的神经机器翻译(NMT)系统的开发与部署。
  • 作为对比基线,实施了统计机器翻译(SMT)系统。
  • 与两个外部通用在线翻译引擎(一个统计模型,一个神经网络模型)进行集成与基准测试。
  • 使用自动评估指标(如BLEU、METEOR)和人工评估对翻译质量进行评估。
  • 系统性分析不同句子长度下的翻译质量,以评估系统的鲁棒性。
  • 收集并分析聚焦于流畅性、充分性和整体质量的人工评估数据。

实验结果

研究问题

  • RQ1领域特定的NMT系统与内部SMT系统及通用在线引擎相比,其翻译质量如何?
  • RQ2句子长度对SMT和NMT系统中翻译质量有何影响?
  • RQ3人工评估者如何评价NMT与SMT及外部引擎生成的翻译在流畅性和充分性方面的表现?
  • RQ4在真实世界电商生产环境中部署NMT时面临的主要挑战与经验教训是什么?

主要发现

  • 定制的NMT系统在自动评估和人工评估中均优于内部SMT系统,尤其在流畅性和充分性方面有显著提升。
  • NMT系统的BLEU和METEOR得分均高于SMT系统和通用引擎,表明其自动评估性能更优。
  • 人工评估确认,NMT生成的翻译在流畅性和充分性方面评分更高,且与SMT输出相比具有统计学上显著的偏好优势。
  • 较长的句子对SMT和NMT系统的翻译质量均有负面影响,但NMT系统对句子长度增加表现出更强的鲁棒性。
  • 通用神经引擎的表现优于统计引擎,但仍不及Booking.com的定制NMT系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。