Skip to main content
QUICK REVIEW

[论文解读] Toward a full-scale neural machine translation in production: the Booking.com use case

Pavel Levin, Nishikant Dhanuka|arXiv (Cornell University)|Sep 18, 2017
Natural Language Processing Techniques参考文献 15被引用 8
一句话总结

本文介绍了 Booking.com 的生产级神经机器翻译(NMT)系统,该系统基于大规模双语语料库并结合领域特定调优,专为旅游领域优化。结果表明,结合使用 Adam 优化器与学习率衰减、预处理命名实体,以及采用业务敏感性框架进行错误检测,其性能优于仅依赖 BLEU 的质量评估。人工评估显示,尽管 BLEU 分数未体现该趋势,但使用更大规模训练语料(1000 万句)可显著提升翻译质量。

ABSTRACT

While some remarkable progress has been made in neural machine translation (NMT) research, there have not been many reports on its development and evaluation in practice. This paper tries to fill this gap by presenting some of our findings from building an in-house travel domain NMT system in a large scale E-commerce setting. The three major topics that we cover are optimization and training (including different optimization strategies and corpus sizes), handling real-world content and evaluating results.

研究动机与目标

  • 开发一个可扩展、高质量的 NMT 系统,专为大型电子商务环境下的旅游领域定制。
  • 评估不同优化策略(SGD、Adam、Adagrad、Adadelta)在单 GPU 和多 GPU 环境下的表现,以实现更快收敛和更优性能。
  • 通过预处理命名实体和应用 BPE 分词技术,提升罕见词和领域特定术语的翻译质量。
  • 建立一个结合自动评估(BLEU)与人工评估的稳健评估流程,包括使用业务敏感性框架检测关键错误。
  • 证明仅依赖 BLEU 分数无法有效追踪 NMT 系统的改进,尤其是在领域特定场景下。

提出的方法

  • 使用 OpenNMT 训练编码器-解码器 NMT 模型,采用双向 LSTM 编码器和解码器,引入残差连接与 dropout(0.3)。
  • 应用输入馈送注意力机制和欧洲语言的大小写特征,以提升对齐效果与语言流畅性。
  • 采用字节对编码(BPE)处理罕见词与 OOV(未登录词),提升低资源及领域特定术语的泛化能力。
  • 通过 word2vec 基于种子扩展与关键词匹配技术,对命名实体(如酒店设施、地点)进行预处理,以提升翻译准确性。
  • 实现一个业务敏感性框架(BSF),采用两个线性模型分类器(源端与目标端)检测源文本与翻译文本之间关键要素(如停车、宠物政策)的不匹配。
  • 结合自动 BLEU 评分与人工评估的充分性与流畅性评分,并使用保留集验证 BSF 的性能。

实验结果

研究问题

  • RQ1在单 GPU 环境下,不同优化算法(SGD、Adam、Adagrad、Adadelta)在旅游领域 NMT 系统中的收敛速度与翻译质量表现如何比较?
  • RQ2将训练双语语料规模从 100 万句增加到 1000 万句,对翻译质量的提升程度如何?评估指标包括人工评估与 BLEU 分数。
  • RQ3BPE 分词与命名实体预处理在提升罕见词与领域特定术语翻译质量方面的有效性如何?
  • RQ4在生产级 NMT 系统中,BLEU 分数与人工评估的流畅性与充分性指标之间的相关性如何?
  • RQ5业务敏感性框架能否有效检测出标准指标所遗漏的关键翻译错误(如错误的设施信息)?

主要发现

  • 在第 15 个训练周期后,SGD 搭配学习率衰减在困惑度与 BLEU 分数上均优于 Adam 与 Adadelta,尽管 Adam 初始收敛更快。
  • Adagrad 表现较差,20 个周期后 BLEU 分数仅为 3.14,而 SGD 达到了 46.58 的 BLEU 分数。
  • 业务敏感性框架在检测英德翻译中“停车可用性”错误方面达到了 97% 的 F1 分数,各类别均保持高精确率与高召回率。
  • 人工评估显示,使用 1000 万句语料训练的模型在充分性与流畅性评分上最高,尽管 BLEU 分数未体现该改进。
  • BLEU 分数与人工评估指标之间相关性微弱,表明在领域特定场景下,仅依赖 BLEU 无法准确反映真实世界的翻译质量。
  • 异步 SGD 并行化显著缩短了训练时间,从而在大规模生产级 NMT 开发中实现了更快的迭代周期。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。