[论文解读] Lexicons and Minimum Risk Training for Neural Machine Translation: NAIST-CMU at WAT2016
本文提出了一种增强的神经机器翻译系统,用于日语-英语翻译,通过整合离散翻译词典来改进概率估计,并采用最小风险训练以优化BLEU得分。结合这些技术与模型集成,该系统在WAT 2016基准测试中取得了最先进性能,在自动评估与人工评估中均优于强基线模型及竞争系统。
This year, the Nara Institute of Science and Technology (NAIST)/Carnegie Mellon University (CMU) submission to the Japanese-English translation track of the 2016 Workshop on Asian Translation was based on attentional neural machine translation (NMT) models. In addition to the standard NMT model, we make a number of improvements, most notably the use of discrete translation lexicons to improve probability estimates, and the use of minimum risk training to optimize the MT system for BLEU score. As a result, our system achieved the highest translation evaluation scores for the task.
研究动机与目标
- 通过改进概率估计与训练优化,提升神经机器翻译在日语-英语翻译任务上的性能。
- 探究离散翻译词典对NMT模型置信度与输出质量的影响。
- 评估最小风险训练在优化NMT模型以提升BLEU得分(而非最大似然)方面的有效性。
- 确定词元惩罚与模型集成是否能进一步提升翻译质量。
提出的方法
- 该系统采用基于双向LSTM与软注意力机制的注意力神经机器翻译模型,基于编码器-解码器架构。
- 通过可学习参数ε控制影响程度,将离散翻译词典整合以优化NMT模型的概率估计。
- 采用蒙特卡洛近似方法计算BLEU得分,实施最小风险训练,以最大化开发集上的期望BLEU得分来优化模型参数。
- 模型采用联合字节对编码(BPE)进行子词分割,并在解码过程中使用词元惩罚以控制输出长度。
- 通过在测试时对多个模型的预测词概率进行平均,实现模型集成,以提升鲁棒性与性能。
- 系统在ASPEC平行语料库中前200万句上进行训练,对两种语言均应用了归一化与分词处理。
实验结果
研究问题
- RQ1将离散翻译词典整合是否能提升神经机器翻译模型的准确度与可靠性?
- RQ2以BLEU得分为优化目标的最小风险训练,是否能带来优于最大似然训练的翻译质量?
- RQ3在日语-英语翻译背景下,不同注意力机制(点积注意力与MLP注意力)对翻译性能有何影响?
- RQ4词元惩罚与模型集成在多大程度上能提升BLEU与RIBES得分?
主要发现
- 使用ε = 10⁻⁵或10⁻⁶的词典,BLEU得分相比基线最高提升0.9分,最小风险训练下达到最高BLEU得分25.9。
- 与最大似然训练相比,最小风险训练使BLEU得分提升1.0–1.5分,最佳系统达到29.3 BLEU与77.3 RIBES。
- 多层感知机注意力机制优于点积注意力,在所有配置下均取得更高的BLEU与RIBES得分。
- 词元惩罚显著改善了输出长度控制,将长度比从1.01降低至0.97,并平均提升BLEU 1.8分。
- 集成六个模型使BLEU得分提升至27.3(最大似然)与29.3(最小风险),显著优于单个模型。
- 最小风险训练的集成模型在人工评估中获得48.25分,为该任务最高分,表明其具备出色的高质量人工评分表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。