Skip to main content
QUICK REVIEW

[论文解读] A Study of Reinforcement Learning for Neural Machine Translation

Lijun Wu, Fei Tian|arXiv (Cornell University)|Aug 27, 2018
Natural Language Processing Techniques参考文献 30被引用 19
一句话总结

本文对使用深度模型和大规模平行语料及单语语料,应用强化学习(RL)训练最先进神经机器翻译(NMT)模型进行了系统研究。提出了一种新颖方法,联合利用源语言和目标语言单语数据与RL训练,使WMT17中文-英文翻译任务的BLEU得分达到26.73的新SOTA水平,较强基线模型高出近1.5 BLEU点。

ABSTRACT

Recent studies have shown that reinforcement learning (RL) is an effective approach for improving the performance of neural machine translation (NMT) system. However, due to its instability, successfully RL training is challenging, especially in real-world systems where deep models and large datasets are leveraged. In this paper, taking several large-scale translation tasks as testbeds, we conduct a systematic study on how to train better NMT models using reinforcement learning. We provide a comprehensive comparison of several important factors (e.g., baseline reward, reward shaping) in RL training. Furthermore, to fill in the gap that it remains unclear whether RL is still beneficial when monolingual data is used, we propose a new method to leverage RL to further boost the performance of NMT systems trained with source/target monolingual data. By integrating all our findings, we obtain competitive results on WMT14 English- German, WMT17 English-Chinese, and WMT17 Chinese-English translation tasks, especially setting a state-of-the-art performance on WMT17 Chinese-English translation task.

研究动机与目标

  • 解决将强化学习应用于大规模、深度NMT模型时面临的不稳定性和实际挑战。
  • 研究在竞争性NMT架构上有效的RL训练策略,如奖励设计、基线奖励和方差减少。
  • 探索将源语言和目标语言单语数据与RL训练相结合的方法,填补文献中此前未解决的空白。
  • 在主要NMT基准测试中实现最先进性能,特别是WMT17中文-英文任务。

提出的方法

  • 提出一种统一的RL训练框架,将最大似然估计(MLE)和RL目标通过自适应加权结合,以稳定训练过程。
  • 在奖励计算中采用多项式采样而非束搜索,提升序列级优化效果。
  • 提出一种新颖方法,将源语言和目标语言单语数据有效整合到基于RL的NMT训练中,增强模型泛化能力。
  • 应用标准RL技术,如基线奖励和奖励塑造,并通过实证分析其影响。
  • 使用演员-评论家和REINFORCE风格的策略优化,以序列级BLEU作为奖励信号。
  • 采用混合训练策略:先在平行语料上用MLE进行预训练,再使用平行语料和单语语料通过RL进行微调。

实验结果

研究问题

  • RQ1在基于RL的NMT训练中,多项式采样与束搜索在奖励计算方面有何差异?
  • RQ2基线奖励和奖励塑造对深度NMT模型中RL训练的稳定性和性能有何影响?
  • RQ3如何有效整合源语言和目标语言单语数据与RL训练,以提升翻译质量?
  • RQ4当与大规模单语数据结合时,RL在强MLE基线NMT系统中是否仍能带来性能提升?
  • RQ5在端到端训练中,MLE与RL目标之间的最优平衡是什么,以实现稳健性能?

主要发现

  • 使用多项式采样进行奖励计算显著优于束搜索,在WMT17中文-英文任务上BLEU得分最高提升0.5点。
  • 通过合理加权结合MLE与RL目标,可稳定训练过程,并在所有任务中实现一致的性能提升。
  • 基线奖励和奖励塑造技术仅带来微小改进,其影响远小于合适的采样方法和训练策略。
  • 结合源语言和目标语言单语数据与RL训练可显著提升性能:最终模型在WMT17中文-英文任务上达到26.73 BLEU,较仅使用单语数据的MLE模型提升0.6点。
  • 最终模型在WMT17中文-英文任务上创下新SOTA,较最佳集成系统高出1.5 BLEU点。
  • 在WMT14英文-德文和WMT17英文-中文任务上,该方法也取得了具有竞争力的结果,证实了其广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。