[论文解读] Reinforcement Learning with Large Action Spaces for Neural Machine Translation
本文通过改进目标嵌入的初始化方式并冻结嵌入层,减少了动作空间的有效大小,从而提升了神经机器翻译(NMT)中的强化学习(RL)性能。采用高质量的BERT-based目标嵌入替代随机初始化的嵌入,使RL微调的BLEU平均提升1.5点,尤其在低概率词上表现更优,表明动作空间复杂度是RL应用于NMT时的关键瓶颈。
Applying Reinforcement learning (RL) following maximum likelihood estimation (MLE) pre-training is a versatile method for enhancing neural machine translation (NMT) performance. However, recent work has argued that the gains produced by RL for NMT are mostly due to promoting tokens that have already received a fairly high probability in pre-training. We hypothesize that the large action space is a main obstacle to RL's effectiveness in MT, and conduct two sets of experiments that lend support to our hypothesis. First, we find that reducing the size of the vocabulary improves RL's effectiveness. Second, we find that effectively reducing the dimension of the action space without changing the vocabulary also yields notable improvement as evaluated by BLEU, semantic similarity, and human evaluation. Indeed, by initializing the network's final fully connected layer (that maps the network's internal dimension to the vocabulary dimension), with a layer that generalizes over similar actions, we obtain a substantial improvement in RL performance: 1.5 BLEU points on average.
研究动机与目标
- 探究尽管强化学习具有理论优势,为何在神经机器翻译中带来的增益仍然有限。
- 识别大规模动作空间(词汇量)是强化学习在神经机器翻译中有效应用的关键障碍。
- 探索在不改变词汇量的前提下,降低动作空间有效维度的方法。
- 评估在神经机器翻译的强化学习微调中,目标嵌入的初始化与冻结对性能的影响。
- 对比MLE训练与基于BERT的目标嵌入在语义泛化能力上的差异。
提出的方法
- 用基于BERT的嵌入替换标准的随机初始化目标嵌入层,以提升语义泛化能力。
- 在强化学习微调过程中冻结基于BERT的目标嵌入层,以稳定学习过程并提升性能。
- 通过消融实验比较使用标准MLE嵌入与基于BERT的嵌入(是否冻结)在强化学习性能上的差异。
- 在低资源设置中减小词汇量,以评估其对强化学习增益的影响。
- 通过词对(同义词、词形变化、随机配对)的余弦相似度分析目标嵌入的语义泛化能力。
- 采用策略梯度强化学习方法,以BLEU作为奖励函数,微调预训练的MLE-NMT模型。
实验结果
研究问题
- RQ1减小词汇量是否能提升神经机器翻译中的强化学习性能?
- RQ2使用预训练的上下文嵌入(如BERT)初始化目标嵌入是否能增强强化学习的有效性?
- RQ3在强化学习微调过程中冻结目标嵌入是否能带来性能提升?
- RQ4基于BERT的目标嵌入与MLE训练的嵌入相比,在捕捉语义相似性方面表现如何?
- RQ5使用改进后的目标嵌入进行强化学习,是否能更好地优化MLE模型预测概率较低的目标词?
主要发现
- 减小词汇量在强化学习微调中带来了约1 BLEU点的显著平均提升,即使在MLE模型原本就不够准确的情况下也成立。
- 使用基于BERT的目标嵌入替代MLE训练的嵌入,使强化学习性能平均提升1.5 BLEU点。
- 在强化学习训练过程中冻结基于BERT的目标嵌入,可带来超越仅初始化改进的额外性能增益。
- BERT嵌入展现出显著更优的语义泛化能力,其同义词与词形变化词对的余弦相似度分布具有明显区分性,而MLE嵌入在所有词对类型中均呈现重叠分布。
- 使用基于BERT的嵌入进行强化学习,能改善MLE预训练阶段预测概率较低的目标词的预测表现,表明其优化范围更广。
- 基于BERT的初始化与目标嵌入冻结相结合,在自动评估指标(BLEU、语义相似度)和人工评估中均表现出一致的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。