Skip to main content
QUICK REVIEW

[论文解读] MAD for Robust Reinforcement Learning in Machine Translation

Domenic Donato, Lei Yu|arXiv (Cornell University)|Jul 18, 2022
Natural Language Processing Techniques被引用 5
一句话总结

本文提出MAD,一种用于神经机器翻译中鲁棒强化学习的分布式策略梯度算法,通过结合条件奖励归一化与基于平均绝对偏差(MAD)的鲁棒重要性加权方案,提升了训练稳定性和泛化能力。MAD在交叉熵微调基础上实现了平均2.0 BLEU的性能提升,并降低了对束搜索超参数的敏感性。

ABSTRACT

We introduce a new distributed policy gradient algorithm and show that it outperforms existing reward-aware training procedures such as REINFORCE, minimum risk training (MRT) and proximal policy optimization (PPO) in terms of training stability and generalization performance when optimizing machine translation models. Our algorithm, which we call MAD (on account of using the mean absolute deviation in the importance weighting calculation), has distributed data generators sampling multiple candidates per source sentence on worker nodes, while a central learner updates the policy. MAD depends crucially on two variance reduction strategies: (1) a conditional reward normalization method that ensures each source sentence has both positive and negative reward translation examples and (2) a new robust importance weighting scheme that acts as a conditional entropy regularizer. Experiments on a variety of translation tasks show that policies learned using the MAD algorithm perform very well when using both greedy decoding and beam search, and that the learned policies are sensitive to the specific reward used during training.

研究动机与目标

  • 解决现有奖励感知训练方法在神经机器翻译中训练不稳定和泛化能力差的问题。
  • 在不依赖脆弱辅助评论网络的前提下,降低策略梯度估计的方差。
  • 通过确保每条源句的高奖励与低奖励翻译采样多样化且均衡,提升策略鲁棒性。
  • 通过温度范围采样实现高效超参数调优,降低计算成本。
  • 证明所学习的策略对训练过程中使用的奖励函数具有敏感性,确认其为奖励驱动学习。

提出的方法

  • 该算法采用分布式设置,多个工作节点从略微过时的策略中,使用一系列采样温度生成多样化的翻译候选。
  • 对每个源句应用条件奖励归一化,通过将奖励围绕经验均值中心化并按标准差缩放,确保每个批次中同时包含正负奖励样本。
  • 提出一种基于平均绝对偏差(MAD)的新型鲁棒重要性加权方案,作为条件熵正则化器,聚焦于略微偏离当前策略的轨迹,以维持探索性与稳定性。
  • 中央学习器使用归一化奖励与MAD权重计算的策略梯度更新策略,实现小而保守的更新。
  • 该方法避免依赖批量基线或辅助值网络,转而利用每个输入的多个采样翻译的经验奖励统计量。
  • 在采样过程中使用温度范围,以减少超参数调优所需的搜索次数,提升超参数搜索效率。

实验结果

研究问题

  • RQ1分布式策略梯度算法能否提升神经机器翻译中序列级强化学习的训练稳定性和泛化能力?
  • RQ2确保每个输入同时包含正负奖励样本的条件奖励归一化,是否能改善策略学习?
  • RQ3基于平均绝对偏差的鲁棒重要性加权方案,能否提升样本多样性并降低策略更新的方差?
  • RQ4所学习的策略在不同奖励函数下的泛化程度如何?其是否特异性地适应了训练期间使用的奖励函数?
  • RQ5与单一温度相比,使用温度范围是否能减少达到最优性能所需的超参数调优次数?

主要发现

  • MAD算法在多个翻译任务的保留测试集上,相对于初始的交叉熵微调模型,实现了平均2.0 BLEU的性能提升。
  • MAD在训练稳定性和泛化性能方面,优于REINFORCE、MRT和PPO等强基线模型。
  • 所学习的策略对束搜索超参数的敏感性更低,即使在更大的束宽下也表现出极小的性能下降。
  • 条件奖励归一化被识别为算法成功的关键组件,显著提升了性能与稳定性。
  • MAD重要性加权方案增强了样本多样性,并在多个训练步骤中促进了稳定且保守的策略更新。
  • 使用不同奖励函数训练的模型能良好泛化到各自对应的评估指标,证实策略学习到了特定于奖励的行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。