[论文解读] Fast Sequence Generation with Multi-Agent Reinforcement Learning
该论文提出一种基于反事实关键多智能体强化学习(CMAL)的非自回归序列生成模型,其中每个标记位置作为一个协作智能体,以BLEU等句级奖励为目标进行优化。该方法在图像字幕和机器翻译基准上实现了最先进性能,推理速度相比自回归模型最高提升17.46倍,显著改善了基于交叉熵训练的非自回归模型在生成一致性方面的缺陷。
Autoregressive sequence Generation models have achieved state-of-the-art performance in areas like machine translation and image captioning. These models are autoregressive in that they generate each word by conditioning on previously generated words, which leads to heavy latency during inference. Recently, non-autoregressive decoding has been proposed in machine translation to speed up the inference time by generating all words in parallel. Typically, these models use the word-level cross-entropy loss to optimize each word independently. However, such a learning process fails to consider the sentence-level consistency, thus resulting in inferior generation quality of these non-autoregressive models. In this paper, we propose a simple and efficient model for Non-Autoregressive sequence Generation (NAG) with a novel training paradigm: Counterfactuals-critical Multi-Agent Learning (CMAL). CMAL formulates NAG as a multi-agent reinforcement learning system where element positions in the target sequence are viewed as agents that learn to cooperatively maximize a sentence-level reward. On MSCOCO image captioning benchmark, our NAG method achieves a performance comparable to state-of-the-art autoregressive models, while brings 13.9x decoding speedup. On WMT14 EN-DE machine translation dataset, our method outperforms cross-entropy trained baseline by 6.0 BLEU points while achieves the greatest decoding speedup of 17.46x.
研究动机与目标
- 解决非自回归序列生成模型中的解码不一致性问题,该问题虽具备高速推理能力,但句级连贯性较差。
- 克服词级交叉熵损失的局限性,该损失无法优化BLEU或CIDEr等不可微的句级指标。
- 通过使用句级奖励进行强化学习,实现非自回归模型的端到端优化,提升全局连贯性。
- 在不牺牲生成质量的前提下实现高速推理,使非自回归模型适用于实时工业应用。
- 通过利用协作式多智能体学习,提升长序列上的性能,以维持结构一致性。
提出的方法
- 将非自回归序列生成建模为协作式多智能体强化学习(MARL)系统,其中每个标记位置被视为一个智能体。
- 使用共享的Transformer解码器并引入自注意力机制,以在序列生成过程中实现智能体间的通信。
- 将句级奖励(如BLEU或CIDEr)定义为团队奖励,以优化整体句级质量。
- 采用带有反事实基线的策略梯度方法,解决多智能体信用分配问题并稳定训练过程。
- 通过引入未标注输入数据增强训练集,以提升泛化能力与生成质量。
- 采用组合式反事实基线,估算仅一个智能体改变动作时的期望回报,从而提高策略梯度信号效率。
实验结果
研究问题
- RQ1多智能体强化学习框架能否有效提升非自回归序列生成中的句级一致性?
- RQ2通过策略梯度优化不可微的句级指标(如BLEU)是否能获得优于词级交叉熵损失的生成质量?
- RQ3所提出的CMAL方法能否在保持高速解码的同时,与自回归模型相比实现具有竞争力的性能?
- RQ4在长序列上,该模型表现如何?在该场景下,词级损失优化通常会退化。
- RQ5反事实基线能否在协作式MARL用于序列生成时提升训练稳定性和性能?
主要发现
- 在WMT14 En-De机器翻译基准上,所提出的NAT-CMAL模型相比交叉熵训练基线模型提升6.0 BLEU分数,同时实现17.46倍的解码加速。
- 在MSCOCO图像字幕生成基准上,模型性能与最先进自回归模型相当,且实现13.9倍的解码加速。
- 模型在不同句长下均保持稳定性能,尤其在长句上显著优于交叉熵基线,后者在长句上性能急剧下降。
- 消融实验表明,反事实基线提升了训练稳定性和性能,其中组合式反事实基线效果最佳。
- 模型的推理延迟几乎不随序列长度变化,100个标记的句子在GTX 1080 Ti上仅需16.4ms,而自回归Transformer接近1秒。
- 定性分析显示,与NAT-XE相比,NAT-CMAL显著减少了重复和不一致的词语,生成结果质量更接近自回归模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。