Skip to main content
QUICK REVIEW

[论文解读] Non-Autoregressive Image Captioning with Counterfactuals-Critical Multi-Agent Learning

Longteng Guo, Jing Liu|arXiv (Cornell University)|May 10, 2020
Multimodal Machine Learning Applications参考文献 25被引用 11
一句话总结

本文提出一种基于反事实-关键多智能体学习(CMAL)的非自回归图像字幕模型,其中序列位置被视为合作智能体,通过策略梯度优化句子级奖励。通过引入针对智能体的反事实基线解决信用分配问题,该方法在实现13.9倍更快推理速度的同时,达到与自回归模型相当的最先进性能,并通过利用未标注图像进一步提升准确率。

ABSTRACT

Most image captioning models are autoregressive, i.e. they generate each word by conditioning on previously generated words, which leads to heavy latency during inference. Recently, non-autoregressive decoding has been proposed in machine translation to speed up the inference time by generating all words in parallel. Typically, these models use the word-level cross-entropy loss to optimize each word independently. However, such a learning process fails to consider the sentence-level consistency, thus resulting in inferior generation quality of these non-autoregressive models. In this paper, we propose a Non-Autoregressive Image Captioning (NAIC) model with a novel training paradigm: Counterfactuals-critical Multi-Agent Learning (CMAL). CMAL formulates NAIC as a multi-agent reinforcement learning system where positions in the target sequence are viewed as agents that learn to cooperatively maximize a sentence-level reward. Besides, we propose to utilize massive unlabeled images to boost captioning performance. Extensive experiments on MSCOCO image captioning benchmark show that our NAIC model achieves a performance comparable to state-of-the-art autoregressive models, while brings 13.9x decoding speedup.

研究动机与目标

  • 为解决非自回归图像字幕中的解码不一致性问题,该问题源于忽略句子级连贯性的词级交叉熵训练。
  • 通过将NAIC建模为合作多智能体强化学习系统,其中序列位置作为智能体,提升生成质量。
  • 利用针对智能体的反事实基线解决多智能体信用分配问题,以隔离个体对团队奖励的贡献。
  • 通过在预训练阶段利用大规模未标注图像提升模型性能。
  • 在不牺牲字幕质量的前提下实现高速推理,性能与最先进自回归模型相当。

提出的方法

  • 将目标字幕中的每个词位置视为合作多智能体强化学习框架中的独立智能体。
  • 定义句子级奖励(如CIDEr)作为共享团队奖励,以优化整体字幕质量。
  • 在推理过程中利用Transformer解码器中的自注意力机制,实现智能体间的通信与上下文共享。
  • 使用反事实基线计算针对智能体的优势函数:即在固定其他智能体动作的前提下,对当前智能体动作进行边缘化后的期望奖励。
  • 使用反事实优势进行策略梯度更新,仅优化优于基线的动作,以改进每个智能体的策略。
  • 在微调前,使用交叉熵损失在大规模未标注图像上预训练模型,以改善初始化并提升性能。

实验结果

研究问题

  • RQ1合作多智能体强化学习框架能否有效提升非自回归图像字幕的句子级一致性?
  • RQ2使用针对智能体的反事实基线是否优于全局基线(如移动平均或自关键)?
  • RQ3在预训练阶段使用未标注图像能在多大程度上提升非自回归字幕模型的性能?
  • RQ4所提出的CMAL方法能否在实现显著更快推理速度的同时,达到与自回归模型相当的性能?
  • RQ5CMAL训练对超参数(如动作采样中的top-k大小)的敏感性如何?

主要发现

  • 所提出的CMAL模型在MSCOCO测试集上达到124.0的CIDEr分数,性能与最先进自回归模型相当,同时实现13.9倍的推理加速。
  • 反事实基线(CF)优于移动平均(MA)和自关键(SC)基线,尤其在从较差初始化开始训练时表现更优,表明其具有更强的鲁棒性。
  • 在预训练阶段使用100,000张未标注图像,可使CIDEr分数从124.0提升至125.5,证明了自监督预训练的有效性。
  • 模型对动作采样中的top-k大小不敏感,k=2即可实现接近最优的性能(CIDEr=124.0)。
  • 定性结果表明,CMAL训练的模型消除了重复词汇和内容不完整的问题,显著提升了与XE训练的非自回归模型相比的流畅性与连贯性。
  • 该方法通过将训练目标与句子级指标对齐,直接优化CIDEr和BLEU等不可微分评估指标,从而减少了解码不一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。