Skip to main content
QUICK REVIEW

[论文解读] Better Captioning with Sequence-Level Exploration

Jia Chen, Qin Jin|arXiv (Cornell University)|Mar 8, 2020
Multimodal Machine Learning Applications参考文献 39被引用 5
一句话总结

本文提出SLL-SLE,一种用于图像和视频字幕生成的新型序列级学习目标,通过在损失函数中加入序列级探索项以最大化字幕多样性,从而提升模型的召回率。通过在精度与召回率之间通过多样性正则化实现平衡,该方法在MSCOCO和TGIF数据集上均取得了当前最优性能,在CIDEr、METEOR和SPICE指标上超越了现有基线模型,同时提升了多样性得分。

ABSTRACT

Sequence-level learning objective has been widely used in captioning tasks to achieve the state-of-the-art performance for many models. In this objective, the model is trained by the reward on the quality of its generated captions (sequence-level). In this work, we show the limitation of the current sequence-level learning objective for captioning tasks from both theory and empirical result. In theory, we show that the current objective is equivalent to only optimizing the precision side of the caption set generated by the model and therefore overlooks the recall side. Empirical result shows that the model trained by this objective tends to get lower score on the recall side. We propose to add a sequence-level exploration term to the current objective to boost recall. It guides the model to explore more plausible captions in the training. In this way, the proposed objective takes both the precision and recall sides of generated captions into account. Experiments show the effectiveness of the proposed method on both video and image captioning datasets.

研究动机与目标

  • 识别当前字幕生成任务中序列级学习目标的局限性,即过度强调精度而忽视召回。
  • 解决模型在标准序列级学习下训练时生成高度相似、低多样性的字幕这一经验性问题。
  • 提出一种新的学习目标,通过促进对多样且语义连贯字幕的探索,显式提升召回率。
  • 证明多样性可作为字幕生成中召回的可靠代理指标,从而提升模型泛化能力。
  • 在图像和视频字幕生成基准上实现精度与召回率的双赢提升。

提出的方法

  • 引入一个序列级探索项,通过最大化同一输入生成的字幕之间的编辑距离,促进句法与语义多样性。
  • 将新目标形式化为标准序列级学习损失与基于字幕间差异性的多样性正则化项的组合。
  • 使用编辑距离作为可微分代理指标来衡量字幕多样性,鼓励模型在训练过程中探索多种合理的字幕变体。
  • 采用强化学习端到端训练模型,其奖励信号结合了字幕质量(通过CIDEr/METEOR)与多样性。
  • 在编码器-解码器架构结合注意力机制的图像与视频字幕生成任务中应用该方法。
  • 实现随机采样与束搜索两种解码策略,以评估不同推理模式下的鲁棒性与泛化能力。

实验结果

研究问题

  • RQ1标准序列级学习目标在字幕生成中是否隐式忽略了召回方面?
  • RQ2通过序列级探索提升字幕多样性,是否能在召回相关指标上带来可测量的提升?
  • RQ3多样性是否可作为字幕生成中召回的有效代理指标,且能否通过序列级目标有效优化?
  • RQ4所提出的SLL-SLE方法是否在不同数据集和解码策略下均实现精度与召回率的一致性提升?
  • RQ5与SLL、SLL-ME及基于GAN的强基线方法相比,该方法在性能与多样性方面表现如何?

主要发现

  • 标准序列级学习目标在理论上等价于最大化广义精度,而忽略了召回,导致预测结果多样性较低。
  • 经验上,使用标准序列级学习训练的模型生成的字幕高度相似,如在随机采样下多样性得分极低(Div1: 0.06, Div2: 0.81)。
  • 所提出的SLL-SLE方法在MSCOCO数据集上,随机采样下CIDEr得分为115.9,束搜索下为117.2,优于SLL与SLL-ME。
  • 在TGIF视频字幕数据集上,SLL-SLE取得18.8 METEOR、50.8 CIDEr与16.6 SPICE得分,超过官方基线及先前SOTA方法。
  • 与SLL相比,SLL-SLE在召回代理指标上平均提升40%(Div1: 0.29, Div2: 0.40),证明其探索能力有效。
  • 该方法在随机采样与束搜索解码下均保持强劲性能,表明其具备鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。