Skip to main content
QUICK REVIEW

[论文解读] Multimodal Memory Modelling for Video Captioning

Junbo Wang, Wei Wang|arXiv (Cornell University)|Nov 17, 2016
Multimodal Machine Learning Applications参考文献 42被引用 8
一句话总结

该论文提出了一种用于视频字幕生成的多模态记忆模型(M³),通过共享记忆来建模长期视觉-文本依赖关系,并引导全局视觉注意力。通过将外部记忆与基于LSTM的解码器及基于CNN的视频编码器相结合,M³在MSVD和MSR-VTT数据集上的性能得到提升,其BLEU@4指标最高提升26.9%,METEOR指标最高提升8.5%。

ABSTRACT

Video captioning which automatically translates video clips into natural language sentences is a very important task in computer vision. By virtue of recent deep learning technologies, e.g., convolutional neural networks (CNNs) and recurrent neural networks (RNNs), video captioning has made great progress. However, learning an effective mapping from visual sequence space to language space is still a challenging problem. In this paper, we propose a Multimodal Memory Model (M3) to describe videos, which builds a visual and textual shared memory to model the long-term visual-textual dependency and further guide global visual attention on described targets. Specifically, the proposed M3 attaches an external memory to store and retrieve both visual and textual contents by interacting with video and sentence with multiple read and write operations. First, text representation in the Long Short-Term Memory (LSTM) based text decoder is written into the memory, and the memory contents will be read out to guide an attention to select related visual targets. Then, the selected visual information is written into the memory, which will be further read out to the text decoder. To evaluate the proposed model, we perform experiments on two publicly benchmark datasets: MSVD and MSR-VTT. The experimental results demonstrate that our method outperforms the state-of-theart methods in terms of BLEU and METEOR.

研究动机与目标

  • 解决现有基于RNN的模型在长序列中因梯度消失而难以建模视频字幕中长期视觉-文本依赖关系的挑战。
  • 通过共享记忆机制显式引导相关视觉目标的选择,从而改善全局视觉注意力。
  • 克服仅依赖LSTM隐藏状态的单一视觉表征与注意力机制的局限性。
  • 证明多模态记忆在提升多种基准数据集上视频字幕生成性能方面的有效性。
  • 研究不同视觉特征提取器对字幕质量及记忆融合的影响。

提出的方法

  • 引入一个多模态记忆矩阵(Mem),通过多次读取和写入操作存储并检索视觉与文本表征。
  • 使用基于CNN的视频编码器(如Inception-V3、ResNet、VGG-19)提取帧级特征,构成输入视频表征。
  • 实现基于LSTM的文本解码器,其生成的词语同时依赖于先前的隐藏状态和从多模态记忆中读取的内容。
  • 使用记忆读取内容而非LSTM隐藏状态来引导视觉注意力,从而实现更准确和全局的目标选择。
  • 在每个解码步骤执行两次写操作:(1) 将LSTM解码器隐藏状态写入记忆;(2) 将通过注意力选择的视觉特征写入记忆。
  • 实现双向记忆交互:从记忆中读取以引导注意力和解码器,同时将内容写入记忆以保留并更新多模态上下文。

实验结果

研究问题

  • RQ1共享的多模态记忆能否有效建模视频字幕中视觉与文本序列之间的长期依赖关系?
  • RQ2使用记忆读取内容来引导视觉注意力,是否相比基于LSTM隐藏状态的注意力,能提升生成字幕的相关性与准确性?
  • RQ3多模态记忆融合在不同视觉特征提取器(如Inception-V3、VGG-19、C3D)上的性能影响如何?
  • RQ4所提出的M³模型是否能在MSVD和MSR-VTT等多样化基准数据集上持续超越当前最先进方法?
  • RQ5当与多模态记忆结合时,运动感知特征(如C3D)与仅外观特征(如VGG-19)的贡献分别是什么?

主要发现

  • 在MSVD数据集上,使用GoogleNet特征时,M³模型相比基线SA模型在BLEU@4指标上实现26.9%的相对提升,在METEOR指标上提升8.5%。
  • 在MSVD上,使用Inception-V3特征的M³-inception模型表现最佳,优于使用VGG-19、ResNet和GoogleNet特征的模型。
  • 在MSR-VTT上,M³模型始终优于对应的SA基线模型,其中M³-VC(结合VGG-19与C3D特征)在BLEU和METEOR指标上均超过所有对比方法。
  • 在MSR-VTT上,使用C3D特征(编码运动信息)的性能优于仅使用VGG-19特征,表明运动信息对本数据集至关重要。
  • 视觉检查确认,M³能生成更精确的物体术语(如“basketball”而非“soccer ball”),并能对相关目标(如“dog”而非“guitar”)应用全局注意力。
  • 使用不同视觉特征的模型性能排名与它们在ImageNet上的分类准确率高度相关,证实了高质量视觉表征的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。