Skip to main content
QUICK REVIEW

[论文解读] Temporal Deformable Convolutional Encoder-Decoder Networks for Video Captioning

Jingwen Chen, Yingwei Pan|arXiv (Cornell University)|May 3, 2019
Multimodal Machine Learning Applications参考文献 40被引用 12
一句话总结

该论文提出TDConvED,一种新颖的卷积编码器-解码器架构,用于视频字幕生成。该模型用堆叠的时序可变形卷积替代循环网络,实现并行训练并提升长程建模能力。通过在编码器中使用可变形卷积、在解码器中引入时序注意力机制,TDConvED在MSVD数据集上取得了67.2%的CIDEr-D得分,显著优于基于RNN的基线模型,并因完全并行化而实现更快的训练速度。

ABSTRACT

It is well believed that video captioning is a fundamental but challenging task in both computer vision and artificial intelligence fields. The prevalent approach is to map an input video to a variable-length output sentence in a sequence to sequence manner via Recurrent Neural Network (RNN). Nevertheless, the training of RNN still suffers to some degree from vanishing/exploding gradient problem, making the optimization difficult. Moreover, the inherently recurrent dependency in RNN prevents parallelization within a sequence during training and therefore limits the computations. In this paper, we present a novel design --- Temporal Deformable Convolutional Encoder-Decoder Networks (dubbed as TDConvED) that fully employ convolutions in both encoder and decoder networks for video captioning. Technically, we exploit convolutional block structures that compute intermediate states of a fixed number of inputs and stack several blocks to capture long-term relationships. The structure in encoder is further equipped with temporal deformable convolution to enable free-form deformation of temporal sampling. Our model also capitalizes on temporal attention mechanism for sentence generation. Extensive experiments are conducted on both MSVD and MSR-VTT video captioning datasets, and superior results are reported when comparing to conventional RNN-based encoder-decoder techniques. More remarkably, TDConvED increases CIDEr-D performance from 58.8% to 67.2% on MSVD.

研究动机与目标

  • 解决基于RNN的视频字幕模型存在的梯度消失/爆炸问题以及序列计算瓶颈。
  • 探索在编码器和解码器中使用前馈卷积代替RNN进行序列到序列视频字幕生成的可行性和有效性。
  • 通过在编码器中引入时序可变形卷积,提升长程时间建模能力,以捕捉视频中的动态时间结构。
  • 通过消除循环依赖关系,实现训练过程的完全并行化,从而提升训练效率。
  • 通过堆叠卷积块与时序注意力机制的结合,提升生成句子的质量。

提出的方法

  • 使用标准CNN从采样的视频帧或视频片段中提取视觉特征,作为编码器的输入。
  • 在编码器中堆叠卷积块,为每个帧/片段生成中间上下文表征,堆叠数量控制感受野大小。
  • 在编码器中引入时序可变形卷积,实现对时间特征的自由形式采样,提升对动态动作和场景转换的建模能力。
  • 通过在所有中间帧/片段特征上进行全局平均池化,计算视频级别的表征。
  • 在解码器中,使用前馈卷积块处理视频级别表征与先前生成词的词嵌入的拼接结果,以预测下一个词。
  • 集成时序注意力机制,在生成单词时关注相关视频特征,增强视觉内容与生成句子之间的对齐。

实验结果

研究问题

  • RQ1完全基于卷积的编码器-解码器架构是否能在实现并行训练的同时,超越基于RNN的视频字幕模型?
  • RQ2在编码器中使用时序可变形卷积如何提升对视频中长程和动态时间依赖关系的建模能力?
  • RQ3堆叠多个卷积块在多大程度上增强了视频字幕生成中的长程上下文学习能力?
  • RQ4在卷积解码器中集成时序注意力机制,与标准注意力机制相比,如何提升句子生成质量?
  • RQ5用卷积层替代RNN对训练速度和优化稳定性有何影响?

主要发现

  • TDConvED在MSVD数据集上取得了67.2%的CIDEr-D得分,显著优于此前的SOTA基于RNN的模型(58.8%)。
  • 在编码器中使用时序可变形卷积的模型(TDConvED 2)优于使用标准卷积的基线模型(TDConvED 1),证明了可变形采样的有效性。
  • 引入时序注意力机制后性能进一步提升,表明其在对齐相关视觉线索与生成词汇方面的价值。
  • 与MP-LSTM相比,训练速度提升了约2.2倍,相同硬件条件下TDConvED每轮训练耗时1070秒,而MP-LSTM为2370秒。
  • 编码器和解码器中堆叠卷积块的最优数量均为2个,性能在更多或更少块时均下降,表明容量与泛化能力之间存在权衡。
  • 定性分析显示,TDConvED生成的字幕更准确且上下文相关,例如能正确识别出‘dancing’而非‘walking’,以及将‘onion’作为关键物体,归因于更优的长程建模能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。