Skip to main content
QUICK REVIEW

[论文解读] NITS-VC System for VATEX Video Captioning Challenge 2020

Alok Singh, Thoudam Doren Singh|arXiv (Cornell University)|Jun 7, 2020
Multimodal Machine Learning Applications参考文献 20被引用 4
一句话总结

本论文介绍了NITS-VC系统,用于VATEX 2020视频字幕挑战赛,采用基于C3D的视觉特征编码与双LSTM编码器-解码器架构。该模型通过逐元素相乘实现视觉与文本特征的融合,在公开测试集上达到BLEU-4得分为0.20,在私有测试集上达到0.22,展示了在开放领域英语视频字幕生成任务中的优异性能。

ABSTRACT

Video captioning is process of summarising the content, event and action of the video into a short textual form which can be helpful in many research areas such as video guided machine translation, video sentiment analysis and providing aid to needy individual. In this paper, a system description of the framework used for VATEX-2020 video captioning challenge is presented. We employ an encoder-decoder based approach in which the visual features of the video are encoded using 3D convolutional neural network (C3D) and in the decoding phase two Long Short Term Memory (LSTM) recurrent networks are used in which visual features and input captions are fused separately and final output is generated by performing element-wise product between the output of both LSTMs. Our model is able to achieve BLEU scores of 0.20 and 0.22 on public and private test data sets respectively.

研究动机与目标

  • 开发一个针对VATEX 2020多语言视频字幕挑战赛的鲁棒视频字幕系统。
  • 通过生成连贯且与上下文相关的英语字幕,应对开放领域视频字幕生成的挑战。
  • 通过双LSTM架构与逐元素相乘实现视觉与文本特征融合,提升字幕质量。
  • 使用BLEU、CIDEr、METEOR和ROUGE-L等标准指标,在公开与私有测试集上评估系统性能。
  • 证明C3D特征与无注意力机制的双LSTM解码在视频字幕任务中的有效性。

提出的方法

  • 使用在均匀分割的视频片段(每段16帧)上预训练的3D卷积神经网络(C3D)提取视觉特征。
  • 通过池化核大小为5的平均池化操作处理C3D输出,以降低维度并去除冗余信息。
  • 将每个片段的池化特征拼接,以保留时间关系,并形成视觉表征序列。
  • 解码器中使用两个独立的长短期记忆网络(LSTM):一个基于视觉特征,另一个基于输入字幕,通过逐元素相乘实现特征融合。
  • 字幕生成过程以<BOS>标记初始化,以<EOS>标记终止,采用贪婪解码逐词生成预测。
  • 模型使用交叉熵损失函数,采用Adam优化器训练,dropout率为0.5,两个LSTM的隐藏层维度均为512,训练周期为50轮,批量大小分别为64和256。

实验结果

研究问题

  • RQ1与标准单LSTM解码器相比,采用逐元素特征融合的双LSTM解码器在生成准确视频字幕方面的有效性如何?
  • RQ2结合平均池化的C3D视觉特征提取是否能通过减少视频帧冗余来提升字幕生成性能?
  • RQ3在使用VATEX数据集的视频字幕任务中,批量大小对模型泛化能力与性能的影响如何?
  • RQ4所提出的系统在BLEU、CIDEr、METEOR和ROUGE-L等标准评估指标上与当前最先进模型相比表现如何?
  • RQ5通过逐元素相乘实现视觉与文本特征融合,对提升字幕连贯性与相关性有多大促进作用?

主要发现

  • 系统在公开测试集上获得BLEU-4得分为0.20,在私有测试集上为0.22,表明在开放领域视频字幕生成任务中表现优异。
  • 在私有测试集上CIDEr得分为0.27,表明生成字幕与参考字幕在n-gram重叠与语义相关性方面具有良好的对齐。
  • 在私有测试集上BLEU-1得分为0.65,表明生成字幕与参考字幕在一元语法层面具有较高的重叠度。
  • METEOR得分在两个测试集上均稳定在0.18,反映出生成字幕在一元语法精确率与召回率上表现一致,且碎片化程度较低。
  • 在私有测试集上ROUGE-L得分为0.43,表明生成字幕在句子层面具有良好的连贯性,并且与参考字幕的最长公共子序列召回率较高。
  • 较小的批量大小(64)优于较大的批量大小(256),表明其具有更好的泛化能力并减少了过拟合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。