[论文解读] Video Captioning with Transferred Semantic Attributes
该论文提出LSTM-TSA,一种新颖的视频字幕生成模型,通过将来自图像和视频的迁移语义属性整合到端到端的LSTM编码器-解码器框架中,以增强句子生成。通过引入一个动态迁移单元来上下文性地平衡图像与视频属性,该模型在MSVD数据集上实现了最先进性能,BLEU@4达到52.8%,CIDEr-D达到74.0%。
Automatically generating natural language descriptions of videos plays a fundamental challenge for computer vision community. Most recent progress in this problem has been achieved through employing 2-D and/or 3-D Convolutional Neural Networks (CNN) to encode video content and Recurrent Neural Networks (RNN) to decode a sentence. In this paper, we present Long Short-Term Memory with Transferred Semantic Attributes (LSTM-TSA)---a novel deep architecture that incorporates the transferred semantic attributes learnt from images and videos into the CNN plus RNN framework, by training them in an end-to-end manner. The design of LSTM-TSA is highly inspired by the facts that 1) semantic attributes play a significant contribution to captioning, and 2) images and videos carry complementary semantics and thus can reinforce each other for captioning. To boost video captioning, we propose a novel transfer unit to model the mutually correlated attributes learnt from images and videos. Extensive experiments are conducted on three public datasets, i.e., MSVD, M-VAD and MPII-MD. Our proposed LSTM-TSA achieves to-date the best published performance in sentence generation on MSVD: 52.8% and 74.0% in terms of BLEU@4 and CIDEr-D. Superior results when compared to state-of-the-art methods are also reported on M-VAD and MPII-MD.
研究动机与目标
- 为解决现有视频字幕模型在利用高层语义线索方面不足的问题,通过将语义属性整合到字幕生成流程中。
- 探索从图像(静态内容)和视频(时间动态)中提取的语义属性之间的互补性,以提升句子生成质量。
- 设计一种动态融合机制,根据上下文自适应地平衡图像与视频属性的影响,从而提升字幕质量。
- 开发一种整体性视频多实例学习(MIL)框架,以在多个视频帧上更有效地学习属性,提升语义表征能力。
提出的方法
- 利用2D/3D卷积神经网络(CNNs)从采样的视频帧中提取视觉特征,随后通过平均池化生成视频表征。
- 提出一种针对视频的多实例学习(MIL)框架,联合学习视频所有帧的语义属性,从而在整体上提升语义理解,优于逐帧学习方法。
- 采用长短期记忆网络(LSTM)解码器,将视频表征和语义属性作为输入,其中属性同时来自图像和视频。
- 设计一种迁移单元,基于当前输入词和LSTM隐藏状态动态计算类似注意力的权重,实现上下文感知的图像与视频属性融合。
- 使用门控机制(LSTM-TSA IV变体)计算图像与视频属性的加权组合,门控参数在每个时间步更新,实现自适应控制。
- 端到端训练整个模型,实现视觉特征提取、属性学习与句子生成的联合优化。
实验结果
研究问题
- RQ1能否有效融合从图像和视频中挖掘出的语义属性,以提升视频字幕生成性能?
- RQ2在句子生成过程中,如何以上下文感知的方式利用静态图像属性与动态视频属性之间的互补语义?
- RQ3与逐帧属性学习相比,用于属性学习的整体性视频MIL框架是否在视频字幕任务中表现更优?
- RQ4与固定或逐元素融合相比,能够根据输入词和隐藏状态自适应调整的动态迁移单元在多大程度上提升了字幕质量?
主要发现
- 所提出的LSTM-TSA模型在MSVD数据集上达到最先进性能,BLEU@4为52.8%,CIDEr-D为74.0%,优于先前方法。
- 视频MIL属性学习框架显著优于逐帧MIL,使MSVD数据集上的CIDEr-D从70.6%提升至71.7%。
- 采用学习权重动态融合图像与视频属性的动态迁移单元(LSTM-TSA IV₃)表现最佳,BLEU@4为52.8%,CIDEr-D为74.0%。
- 使用随时间步变化的迁移门控机制始终优于固定元素求和融合(LSTM-TSA IV₀),证明了上下文感知融合的优势。
- 在M-VAD和MPII-MD数据集上,LSTM-TSA也优于最先进方法,验证了其在不同数据集上的泛化能力。
- 消融实验表明,通过动态加权结合双源属性可获得最大性能提升,验证了图像与视频语义的互补性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。