[论文解读] Beyond Caption To Narrative: Video Captioning With Multiple Sentences
本文提出一种类似故事的视频字幕生成方法,通过动作定位对视频进行分段,然后利用自然语言处理技术将字幕连接起来,生成多句描述。该方法在不依赖视频级特征的情况下,实现了与最先进方法相当的性能,生成的字幕更加丰富、更具动态性,优于单帧基线方法。
Recent advances in image captioning task have led to increasing interests in video captioning task. However, most works on video captioning are focused on generating single input of aggregated features, which hardly deviates from image captioning process and does not fully take advantage of dynamic contents present in videos. We attempt to generate video captions that convey richer contents by temporally segmenting the video with action localization, generating multiple captions from multiple frames, and connecting them with natural language processing techniques, in order to generate a story-like caption. We show that our proposed method can generate captions that are richer in contents and can compete with state-of-the-art method without explicitly using video-level features as input.
研究动机与目标
- 通过超越单句图像字幕方法,生成更丰富、类似故事的视频字幕。
- 解决单一聚合视频特征在捕捉动态视频内容方面的局限性。
- 开发一种方法,从时间分段的视频动作中生成多个连贯、叙事风格的句子。
- 消除对视频级特征或外部文本数据以实现叙事连贯性的依赖。
提出的方法
- 使用动作定位对视频进行时间分段,基于动作变化而非镜头/场景切换识别不同事件。
- 从每个动作分段的中间帧提取CNN特征(VGG-16 fc7)用于字幕生成。
- 使用在MS COCO数据集上微调过的LSTM模型为每个分段生成独立字幕。
- 应用自然语言处理技术,将多个字幕连接成流畅、类似叙事的段落。
- 在动作定位过程中使用Fisher向量编码,并结合PCA和L2归一化生成视频级表示。
- 不将视频级特征作为字幕模型的输入,仅依赖帧级CNN特征。
实验结果
研究问题
- RQ1通过生成多句字幕而非单一句字幕,能否提升视频字幕生成性能?
- RQ2基于动作的时间分段是否比基于镜头/场景的分段产生更连贯、内容更丰富的视频字幕?
- RQ3能否通过在独立生成的字幕上应用自然语言处理技术,无需外部文本数据即可实现叙事连贯性?
- RQ4一种不显式使用视频级特征的方法是否仍能与最先进性能持平?
- RQ5该方法在剪辑频率较低的非电影类视频上表现如何?
主要发现
- 所提方法在所有数据集和评估指标上均优于单帧基线方法,证明了内容丰富性的提升。
- 尽管生成的字幕长度约为最先进方法的四倍,模型仍保持了相当的BLEU、ROUGE和CIDEr得分,表明内容保真度高。
- 在MSVD数据集上,该方法的CIDEr和ROUGE得分高于基线,证实与人工标注字幕的对齐性更好。
- 在YouTube视频中剪辑频率较低的MSVD子集上,该方法在多数指标上仍优于单帧方法,显示出超越电影片段的鲁棒性。
- 定性结果表明,生成的字幕形成连贯、类似叙事的段落,句子间过渡自然。
- 该方法在不使用视频级特征的情况下成功生成了更具信息量的字幕,证明仅通过帧级特征结合分段与自然语言处理即可取得优异效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。