Skip to main content
QUICK REVIEW

[论文解读] Joint Event Detection and Description in Continuous Video Streams

Huijuan Xu, Boyang Li|arXiv (Cornell University)|Feb 28, 2018
Multimodal Machine Learning Applications被引用 6
一句话总结

该论文提出 JEDDi-Net,一种端到端的深度学习模型,可联合检测时间事件并生成连续视频流中的自然语言描述。通过使用 3D 卷积特征、针对提议的 3D SoI 池化以提取特定表示,以及整合视觉与语言上下文的分层字幕模块,JEDDi-Net 在 ActivityNet Captions 上实现了最先进性能,并在 TACoS-MultiLevel 上报告了首个密集字幕结果,CIDEr 得分(104.0)和 ROUGE-L 得分(50.9)显著提升。

ABSTRACT

Dense video captioning is a fine-grained video understanding task that involves two sub-problems: localizing distinct events in a long video stream, and generating captions for the localized events. We propose the Joint Event Detection and Description Network (JEDDi-Net), which solves the dense video captioning task in an end-to-end fashion. Our model continuously encodes the input video stream with three-dimensional convolutional layers, proposes variable-length temporal events based on pooled features, and generates their captions. Proposal features are extracted within each proposal segment through 3D Segment-of-Interest pooling from shared video feature encoding. In order to explicitly model temporal relationships between visual events and their captions in a single video, we also propose a two-level hierarchical captioning module that keeps track of context. On the large-scale ActivityNet Captions dataset, JEDDi-Net demonstrates improved results as measured by standard metrics. We also present the first dense captioning results on the TACoS-MultiLevel dataset.

研究动机与目标

  • 解决现有两阶段密集视频字幕模型中事件提议与字幕生成网络分别训练所导致的局限性。
  • 通过使用 3D SoI 池化提取提议特定特征,而非依赖 RNN 状态向量,以提高事件检测的准确性。
  • 通过建模时间有序事件中的视觉与语言上下文,提升字幕的连贯性。
  • 实现端到端训练,使字幕损失能够反向传播以优化事件提议。
  • 在 TACoS-MultiLevel 数据集上建立首个密集视频字幕基准,提供细粒度、多句描述。

提出的方法

  • 使用 3D 卷积网络将整个输入视频流编码为共享的时空特征。
  • 基于 R-C3D 的提议网络生成可变长度的时间片段以表示潜在事件。
  • 应用 3D 关注区域(SoI)池化,从共享视频特征中提取提议特定特征,提升表示准确性。
  • 实现两级分层字幕模块:高层控制器 RNN 聚合视觉与语言上下文,低层 RNN 在此上下文基础上生成句子。
  • 端到端训练整个网络,使字幕损失的梯度可反向传播至提议生成过程。
  • 使用标准视频采样(5 fps)和基于词汇表的分词法,最大字幕长度为 15 个标记。

实验结果

研究问题

  • RQ1与分别训练相比,事件检测与字幕生成的端到端联合训练是否能提升性能?
  • RQ2与 RNN 状态向量相比,使用 3D SoI 池化提取提议特征是否能获得更准确的视觉表示?
  • RQ3在分层字幕模块中同时建模视觉与语言上下文,在多大程度上能提升字幕质量与连贯性?
  • RQ4所提出的模型能否泛化到高标注密度数据集(如 TACoS-MultiLevel)?
  • RQ5在 TACoS-MultiLevel 上,密集视频字幕的性能如何?与剪裁视频字幕基线相比表现如何?

主要发现

  • 在 ActivityNet Captions 数据集上,JEDDi-Net 在联合训练下达到 CIDEr 得分 99.7 和 ROUGE-L 得分 50.0,优于分别训练的基线。
  • 采用显式上下文建模的模型(JEDDi-Net with context)在 TACoS-MultiLevel 上达到 CIDEr 得分 104.0,显著优于分别训练基线(65.4)。
  • 在 TACoS-MultiLevel 上,模型达到 Bleu-4 得分 18.1,当考虑 IoU 重叠时,已接近剪裁视频字幕的上限(27.5% Bleu-4)。
  • 在 tIoU 阈值范围(0.5–0.95)内,提议检测的平均 AUC 从 41.90 提升至 43.30,表明端到端训练提升了提议质量。
  • 结合视觉与语言上下文的分层字幕模块相比无上下文版本,在 METEOR 和 CIDER 上分别提升 1.5–2.0 分。
  • 定性结果表明,尽管遗漏部分物体,JEDDi-Net 仍能生成对小物体交互(如橙子、鸡蛋)的细粒度描述,表明其能有效学习端到端监督信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。