[论文解读] RUC+CMU: System Report for Dense Captioning Events in Videos
该论文提出了一种两阶段密集视频字幕系统,结合时间提议排序与集成字幕生成,利用多模态特征(RGB、光流、音频)和双向LSTM上下文建模。通过融合提议分数与字幕分数进行重排序,该系统在ActivityNet测试集上实现了8.529的METEOR得分,达到当前最先进性能。
This notebook paper presents our system in the ActivityNet Dense Captioning in Video task (task 3). Temporal proposal generation and caption generation are both important to the dense captioning task. Therefore, we propose a proposal ranking model to employ a set of effective feature representations for proposal generation, and ensemble a series of caption models enhanced with context information to generate captions robustly on predicted proposals. Our approach achieves the state-of-the-art performance on the dense video captioning task with 8.529 METEOR score on the challenge testing set.
研究动机与目标
- 为解决密集视频字幕中的时间事件定位与准确字幕生成联合优化挑战。
- 通过引入上下文感知特征与边界方差,提升提议质量,实现更精确的时间事件定位。
- 通过融合增强上下文与主题信息的多个字幕模型,提升字幕的鲁棒性。
- 通过系统化的模型集成与重排序,在ActivityNet密集字幕基准上实现最先进性能。
提出的方法
- 将视频划分为64帧的非重叠片段,并提取多模态特征:ResNet(图像)、I3D(运动)和VGGish(音频)。
- 使用双向LSTM编码来自片段特征的双向上下文,训练目标为预测真实字幕概念。
- 通过滑动窗口方法生成候选提议,窗口长度基于真实标注分布聚类结果确定。
- 采用两层前馈神经网络,基于四种特征对提议进行排序:内部特征(提议内容)、外部特征(上下文)、边界方差以及位置/时长比例。
- 集成三种字幕模型:普通LSTM、基于时间注意力机制的模型以及主题引导模型(使用200个ActivityNet类别),所有模型均通过自Critical强化学习进行微调。
- 通过提议分数与字幕分数的乘积(s = s_p × s_c)对最终输出进行重排序,每视频选取前10个字幕。
实验结果
研究问题
- RQ1多模态与上下文特征在密集视频字幕中如何提升时间提议生成质量?
- RQ2结合上下文与主题引导的集成字幕建模在多大程度上提升了字幕质量与鲁棒性?
- RQ3学习得到的提议排序模型能否有效过滤低质量提议,同时保持高召回率?
- RQ4通过重排序整合提议质量与字幕质量分数,对密集字幕整体性能有何影响?
主要发现
- 滑动窗口基线方法每视频生成241个提议,精度为28%(tiou ≥ 0.3),但召回率高达98%。
- 应用提议排序模型(s_p > 0.5)后,平均提议数量降至53个,精度提升至71%(tiou ≥ 0.3),召回率维持在84%。
- 字幕集成模型在真实提议上达到13.75 METEOR得分,优于单一模型,证明了模型融合的优势。
- 在预测提议上,集成模型仍保持强鲁棒性,达到12.44 METEOR,较13.75有所下降,原因在于提议不完美及提议数量增加。
- 最终系统在ActivityNet测试集上实现最先进8.529 METEOR得分,表明其具备出色的泛化能力与性能表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。