[论文解读] Dense Video Captioning Using Unsupervised Semantic Information
本文提出一种无监督视觉描述符,通过聚类视觉特征的共现模式来学习短视频片段之间的语义相似性,仅使用视觉特征即可实现当前最优的密集视频字幕生成性能,在某些设置下超越了多模态方法。该方法用学习到的视觉语义表示替代了现有模型中的音频信号,通过自监督视觉词典学习提升了时间提议生成和字幕生成的准确性。
We introduce a method to learn unsupervised semantic visual information based on the premise that complex events can be decomposed into simpler events and that these simple events are shared across several complex events. We first employ a clustering method to group representations producing a visual codebook. Then, we learn a dense representation by encoding the co-occurrence probability matrix for the codebook entries. This representation leverages the performance of the dense video captioning task in a scenario with only visual features. For example, we replace the audio signal in the BMT method and produce temporal proposals with comparable performance. Furthermore, we concatenate the visual representation with our descriptor in a vanilla transformer method to achieve state-of-the-art performance in the captioning subtask compared to the methods that explore only visual features, as well as a competitive performance with multi-modal methods. Our code is available at https://github.com/valterlej/dvcusi.
研究动机与目标
- 开发一种无监督视觉描述符,无需人工标注即可捕捉视频片段之间的语义相似性。
- 通过用学习到的视觉语义表示替代音频信号,改进密集视频字幕生成。
- 仅使用视觉特征实现在密集视频字幕生成任务中的最先进性能,特别是在学习到的提议设置下。
- 证明视觉词典条目之间的共现模式可有效建模视频理解中的长程视觉语义。
提出的方法
- 从长视频中提取时长不超过2.56秒的短视频片段,并使用3D卷积神经网络(i3D)将其嵌入,生成深层视觉特征。
- 使用小批量k-means聚类将这些特征分组为视觉词典,为每个片段分配一个离散的聚类标签。
- 计算所有片段中视觉词典条目之间的共现概率矩阵,以建模语义关系。
- 训练一个神经网络以预测预先计算的共现概率,学习视觉语义的密集分布式表示。
- 将学习到的描述符与视觉特征融合,输入到一个标准Transformer模型中进行视频字幕生成,替代Bi-Modal Transformer(BMT)中的音频输入。
- 使用多头双模态提议模块生成时间事件提议,字幕通过Transformer解码器生成。
实验结果
研究问题
- RQ1当仅使用视觉特征时,无监督视觉相似性学习能否提升密集视频字幕生成性能?
- RQ2基于视觉词表示共现模式的学习到的视觉描述符能否在密集视频字幕模型中替代音频信号?
- RQ3在时间事件提议和字幕生成任务中,该方法在未见片段上的泛化能力如何?
- RQ4将基于共现的视觉语义与深层特征结合,能否在单模态视频字幕生成中实现最先进性能?
主要发现
- 在仅使用视觉特征的情况下,该方法在ActivityNet数据集的“学习到的提议”设置中实现了最先进性能,优于所有其他单模态方法。
- 在“真实提议”设置下,该方法的BLEU@4得分为2.55,略低于Masked Transformer,但显著优于其他仅使用视觉的模型。
- 在真实提议设置下,该方法的METEOR得分为8.65,与MDVC和iPerceive等多模态方法相当,尽管未使用音频或动作标注。
- 在学习到的提议场景中,该方法的F1得分达到0.57,表明其在无音频条件下具有出色的时序事件定位性能。
- 定性结果表明,该模型能正确识别混合物质和手部动作等关键动作,即使在视觉变化极小的视频中也表现优异,且在无音频条件下的动作识别上优于BMT (V+Sm)。
- 尽管仅依赖RGB视频流且无音频或语言监督,该方法在性能上与BMT (V+A)和MDVC等多模态模型相当。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。