[论文解读] A Hierarchical Multi-Modal Encoder for Moment Localization in Video Corpus
本文提出 HAMMER,一种分层多模态编码器,通过跨模态注意力机制联合建模视频的帧级与片段级表征,以提升未剪辑视频语料中的时刻定位性能。通过在多任务框架中整合视频检索、时间定位和掩码语言建模,HAMMER 在 ActivityNet Captions 和 TVR 数据集上实现了最先进性能,展现出对长视频长度的鲁棒性,并在定位精度上优于平面基线模型。
Identifying a short segment in a long video that semantically matches a text query is a challenging task that has important application potentials in language-based video search, browsing, and navigation. Typical retrieval systems respond to a query with either a whole video or a pre-defined video segment, but it is challenging to localize undefined segments in untrimmed and unsegmented videos where exhaustively searching over all possible segments is intractable. The outstanding challenge is that the representation of a video must account for different levels of granularity in the temporal domain. To tackle this problem, we propose the HierArchical Multi-Modal EncodeR (HAMMER) that encodes a video at both the coarse-grained clip level and the fine-grained frame level to extract information at different scales based on multiple subtasks, namely, video retrieval, segment temporal localization, and masked language modeling. We conduct extensive experiments to evaluate our model on moment localization in video corpus on ActivityNet Captions and TVR datasets. Our approach outperforms the previous methods as well as strong baselines, establishing new state-of-the-art for this task.
研究动机与目标
- 解决在长时未剪辑视频中,使用自然语言查询定位短时语义相关视频片段的挑战。
- 在多个时间粒度上提升视频理解能力——帧级用于精确定位,片段级用于高效检索。
- 开发一个统一模型,联合优化视频检索、时刻定位和掩码语言建模。
- 通过在模态间实现分层表征学习,降低视频语料搜索中的计算复杂度。
- 在包含大量无关内容的长视频中展示鲁棒性,其中平面模型性能显著下降。
提出的方法
- HAMMER 采用两级分层编码器:基于帧级特征的帧级 Transformer 编码器,以及在其之上构建的片段级编码器。
- 在文本查询与视觉/ASR 特征之间,于帧级、片段级和全视频三个层次应用跨模态注意力,以实现模态对齐。
- 视觉特征通过 I3D 和 ResNet-152 模型在 3 FPS 采样率下提取,随后拼接为 3072 维向量;ASR 嵌入向量由 RoBERTa 模型生成,并每 1.5 秒进行最大池化。
- 模型采用多任务学习目标,结合视频检索、时间定位和掩码语言建模,以提升联合表征学习效果。
- 在多模态融合中,查询表征同时关注视觉和 ASR 特征,随后将二者拼接并归一化,用于下游任务。
- 模型采用 Adam 优化器进行端到端训练,学习率采用线性预热与余弦衰减调度策略,输入序列在 ActivityNet 中限制为 128 帧,在 TVR 中限制为 96 帧。
实验结果
研究问题
- RQ1与平面的单粒度模型相比,分层多模态编码器是否能提升未剪辑视频语料中的时刻定位性能?
- RQ2引入片段级表征在长视频上的检索与定位性能方面有何提升作用?
- RQ3通过掩码语言建模进行多任务学习,在多大程度上提升了视频-文本表征的质量?
- RQ4在包含大量无关内容的长视频中,模型表现如何,而平面模型在此类场景中表现显著下降?
- RQ5视觉特征与 ASR 特征对最终定位准确率的相对贡献如何?
主要发现
- HAMMER 在 ActivityNet Captions 和 TVR 数据集上,于视频检索、单视频中的时刻定位以及视频语料中的时刻定位任务中,均实现了最先进性能。
- 该模型在长视频上显著优于强基线模型,尤其在平面模型因无关内容导致性能严重下降的场景中表现更优。
- 分层设计使模型在不同视频长度下均保持稳健性能,随着视频长度增加,准确率下降幅度极小。
- 消融实验表明,片段级表征对精确定位至关重要,片段编码器常能纠正帧编码器产生的错误。
- ASR 特征的引入提升了 TVR 上的性能,尤其在视觉内容模糊的情况下,通过提供互补的语言上下文增强了模型表现。
- 包含掩码语言建模的多任务目标提升了上下文表征质量,从而在各项任务间实现了更好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。