[论文解读] Query-based Video Summarization with Pseudo Label Supervision
本文提出一种自监督的基于查询的视频摘要方法,利用从现有人工标注的帧级标签中衍生出的片段级伪标签,以提升模型预训练效果。通过引入上下文感知的语义增强模块用于查询编码,并采用互注意力机制实现跨模态交互,该方法在 TVSum、SumMe 和 QueryVS 基准测试中均达到最先进性能,F1 分数分别为 68.4、52.4 和 55.3。
Existing datasets for manually labelled query-based video summarization are costly and thus small, limiting the performance of supervised deep video summarization models. Self-supervision can address the data sparsity challenge by using a pretext task and defining a method to acquire extra data with pseudo labels to pre-train a supervised deep model. In this work, we introduce segment-level pseudo labels from input videos to properly model both the relationship between a pretext task and a target task, and the implicit relationship between the pseudo label and the human-defined label. The pseudo labels are generated based on existing human-defined frame-level labels. To create more accurate query-dependent video summaries, a semantics booster is proposed to generate context-aware query representations. Furthermore, we propose mutual attention to help capture the interactive information between visual and textual modalities. Three commonly-used video summarization benchmarks are used to thoroughly validate the proposed approach. Experimental results show that the proposed video summarization algorithm achieves state-of-the-art performance.
研究动机与目标
- 解决由于人工标注成本高昂而导致的基于查询的视频摘要任务中的数据稀缺问题。
- 通过利用从已有帧级标注中衍生出的片段级伪标签,提升模型泛化能力。
- 通过引入上下文感知的语义增强模块,改进查询表征学习,以提升与查询相关的摘要性能。
- 利用互注意力机制捕捉视觉与文本模态之间的跨模态交互。
- 在标准基准测试上实现最先进性能,且对完全标注数据的依赖程度极低。
提出的方法
- 从现有的人工标注的帧级标签中生成片段级伪标签,作为掩蔽自监督任务的监督信号。
- 使用这些伪标签对模型进行预训练,以在微调基于查询的摘要任务前改善模型初始化和时序建模能力。
- 引入语义增强模块,生成上下文感知的查询嵌入,以更准确地捕捉查询语义。
- 在推理过程中,采用互注意力机制动态对齐并融合视觉与文本特征。
- 使用在 ImageNet 和 Kinetics 上预训练的 2D 和 3D ResNet-34 主干网络,提取帧级和片段级视觉特征。
- 应用帧重复预处理和标准归一化,以确保不同视频输入维度的一致性。

实验结果
研究问题
- RQ1从帧级标注中衍生出的片段级伪标签是否能有效提升基于查询的视频摘要任务的自监督预训练效果?
- RQ2上下文感知的语义增强模块在多大程度上提升了与查询相关的视频摘要任务中的查询表征能力?
- RQ3与标准交叉注意力或拼接方法相比,视觉与文本模态之间的互注意力机制在多大程度上提升了模型性能?
- RQ4所提出的自监督方法是否在标准基准测试上优于现有的完全监督和弱监督基线方法?
- RQ5该方法是否能在具有不同长度和内容分布的多样化视频数据集上实现良好泛化?
主要发现
- 所提方法在 TVSum 上取得 68.4 的 F1 分数,在 SumMe 上取得 52.4,在 QueryVS 上取得 55.3,优于现有完全监督和弱监督方法。
- 消融实验表明,所有组件——伪标签预训练、语义增强模块和互注意力机制——均显著优于基线模型。
- 片段级伪标签即使未经人工验证,也能提供有效的时序监督,因其与帧级标注高度对齐。
- 语义增强模块在捕捉上下文查询语义方面优于传统词袋(BoW)嵌入。
- 互注意力机制提升了跨模态特征交互,从而实现更准确的与查询相关的视频片段选择。
- 该模型在具有不同视频长度和内容分布的数据集上均保持优异性能,展现出强大的鲁棒性和泛化能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。