[论文解读] Weakly-Supervised Video Moment Retrieval via Semantic Completion Network
本文提出了一种弱监督视频瞬间检索框架,仅需视频级标注,无需时序边界标签。该方法引入了语义补全网络(SCN),包含上下文感知的提议生成模块、用于Top-K提议选择的利用-探索策略,以及通过掩码关键查询词并利用视觉上下文进行重建以优化提议分数的语义补全模块,结合重建损失与奖励反馈机制,实现了在ActivityCaptions和Charades-STA数据集上的最先进性能,且无需完全监督。
Video moment retrieval is to search the moment that is most relevant to the given natural language query. Existing methods are mostly trained in a fully-supervised setting, which requires the full annotations of temporal boundary for each query. However, manually labeling the annotations is actually time-consuming and expensive. In this paper, we propose a novel weakly-supervised moment retrieval framework requiring only coarse video-level annotations for training. Specifically, we devise a proposal generation module that aggregates the context information to generate and score all candidate proposals in one single pass. We then devise an algorithm that considers both exploitation and exploration to select top-K proposals. Next, we build a semantic completion module to measure the semantic similarity between the selected proposals and query, compute reward and provide feedbacks to the proposal generation module for scoring refinement. Experiments on the ActivityCaptions and Charades-STA demonstrate the effectiveness of our proposed method.
研究动机与目标
- 为解决视频瞬间检索中精确时序边界标注的高成本与高难度问题。
- 开发一种弱监督方法,仅使用粗粒度的视频级标注(如字幕)即可实现有效训练。
- 通过利用跨模态上下文和语义相似性估计,改进提议生成与评分。
- 通过结合语义补全与基于奖励的学习反馈机制,优化提议置信度分数。
提出的方法
- 提议生成模块通过视频与查询的跨模态融合表征,在单次前向传播中对所有候选提议进行评分。
- 利用利用-探索算法选择Top-K提议:通过NMS选择高置信度提议,其余提议则以递减概率随机选择,以促进探索。
- 语义补全模块对查询中的关键词汇(如名词、动词)进行掩码,并利用每个提议的视觉上下文进行重建,通过重建损失衡量语义相似性。
- 重建损失为每个提议计算奖励,该奖励用于通过排名损失训练提议生成模块,以鼓励对匹配更好的提议赋予更高分数。
- 在提议生成模块与语义补全模块之间应用参数共享,以增强知识迁移并减小模型规模。
- 多任务训练目标结合排名损失与重建损失,联合优化提议评分与语义对齐。
实验结果
研究问题
- RQ1弱监督框架是否仅使用视频级标注即可实现具有竞争力的视频瞬间检索性能?
- RQ2与贪婪选择相比,提议选择中的利用-探索策略是否能提升模型收敛速度与性能?
- RQ3利用视觉上下文对查询进行掩码语义补全,是否能有效估计语义相似性并指导提议评分?
- RQ4通过重建损失与奖励反馈的语义补全反馈机制,是否能提升提议置信度分数的准确性?
主要发现
- 所提出的SCN方法在ActivityCaptions与Charades-STA数据集上均达到最先进性能,优于现有弱监督方法,甚至超越部分完全监督方法。
- SCN(w/o. rand)(移除随机选择)收敛更慢且性能更低,证实了早期训练中探索机制的有益作用。
- SCN(full)(含奖励反馈)相比SCN(w/o. reward)收敛更快且性能更优,证明了基于奖励的优化反馈环路的有效性。
- SCN(w/o. mask)性能劣于完整模型,证明掩码查询重建对准确估计语义相似性至关重要。
- SCN(w/o. share)性能略低且参数量更高,证实参数共享可提升知识迁移效率与模型紧凑性。
- 定性结果表明,高置信度的顶级提议与真实标注对齐良好,且重建损失越低,IoU越高,验证了语义对齐机制的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。