Skip to main content
QUICK REVIEW

[论文解读] Regularized Two-Branch Proposal Networks for Weakly-Supervised Moment Retrieval in Videos

Zhu Zhang, Zhijie Lin|arXiv (Cornell University)|Aug 19, 2020
Multimodal Machine Learning Applications参考文献 44被引用 8
一句话总结

本文提出了一种正则化的两分支提议网络(RTBPN),用于弱监督视频瞬间检索,通过语言感知滤波器生成增强和抑制的视频流,以实现样本内对比学习。通过在两个分支之间共享参数以生成正样本和合理负样本提议,并应用提议正则化,RTBPN在ActivityCaption和Charades-STA基准上实现了最先进性能。

ABSTRACT

Video moment retrieval aims to localize the target moment in an video according to the given sentence. The weak-supervised setting only provides the video-level sentence annotations during training. Most existing weak-supervised methods apply a MIL-based framework to develop inter-sample confrontment, but ignore the intra-sample confrontment between moments with semantically similar contents. Thus, these methods fail to distinguish the target moment from plausible negative moments. In this paper, we propose a novel Regularized Two-Branch Proposal Network to simultaneously consider the inter-sample and intra-sample confrontments. Concretely, we first devise a language-aware filter to generate an enhanced video stream and a suppressed video stream. We then design the sharable two-branch proposal module to generate positive proposals from the enhanced stream and plausible negative proposals from the suppressed one for sufficient confrontment. Further, we apply the proposal regularization to stabilize the training process and improve model performance. The extensive experiments show the effectiveness of our method. Our code is released at here.

研究动机与目标

  • 解决现有弱监督方法仅关注样本间对比学习而忽略语义相似瞬间之间样本内对比学习的局限性。
  • 通过显式建模目标瞬间与同一视频中合理负样本瞬间之间的差异,提升定位精度。
  • 设计一种框架,通过共享的两分支架构同时利用样本间和样本内对比学习。
  • 通过提议正则化稳定训练并提升性能,防止低质量负样本提议的出现。
  • 仅使用视频级句子注释实现有效的弱监督学习,避免昂贵的时序边界注释。

提出的方法

  • 设计一种语言感知滤波器,将文本特征映射到通过NetVALD学习到的聚类中心,以构建语义中间空间。
  • 生成一个增强的视频流,突出显示与输入句子相关的帧,以及一个抑制的视频流,降低这些帧的重要性。
  • 实现一个共享的两分支提议模块:一个分支从增强流中生成正样本提议,另一个分支从抑制流中生成合理负样本提议。
  • 采用基于中心的提议策略,根据得分分布采样候选瞬间,确保提议的多样性和相关性。
  • 应用提议正则化以通过惩罚不一致的提议得分来稳定训练并提升泛化能力。
  • 使用基于MIL的目标函数进行模型训练,以鼓励最相关瞬间与给定句子之间的正确对齐。

实验结果

研究问题

  • RQ1在语义相似的瞬间之间进行样本内对比学习是否能提升弱监督视频瞬间检索性能?
  • RQ2如何有效生成合理负样本提议以增强模型的判别能力?
  • RQ3两分支之间的参数共享对提议质量和训练稳定性有何影响?
  • RQ4与仅基于视觉的评分相比,语言感知滤波机制如何提升跨模态对齐效果?
  • RQ5每视频的最优提议数量是多少,以在弱监督训练中平衡覆盖范围与噪声?

主要发现

  • 完整RTBPN模型在ActivityCaption和Charades-STA数据集上均达到最先进性能,R@1, IoU=0.5分别为48.7%和42.1%。
  • 移除语言感知滤波器(w/o. filter)或参数共享(w/o. parameter sharing)会导致性能显著下降,证实二者在样本内对比学习中的关键作用。
  • 仅使用视觉评分的模型(w/o. NetVALD)表现劣于完整模型,表明引入语言上下文的跨模态估计可提升得分分布质量。
  • 基于中心的提议方法优于所有提议和top-k提议基线,表明其在捕捉多样且相关瞬间候选方面具有有效性。
  • 每视频的最优提议数量为48个,当T设为48时在两个数据集上均取得最佳性能,且在更低或更高的值下均出现性能下降。
  • 定性结果表明,语言感知滤波器为相关帧分配更高得分,使增强分支能够比SCN基线更准确地定位目标瞬间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。