Skip to main content
QUICK REVIEW

[论文解读] Weakly Supervised Temporal Adjacent Network for Language Grounding

Yuechen Wang, Jiajun Deng|arXiv (Cornell University)|Jun 30, 2021
Multimodal Machine Learning Applications参考文献 62被引用 11
一句话总结

该论文提出了一种弱监督时序邻接网络(WSTAN),这是一种用于时序语言定位的新框架,将任务表述为多实例学习(MIL)问题,使用完整段落的描述而非单个查询。通过利用时序邻接网络、带有伪监督的互补分支以及自判别损失,WSTAN 提升了跨模态对齐与时序精度,在三个基准数据集上实现了最先进性能,且无需时序边界标注。

ABSTRACT

Temporal language grounding (TLG) is a fundamental and challenging problem for vision and language understanding. Existing methods mainly focus on fully supervised setting with temporal boundary labels for training, which, however, suffers expensive cost of annotation. In this work, we are dedicated to weakly supervised TLG, where multiple description sentences are given to an untrimmed video without temporal boundary labels. In this task, it is critical to learn a strong cross-modal semantic alignment between sentence semantics and visual content. To this end, we introduce a novel weakly supervised temporal adjacent network (WSTAN) for temporal language grounding. Specifically, WSTAN learns cross-modal semantic alignment by exploiting temporal adjacent network in a multiple instance learning (MIL) paradigm, with a whole description paragraph as input. Moreover, we integrate a complementary branch into the framework, which explicitly refines the predictions with pseudo supervision from the MIL stage. An additional self-discriminating loss is devised on both the MIL branch and the complementary branch, aiming to enhance semantic discrimination by self-supervising. Extensive experiments are conducted on three widely used benchmark datasets, \emph{i.e.}, ActivityNet-Captions, Charades-STA, and DiDeMo, and the results demonstrate the effectiveness of our approach.

研究动机与目标

  • 为解决完全监督时序语言定位中高昂的标注成本,通过仅使用视频级描述且无需时序边界标签来实现训练。
  • 在弱监督设置下,提升文本与视频内容之间的跨模态语义对齐,其中传统方法缺乏时序可区分性。
  • 通过建模时序上下文并利用带有伪监督的互补分支来优化预测,提升定位精度。
  • 探索使用粗粒度视频脚本作为弱监督的可行性,扩展至仅含极少标注的真实世界数据的应用。

提出的方法

  • 将弱监督时序语言定位表述为多实例学习(MIL)问题,将候选视频片段视为包,将文本段落视为实例。
  • 从均匀划分的视频片段构建二维得分图,其中每个元素代表从片段 i 到 j 的候选时序段,以建模时序关系。
  • 在MIL框架内引入时序邻接网络,利用视频片段间的序列依赖性,提升与段落级文本输入的对齐能力。
  • 引入一个互补分支,利用中间结果生成的伪标签来优化MIL分支的预测,减少语义稀疏性。
  • 在MIL分支和互补分支上均应用自判别损失,通过强调语义丰富的视频片段来增强时序可区分性。
  • 使用阈值化伪标签(o_max=1.0, o_min=0.9)以减少训练过程中监督信号的不确定性。

实验结果

研究问题

  • RQ1与单个查询输入相比,段落级文本输入是否能提升弱监督时序语言定位中的跨模态对齐与定位性能?
  • RQ2互补分支在优化MIL预测并揭示初始匹配中不明显的语义有意义片段方面有多有效?
  • RQ3自判别损失在通过强调小物体和姿态等关键语义内容来提升时序精度方面,其作用有多大?
  • RQ4WSTAN 是否能泛化至更弱的监督形式,如具有复杂语法的视频级脚本,而性能不会显著下降?

主要发现

  • WSTAN 在三个基准数据集——Charades-STA、ActivityNet-Captions 和 DiDeMo 上实现了最先进性能,且无需时序边界标注。
  • 段落输入设计在多数指标上提升了性能,表明聚合的文本输入可减少因视频间语义部分相似性带来的噪声。
  • 互补分支显著提升了定位精度,定性结果表明,完整WSTAN模型能检测到基础模型所遗漏的细微语义概念,如'off'。
  • 自判别损失增强了模型的判别能力,尤其在R@1指标上表现更优,而互补分支的伪标签阈值主要影响R@5指标。
  • WSTAN 在视频脚本作为弱监督时具有良好的泛化能力,性能与标准描述输入相当,验证了其在实际低资源场景下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。