Skip to main content
QUICK REVIEW

[论文解读] Compositional Temporal Grounding with Structured Variational Cross-Graph Correspondence Learning

Juncheng Li, Junlin Xie|arXiv (Cornell University)|Mar 24, 2022
Multimodal Machine Learning Applications被引用 5
一句话总结

本文提出 VISA,一种用于组合性时序定位的变分跨图推理框架,通过层次化语义图(全局事件、局部动作、原子对象)对视频和语言进行建模,实现细粒度、结构化的跨模态对应。该方法在组合泛化方面取得显著提升,尤其在新词组合上,Charades-CG 上 R@1 最高提升 33.97%,ActivityNet-CG 上提升 31.89%。

ABSTRACT

Temporal grounding in videos aims to localize one target video segment that semantically corresponds to a given query sentence. Thanks to the semantic diversity of natural language descriptions, temporal grounding allows activity grounding beyond pre-defined classes and has received increasing attention in recent years. The semantic diversity is rooted in the principle of compositionality in linguistics, where novel semantics can be systematically described by combining known words in novel ways (compositional generalization). However, current temporal grounding datasets do not specifically test for the compositional generalizability. To systematically measure the compositional generalizability of temporal grounding models, we introduce a new Compositional Temporal Grounding task and construct two new dataset splits, i.e., Charades-CG and ActivityNet-CG. Evaluating the state-of-the-art methods on our new dataset splits, we empirically find that they fail to generalize to queries with novel combinations of seen words. To tackle this challenge, we propose a variational cross-graph reasoning framework that explicitly decomposes video and language into multiple structured hierarchies and learns fine-grained semantic correspondence among them. Experiments illustrate the superior compositional generalizability of our approach. The repository of this work is at https://github.com/YYJMJC/ Compositional-Temporal-Grounding.

研究动机与目标

  • 系统评估时序定位模型在组合泛化方面的表现,因为当前数据集因训练与测试划分中存在重叠组合,无法准确衡量此能力。
  • 识别当前最先进模型在已见词汇的新组合上泛化失败的问题,尽管其在标准基准上表现优异。
  • 解决现有方法在语义建模方面缺乏结构化的问题,这些方法依赖非结构化的全局表征,无法捕捉语言与视觉的组合性。
  • 开发一种框架,显式建模视频与语言中的层次化语义,并学习细粒度的跨图对应,以实现联合组合推理。
  • 构建两个新的基准划分,即 Charades-CG 与 ActivityNet-CG,以实现对时序定位中组合泛化能力的严格评估。

提出的方法

  • 提出一种层次化语义图,将视频与语言分解为三个结构化层级:全局事件、局部动作与原子对象,实现语义的结构化表征。
  • 设计一种结构化跨模态注意力机制,学习视频图与语言图中节点之间的细粒度语义对应,促进组合推理。
  • 引入一种变分跨图对应(VCC)模块,对结构化节点之间的概率化、可微分对应关系进行建模,实现对不确定性的感知对齐。
  • 提出一种结构化对比学习(SCL)目标,增强模型区分细微语义差异的能力,尤其在复杂或新组合中表现更优。
  • 采用对比学习与交叉注意力机制相结合的方式,端到端训练 VISA 框架,联合优化时序定位与组合对齐任务。
  • 采用基于阈值的可视化方法,解释学习到的图结构,突出显示语言词汇与视觉片段之间的关键语义对应。

实验结果

研究问题

  • RQ1当前最先进时序定位模型在已见词汇的新组合上泛化能力如何?其在新组合上的表现与在已见组合上的表现相比如何?
  • RQ2现有模型对查询句中词序变化的敏感度如何?这是否表明其依赖于表面相关性而非组合语义?
  • RQ3通过层次化图对视频与语言语义进行结构化建模,能否提升时序定位中的组合泛化能力?
  • RQ4结构化对比学习(SCL)与变分跨图对应(VCC)对模型处理新组合的能力分别有何贡献?
  • RQ5当查询包含训练中未见的复杂或新组合语言表达时,模型在时序定位上的表现如何?

主要发现

  • 最先进模型在组合泛化方面表现严重不足:在 Charades-CG 上,R@1 从已见组合的 24.14% 下降至新组合的 33.97%,表明其对未见词组合泛化能力差。
  • SOTA 模型对词序变化高度不敏感:在词序打乱的查询上性能几乎与原始查询无异,IoU 分数几乎不变,表明其依赖于表面相关性而非组合语义。
  • 所提出的 VISA 框架在 Charades-CG 与 ActivityNet-CG 上均达到 SOTA 性能,新组合划分上的 R@1 分别为 29.80% 与 27.60%,显著优于基线模型。
  • 消融实验表明,若移除 SCL 或 VCC,性能将显著下降(例如在 Charades-CG 上从 24.31% 降至 19.64%),证实二者在建模细粒度语义中的关键作用。
  • 定性分析表明,VISA 能够基于组合语义正确定位时序段(如区分 'prepares to jump' 与 'jump'),而基线模型因误读时序或语义结构而失败。
  • 对学习图结构的可视化显示,VISA 能够成功将 'perform kickboxing' 等语言术语与对应视觉元素(如 'punching person'、'boxing ring')对齐,证明了其有效的跨模态对应能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。