Skip to main content
QUICK REVIEW

[论文解读] UniVTG: Towards Unified Video-Language Temporal Grounding

Kevin Qinghong Lin, Pengchuan Zhang|arXiv (Cornell University)|Jul 31, 2023
Multimodal Machine Learning Applications被引用 6
一句话总结

UniVTG 提出了一种统一的视频-语言时序定位框架,通过可扩展的伪标签数据,在单一公式下整合了时刻检索、亮点检测和视频摘要任务。通过利用灵活的双流模型和跨多样化时序标签的大规模预训练,UniVTG 在包括 QVHighlights、Charades-STA 和 QFVS 在内的七个基准上实现了最先进性能,展现出强大的零样本泛化能力。

ABSTRACT

Video Temporal Grounding (VTG), which aims to ground target clips from videos (such as consecutive intervals or disjoint shots) according to custom language queries (e.g., sentences or words), is key for video browsing on social media. Most methods in this direction develop taskspecific models that are trained with type-specific labels, such as moment retrieval (time interval) and highlight detection (worthiness curve), which limits their abilities to generalize to various VTG tasks and labels. In this paper, we propose to Unify the diverse VTG labels and tasks, dubbed UniVTG, along three directions: Firstly, we revisit a wide range of VTG labels and tasks and define a unified formulation. Based on this, we develop data annotation schemes to create scalable pseudo supervision. Secondly, we develop an effective and flexible grounding model capable of addressing each task and making full use of each label. Lastly, thanks to the unified framework, we are able to unlock temporal grounding pretraining from large-scale diverse labels and develop stronger grounding abilities e.g., zero-shot grounding. Extensive experiments on three tasks (moment retrieval, highlight detection and video summarization) across seven datasets (QVHighlights, Charades-STA, TACoS, Ego4D, YouTube Highlights, TVSum, and QFVS) demonstrate the effectiveness and flexibility of our proposed framework. The codes are available at https://github.com/showlab/UniVTG.

研究动机与目标

  • 将多样化的视频时序定位(VTG)任务——包括时刻检索、亮点检测和视频摘要——统一到一个可扩展的框架下。
  • 通过利用 CLIP 生成可扩展的伪标签,解决细粒度时序标注稀缺的问题,适用于多种标签类型(点、区间、曲线)。
  • 设计一种灵活的单模型架构,通过双流模态融合和多头解码,实现对所有 VTG 任务和标签类型的处理。
  • 实现跨异构标签的大规模时序定位预训练,从而解锁更强的零样本和少样本泛化能力。

提出的方法

  • 提出一种统一的 VTG 公式,将每段视频分解为一系列片段,每个片段关联三种查询条件元素:点级、区间级和曲线级标签。
  • 引入基于 CLIP 的数据蒸馏流程,从开放词汇、多样化的来源(如图像字幕和视频描述)中生成可扩展的细粒度伪标签。
  • 设计一种双流模型,包含单流融合和双流对齐路径,以有效整合所有标签类型的视觉与语言特征。
  • 为模型配备三个任务特定的头,用于解码点级、区间级和曲线级预测,实现所有 VTG 任务的端到端训练。
  • 采用统一的预训练策略,使用来自多个数据集(Ego4D、VideoCC、CLIP)的 420 万条伪标签样本,学习可泛化的时序定位表征。
  • 应用标签转换机制,将现有手动标注转换为统一格式,以支持有效的多任务学习并提升泛化能力。

实验结果

研究问题

  • RQ1统一的公式能否有效表示多样化的 VTG 任务和标签,包括点级、区间级和曲线级标注?
  • RQ2基于 CLIP 的伪标签生成在为多样化时序定位任务生成可扩展、高质量监督信号方面效果如何?
  • RQ3一个统一的单模型是否能在无需任务特定微调的情况下,在多个 VTG 任务上实现优异性能?
  • RQ4在统一的异构标签上进行大规模预训练,能在多大程度上提升时序定位任务的零样本和少样本泛化能力?
  • RQ5不同标签类型(点、区间、曲线)对统一框架整体性能的相对贡献如何?

主要发现

  • UniVTG 在 QVHighlights 上实现最先进性能,时刻检索的 mAP 达到 52.54,亮点检测的 mAP 达到 54.48,优于专用任务模型。
  • 在统一数据上进行预训练后,UniVTG 在 QFVS 视频摘要任务上的 F-score 达到 45.99,较之前最先进方法提升 4.62 分。
  • 模型展现出强大的零样本泛化能力:在多样化标签上进行预训练可显著提升未见领域上的性能,相比非统一预训练,时刻检索任务 mAP 提升 4.62 分。
  • 消融实验表明,曲线级标签在预训练中最为有效,且三类标签联合使用时性能最佳。
  • 将预训练数据从统一语料库的 0% 扩展到 100%,在时刻检索和亮点检测任务上均带来持续的性能提升。
  • 与非统一预训练相比,采用统一公式结合标签转换机制,亮点检测任务性能提升 1.28 mAP,时刻检索任务性能提升 4.62 mAP。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。