Skip to main content
QUICK REVIEW

[论文解读] Constraint and Union for Partially-Supervised Temporal Sentence Grounding

Chen Ju, Haicheng Wang|arXiv (Cornell University)|Feb 20, 2023
Multimodal Machine Learning Applications被引用 7
一句话总结

本文提出了一种部分监督时序句子定位(PTSG)设置,利用短片段或单帧标签以降低标注成本,同时保持高性能。该方法提出了一种四重约束流水线用于多模态表征学习,并设计了一种部分-全联合(PFU)框架,通过伪标签在部分监督与全监督之间建立桥梁,实现在Charades-STA和ActivityNet Captions数据集上的最先进性能,且显著降低了标注负担。

ABSTRACT

Temporal sentence grounding aims to detect the event timestamps described by the natural language query from given untrimmed videos. The existing fully-supervised setting achieves great performance but requires expensive annotation costs; while the weakly-supervised setting adopts cheap labels but performs poorly. To pursue high performance with less annotation cost, this paper introduces an intermediate partially-supervised setting, i.e., only short-clip or even single-frame labels are available during training. To take full advantage of partial labels, we propose a novel quadruple constraint pipeline to comprehensively shape event-query aligned representations, covering intra- and inter-samples, uni- and multi-modalities. The former raises intra-cluster compactness and inter-cluster separability; while the latter enables event-background separation and event-query gather. To achieve more powerful performance with explicit grounding optimization, we further introduce a partial-full union framework, i.e., bridging with an additional fully-supervised branch, to enjoy its impressive grounding bonus, and be robust to partial annotations. Extensive experiments and ablations on Charades-STA and ActivityNet Captions demonstrate the significance of partial supervision and our superior performance.

研究动机与目标

  • 解决全监督时序句子定位(FTSG)的高标注成本问题,同时在性能上超越弱监督方法。
  • 提出一种新颖的部分监督设置(PTSG),其中每个查询仅提供短片段或单帧标签,以在成本与性能之间取得平衡。
  • 设计一种四重约束流水线,通过模态内与模态间、单模态与多模态约束,增强多模态表征学习。
  • 开发一种部分-全联合(PFU)框架,利用全监督分支生成并优化伪标签,提升定位鲁棒性。
  • 在不同标签分布和数据集上验证部分监督与所提框架的有效性。

提出的方法

  • 应用四重约束流水线,通过从部分标签中提取的事件掩码,强制实现样本内事件-查询对齐与事件-背景分离。
  • 利用查询相似度对语义相似的事件进行聚类,并应用对比损失以促进类内紧凑性与类间可分性。
  • 通过事件检测器将部分标签(如单帧或短片段)扩展为完整的事件区间,构建事件掩码。
  • 实施部分-全联合(PFU)框架,通过生成并优化伪标签,将全监督分支的定位优势迁移至部分监督设置。
  • 采用平台形掩码而非高斯形掩码,以更清晰地区分事件与背景特征,提升表征质量。
  • 应用T-SNE可视化,展示四重约束流水线应用后,特征表现出更强的类间可分性与类内紧凑性。

实验结果

研究问题

  • RQ1是否能在仅使用短片段或单帧标签的部分监督设置下,实现接近全监督TSG的性能,同时显著降低标注成本?
  • RQ2如何利用有限的部分标签有效塑造多模态表征,以提升定位质量?
  • RQ3在部分监督下,样本间约束(如基于查询相似度的聚类)在增强表征学习中起到何种作用?
  • RQ4部分-全联合(PFU)框架是否能有效弥合部分监督与全监督之间的差距,从而利用全监督方法的优势?
  • RQ5所提方法对部分标签分布的变化是否具有鲁棒性?其性能是否在不同数据集和标注模式下均具泛化能力?

主要发现

  • 所提出的四重约束流水线相比视频-查询表征,实现了4.4%的mIoU提升,证明了事件-查询对齐特征的优越性。
  • 以2秒短片段标签作为锚点,其定位性能优于单帧标签,生成的伪标签质量更高。
  • 平台形掩码优于高斯形掩码,且当掩码越接近门控形状时性能越优,表明其能更有效地实现事件与背景的区分。
  • PFU框架在性能上接近全监督基线模型,即使在使用较弱的全监督方法时,mIoU下降也极小(如<1%)——在Charades-STA和ActivityNet Captions数据集上表现稳定。
  • 消融实验表明,结合难负样本挖掘的样本间约束至关重要;若无此类约束,表征将退化为平凡解。
  • T-SNE可视化显示,应用四重约束流水线后,视频特征展现出清晰的类间可分性与类内紧凑性,表明语义表征质量得到显著提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。