[论文解读] Constraint and Union for Partially-Supervised Temporal Sentence Grounding
本文提出了一种部分监督时序句子定位(PTSG)设置,利用短片段或单帧标签以降低标注成本,同时保持高性能。该方法提出了一种四重约束流水线用于多模态表征学习,并设计了一种部分-全联合(PFU)框架,通过伪标签在部分监督与全监督之间建立桥梁,实现在Charades-STA和ActivityNet Captions数据集上的最先进性能,且显著降低了标注负担。
Temporal sentence grounding aims to detect the event timestamps described by the natural language query from given untrimmed videos. The existing fully-supervised setting achieves great performance but requires expensive annotation costs; while the weakly-supervised setting adopts cheap labels but performs poorly. To pursue high performance with less annotation cost, this paper introduces an intermediate partially-supervised setting, i.e., only short-clip or even single-frame labels are available during training. To take full advantage of partial labels, we propose a novel quadruple constraint pipeline to comprehensively shape event-query aligned representations, covering intra- and inter-samples, uni- and multi-modalities. The former raises intra-cluster compactness and inter-cluster separability; while the latter enables event-background separation and event-query gather. To achieve more powerful performance with explicit grounding optimization, we further introduce a partial-full union framework, i.e., bridging with an additional fully-supervised branch, to enjoy its impressive grounding bonus, and be robust to partial annotations. Extensive experiments and ablations on Charades-STA and ActivityNet Captions demonstrate the significance of partial supervision and our superior performance.
研究动机与目标
- 解决全监督时序句子定位(FTSG)的高标注成本问题,同时在性能上超越弱监督方法。
- 提出一种新颖的部分监督设置(PTSG),其中每个查询仅提供短片段或单帧标签,以在成本与性能之间取得平衡。
- 设计一种四重约束流水线,通过模态内与模态间、单模态与多模态约束,增强多模态表征学习。
- 开发一种部分-全联合(PFU)框架,利用全监督分支生成并优化伪标签,提升定位鲁棒性。
- 在不同标签分布和数据集上验证部分监督与所提框架的有效性。
提出的方法
- 应用四重约束流水线,通过从部分标签中提取的事件掩码,强制实现样本内事件-查询对齐与事件-背景分离。
- 利用查询相似度对语义相似的事件进行聚类,并应用对比损失以促进类内紧凑性与类间可分性。
- 通过事件检测器将部分标签(如单帧或短片段)扩展为完整的事件区间,构建事件掩码。
- 实施部分-全联合(PFU)框架,通过生成并优化伪标签,将全监督分支的定位优势迁移至部分监督设置。
- 采用平台形掩码而非高斯形掩码,以更清晰地区分事件与背景特征,提升表征质量。
- 应用T-SNE可视化,展示四重约束流水线应用后,特征表现出更强的类间可分性与类内紧凑性。
实验结果
研究问题
- RQ1是否能在仅使用短片段或单帧标签的部分监督设置下,实现接近全监督TSG的性能,同时显著降低标注成本?
- RQ2如何利用有限的部分标签有效塑造多模态表征,以提升定位质量?
- RQ3在部分监督下,样本间约束(如基于查询相似度的聚类)在增强表征学习中起到何种作用?
- RQ4部分-全联合(PFU)框架是否能有效弥合部分监督与全监督之间的差距,从而利用全监督方法的优势?
- RQ5所提方法对部分标签分布的变化是否具有鲁棒性?其性能是否在不同数据集和标注模式下均具泛化能力?
主要发现
- 所提出的四重约束流水线相比视频-查询表征,实现了4.4%的mIoU提升,证明了事件-查询对齐特征的优越性。
- 以2秒短片段标签作为锚点,其定位性能优于单帧标签,生成的伪标签质量更高。
- 平台形掩码优于高斯形掩码,且当掩码越接近门控形状时性能越优,表明其能更有效地实现事件与背景的区分。
- PFU框架在性能上接近全监督基线模型,即使在使用较弱的全监督方法时,mIoU下降也极小(如<1%)——在Charades-STA和ActivityNet Captions数据集上表现稳定。
- 消融实验表明,结合难负样本挖掘的样本间约束至关重要;若无此类约束,表征将退化为平凡解。
- T-SNE可视化显示,应用四重约束流水线后,视频特征展现出清晰的类间可分性与类内紧凑性,表明语义表征质量得到显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。