[论文解读] Weakly-Supervised Spatio-Temporally Grounding Natural Sentence in Video
本文提出了一项新颖的弱监督时空定位任务(WSSTG),在训练过程中无需任何时空标注,即可定位自然语句在视频中对应的时空管。该方法采用注意力交互模块建模细粒度的句子-实例匹配,并引入多样性损失以增强可靠预测,在新提出的 VID-sentence 数据集上实现了最先进性能。
In this paper, we address a novel task, namely weakly-supervised spatio-temporally grounding natural sentence in video. Specifically, given a natural sentence and a video, we localize a spatio-temporal tube in the video that semantically corresponds to the given sentence, with no reliance on any spatio-temporal annotations during training. First, a set of spatio-temporal tubes, referred to as instances, are extracted from the video. We then encode these instances and the sentence using our proposed attentive interactor which can exploit their fine-grained relationships to characterize their matching behaviors. Besides a ranking loss, a novel diversity loss is introduced to train the proposed attentive interactor to strengthen the matching behaviors of reliable instance-sentence pairs and penalize the unreliable ones. Moreover, we also contribute a dataset, called VID-sentence, based on the ImageNet video object detection dataset, to serve as a benchmark for our task. Extensive experimental results demonstrate the superiority of our model over the baseline approaches.
研究动机与目标
- 解决在无时空标注条件下定位自然语言语句在视频中对应时空管的挑战。
- 通过建模句子与时空实例之间细粒度的语义关系,提升定位准确率。
- 设计一种训练目标,通过多样性损失强化可靠预测并抑制错误预测。
- 构建一个新的基准数据集 VID-sentence,用于弱监督时空定位任务。
提出的方法
- 使用区域提议网络从视频中提取一组时空管提议(实例)。
- 利用一种新颖的注意力交互模块编码实例特征与句子嵌入,该模块在细粒度层面建模跨模态注意力。
- 引入多样性损失,对低IoU预测的高匹配分数进行惩罚,同时提升高IoU预测的分数。
- 在多实例学习框架中,结合排序损失与多样性损失进行模型训练。
- 推理阶段,将匹配分数最高的实例作为最终定位结果。
- 利用预训练的 I3D 网络提取视觉表征,使用 LSTM 编码句子。
实验结果
研究问题
- RQ1弱监督模型是否能在无任何时空标注的情况下,准确地定位自然语句在视频中对应的时空管?
- RQ2如何建模句子与视频实例之间的细粒度跨模态交互,以提升定位性能?
- RQ3多样性损失是否能有效抑制不可靠预测并增强可靠预测?
- RQ4所提方法在新提出的 VID-sentence 数据集和 Person-sentence 数据集上与现有基线方法相比表现如何?
主要发现
- 所提模型在 Person-sentence 数据集上达到 62.5% 的平均准确率,优于所有基线模型,包括 DVSA 和 GroundeR 变体。
- 在 VID-sentence 数据集上,完整模型达到 37.2% 的平均准确率,显著优于基础模型(31.0%)和无多样性损失的消融实验(在 Person-sentence 上为 47.1%)。
- 消融实验表明,注意力交互模块与多样性损失均对性能有显著贡献,其中注意力交互模块使准确率平均提升 3.5%,多样性损失提升 1.0%。
- 可视化结果表明,注意力交互模块能自适应地聚焦于与视觉内容匹配的相关词语(如 'puppy'、'hand')在不同视频片段中的对应区域。
- 分布图(图 7)证实,多样性损失有效降低了低IoU预测的匹配分数,同时提升了高IoU预测的分数。
- VID-sentence 数据集比现有基准更具挑战性,表现为上界性能更低(平均 47.6%),相较 Person-sentence 数据集(平均 77.9%)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。