[论文解读] Look at What I'm Doing: Self-Supervised Spatial Grounding of Narrations in Instructional Videos
本文提出一种自监督方法,通过多层跨模态注意力网络与对比学习,实现对教学视频中叙述性交互的空间定位。通过交替使用模态间与模态内注意力,并优化句子级别的对比损失,该模型在图像中的短语定位任务上达到最先进性能,在YouCook2视频中新型局部交互数据集上的表现也优于基线方法。
We introduce the task of spatially localizing narrated interactions in videos. Key to our approach is the ability to learn to spatially localize interactions with self-supervision on a large corpus of videos with accompanying transcribed narrations. To achieve this goal, we propose a multilayer cross-modal attention network that enables effective optimization of a contrastive loss during training. We introduce a divided strategy that alternates between computing inter- and intra-modal attention across the visual and natural language modalities, which allows effective training via directly contrasting the two modalities' representations. We demonstrate the effectiveness of our approach by self-training on the HowTo100M instructional video dataset and evaluating on a newly collected dataset of localized described interactions in the YouCook2 dataset. We show that our approach outperforms alternative baselines, including shallow co-attention and full cross-modal attention. We also apply our approach to grounding phrases in images with weak supervision on Flickr30K and show that stacking multiple attention layers is effective and, when combined with a word-to-region loss, achieves state of the art on recall-at-one and pointing hand accuracies.
研究动机与目标
- 解决在无手动空间标注的情况下,对复杂、复合型叙述性视频交互进行定位的挑战。
- 通过大规模教学视频与自动转录的叙述,实现自监督学习。
- 通过结构化注意力机制,提升自然语言句子与时空视频区域之间的跨模态对齐。
- 展示该架构在弱监督图像短语定位任务中的泛化能力。
- 引入一个新的评估数据集,包含教学视频中叙述性交互的空间标注。
提出的方法
- 提出一种对比多层多模态注意力(CoMMA)模块,通过交替使用模态间与模态内注意力,优化跨模态表示。
- 使用对比损失对齐语言与视觉模态的句子级表示,促进叙述动作与对应视频区域的全局对齐。
- 采用分阶段训练策略,在交替层中计算模态间的注意力,防止某一模态主导的退化解。
- 引入句子级损失,将整个叙述的聚合表示与视频片段进行对比,提升长距离依赖建模能力。
- 通过结合词到区域匹配损失与句子级对比损失,将模型应用于弱监督短语定位。
- 在HowTo100M上端到端进行自监督训练,并在新收集的、带有空间标注的YouCook2基础数据集上进行评估。
实验结果
研究问题
- RQ1自监督模型是否能在无任何人工空间标注监督的情况下,有效定位视频中的叙述性交互?
- RQ2与标准协同注意力或完整交叉注意力相比,交替使用模态间与模态内注意力是否能提升跨模态对齐?
- RQ3结合对比学习的多层注意力机制是否能在视频中定位复杂、复合短语方面,优于浅层注意力模型?
- RQ4该模型在弱监督图像短语定位任务中的泛化性能如何?句子级损失在此设置中起到什么作用?
- RQ5堆叠多个注意力层是否能同时提升视频交互定位与图像短语定位任务的性能?
主要发现
- 所提出的CoMMA模型在Flickr30K上的弱监督短语定位任务中,于召回率-1(R@1)与指向手准确率方面达到最先进性能,优于先前方法。
- 增加第二层交叉注意力后,R@1从49.99%提升至53.80%,指向手召回率从74.97%提升至76.78%,表明深层注意力具有优势。
- 在新的基于YouCook2的数据集中,该模型优于浅层协同注意力与完整交叉注意力基线模型。
- 句子级对比损失显著提升了全局对齐与性能,尤其在涉及多个物体与动作的复杂视频交互中表现更优。
- 词到区域匹配损失在图像短语定位中至关重要,但在视频交互定位中作用较小,表明不同模态对齐需求不同。
- 当结合句子级损失进行训练时,堆叠多个注意力层能提升性能,表明深层架构对复杂定位任务有益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。