Skip to main content
QUICK REVIEW

[论文解读] Single-Stage Visual Query Localization in Egocentric Videos

Hanwen Jiang, Santhosh Kumar Ramakrishnan|arXiv (Cornell University)|Jun 15, 2023
Advanced Image and Video Retrieval Techniques被引用 6
一句话总结

VQLoC 提出了一种单阶段、端到端可训练的框架,用于在第一人称视频中进行视觉查询定位,通过使用视觉变换器主干网络和交叉注意力机制,联合建模查询到帧以及帧到帧之间的时空对应关系。与先前的多阶段方法相比,该方法在准确率上提高了20%,推理速度提升了10倍,成为 Ego4D VQ2D 挑战赛排行榜上的第一名。

ABSTRACT

Visual Query Localization on long-form egocentric videos requires spatio-temporal search and localization of visually specified objects and is vital to build episodic memory systems. Prior work develops complex multi-stage pipelines that leverage well-established object detection and tracking methods to perform VQL. However, each stage is independently trained and the complexity of the pipeline results in slow inference speeds. We propose VQLoC, a novel single-stage VQL framework that is end-to-end trainable. Our key idea is to first build a holistic understanding of the query-video relationship and then perform spatio-temporal localization in a single shot manner. Specifically, we establish the query-video relationship by jointly considering query-to-frame correspondences between the query and each video frame and frame-to-frame correspondences between nearby video frames. Our experiments demonstrate that our approach outperforms prior VQL methods by 20% accuracy while obtaining a 10x improvement in inference speed. VQLoC is also the top entry on the Ego4D VQ2D challenge leaderboard. Project page: https://hwjiang1510.github.io/VQLoC/

研究动机与目标

  • 解决依赖独立、不可微分阶段的多阶段视觉查询定位(VQL)流水线所存在的局限性,并缓解其推理速度慢的问题。
  • 克服开放集对象查询、物体外观变化多样以及长时序第一人称视频中复杂视角、光照条件和遮挡带来的挑战。
  • 通过构建整体的查询-视频关系,实现在长时序第一人称视频中对视觉指定对象的精确且高效的时空定位。
  • 开发一个端到端可训练的系统,避免来自帧级检测的误差传播,并减少成对比较带来的冗余计算。

提出的方法

  • 使用 DINO 预训练的视觉变换器(ViT)主干网络,从视觉查询和每个视频帧中提取图像特征。
  • 通过一个交叉注意力变换器模块建立查询到帧的对应关系,实现查询与每个视频帧之间的区域匹配。
  • 利用一个自注意力变换器模块,在时间上传播这些对应关系,以利用相邻视频帧之间的时序连续性。
  • 设计一个具有局部时间窗口(大小为5)的时空变换器模块,以建模短时序依赖关系,避免长程建模问题。
  • 采用带有锚点回归的卷积预测头,并使用结合二值交叉熵(BCE)与困难负样本挖掘(HNM)的损失函数,以应对类别不平衡问题。
  • 使用多任务损失端到端训练整个模型,同时优化时序和时空定位的准确性。

实验结果

研究问题

  • RQ1单阶段、端到端的框架是否能在第一人称视频的视觉查询定位任务中超越复杂的多阶段流水线?
  • RQ2联合建模查询到帧和帧到帧的对应关系在提升定位准确率和推理速度方面有多有效?
  • RQ3在局部窗口大小和注意力机制方面,时空变换器模块的最佳设计是什么?
  • RQ4损失函数和预测头架构的选择在严重类别不平衡条件下如何影响性能?
  • RQ5所提出的方法是否能泛化到具有多样化物体外观和复杂视觉条件的长时序第一人称视频中?

主要发现

  • VQLoC 在 Ego4D 基准测试中,相较于之前最先进方法,准确率相对提升了20%,tAP@25 达到 0.29,stAP@25 达到 0.19。
  • 由于消除了冗余的成对比较并实现了单次定位,该模型在推理速度上相比多阶段基线实现了10倍加速。
  • 使用大小为5的局部时间窗口(在5 FPS下覆盖1秒)时性能最佳,而全局注意力因动态第一人称视频中的长程依赖关系导致性能下降。
  • 困难负样本挖掘(HNM)在预测头中表现优于焦点损失(focal loss),实现了47.05%的召回率和55.89%的成功率,原因是减少了来自困难正样本的噪声。
  • 消融实验表明,使用3层空间变换器(X-TX)和ViT-S14主干网络、输入分辨率为448×448时性能最佳,达到38.58%的召回率和53.12%的成功率。
  • 该模型对主干网络大小和特征分辨率具有鲁棒性,ViT-S14在448×448分辨率下在准确率与计算成本之间实现了最佳平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。