[论文解读] Particle Video Revisited: Tracking Through Occlusions Using Point Trajectories
本文提出持久独立粒子(PIPs)方法,通过在独立点轨迹上建模时间先验,利用学习到的外观特征和代价体积进行迭代优化,实现对长视频序列中像素轨迹的追踪。该方法在遮挡鲁棒性追踪和关键点传播任务中达到最先进性能,在DAVIS基准上的平均PCK-T准确率相比光流和特征匹配方法最高提升9个百分点。
Tracking pixels in videos is typically studied as an optical flow estimation problem, where every pixel is described with a displacement vector that locates it in the next frame. Even though wider temporal context is freely available, prior efforts to take this into account have yielded only small gains over 2-frame methods. In this paper, we revisit Sand and Teller's "particle video" approach, and study pixel tracking as a long-range motion estimation problem, where every pixel is described with a trajectory that locates it in multiple future frames. We re-build this classic approach using components that drive the current state-of-the-art in flow and object tracking, such as dense cost maps, iterative optimization, and learned appearance updates. We train our models using long-range amodal point trajectories mined from existing optical flow data that we synthetically augment with multi-frame occlusions. We test our approach in trajectory estimation benchmarks and in keypoint label propagation tasks, and compare favorably against state-of-the-art optical flow and feature tracking methods.
研究动机与目标
- 解决光流和特征匹配在长期遮挡下追踪性能受限的问题。
- 通过利用多帧时间上下文,实现鲁棒的长距离像素轨迹估计。
- 在包含非模态轨迹和多帧遮挡的合成数据上进行模型训练,以提升泛化能力。
- 开发一种方法,在临时遮挡后仍能保持追踪持久性,不同于基于光流的方法。
- 提供一种可扩展、推理高效的轨迹估计框架,通过可见性线索支持任意长度的追踪。
提出的方法
- 模型输入为T帧的RGB视频和目标像素的初始(x,y)坐标,输出为T×2的轨迹矩阵。
- 采用具有MLP-Mixer主干的深度网络,联合估计所有帧中的位置和外观,利用学习到的时间先验。
- 通过基于每像素特征构建的4D相关体积执行迭代优化,受RAFT启发,但针对长距离轨迹估计进行了适配。
- 利用学习模块迭代更新外观特征,以适应帧间可见性和外观的变化。
- 在名为FlyingThings++的合成数据集上进行训练,该数据集在FlyingThings数据集基础上扩展了多帧非模态轨迹和合成遮挡。
- 引入可见性预测头,将短轨迹连接为任意长度的轨迹,实现对长时间遮挡的追踪。
实验结果
研究问题
- RQ1在包含非模态轨迹和遮挡的合成数据上训练的模型,能否泛化到真实世界视频中长期遮挡下的追踪任务?
- RQ2与两帧光流或局部特征匹配相比,利用长距离时间上下文是否能提升轨迹估计的鲁棒性?
- RQ3具有强时间先验的独立粒子追踪方法,是否能在光流方法失效的多个遮挡帧中保持准确性?
- RQ4在关键点传播任务中,所提方法与最先进光流和特征匹配方法相比表现如何?
- RQ5模型是否能从遮挡中恢复并重新识别长时间不可见的目标?
主要发现
- PIPs在DAVIS基准上实现了最高的平均PCK-T准确率,相比所有基线方法领先9个百分点。
- 在DAVIS数据集的七段视频中,有四段PIPs达到最佳关键点追踪准确率,其余三段由DINO表现最佳。
- PIPs在短暂遮挡期间保持追踪稳定,而RAFT会丢失目标,DINO则产生粗糙且不稳定的轨迹。
- 该模型展现出对遮挡的卓越鲁棒性,得益于其强时间先验,能成功在可见性丧失后重新识别目标。
- 使用包含非模态轨迹和多帧遮挡的合成数据,有效实现了向真实世界视频序列的泛化。
- 可见性预测使模型能够将短轨迹连接为任意长度的轨迹,将追踪能力扩展至模型原始时间窗口之外。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。