[论文解读] ProContEXT: Exploring Progressive Context Transformer for Tracking
ProContEXT 提出了一种基于 Transformer 的新型视觉目标跟踪器,通过多尺度静态与动态模板逐步编码空间和时间上下文,结合上下文感知的自注意力机制与自适应标记剪枝技术,实现了在 GOT-10k 和 TrackingNet 上的最先进性能,推理速度达 54.3 FPS,AO 达 86.8%,SR@0.5 达 96.8%。
Existing Visual Object Tracking (VOT) only takes the target area in the first frame as a template. This causes tracking to inevitably fail in fast-changing and crowded scenes, as it cannot account for changes in object appearance between frames. To this end, we revamped the tracking framework with Progressive Context Encoding Transformer Tracker (ProContEXT), which coherently exploits spatial and temporal contexts to predict object motion trajectories. Specifically, ProContEXT leverages a context-aware self-attention module to encode the spatial and temporal context, refining and updating the multi-scale static and dynamic templates to progressively perform accurately tracking. It explores the complementary between spatial and temporal context, raising a new pathway to multi-context modeling for transformer-based trackers. In addition, ProContEXT revised the token pruning technique to reduce computational complexity. Extensive experiments on popular benchmark datasets such as GOT-10k and TrackingNet demonstrate that the proposed ProContEXT achieves state-of-the-art performance.
研究动机与目标
- 解决现有视觉目标跟踪器仅依赖首帧单个静态模板所带来的局限性,尤其在快速变化和密集场景下的表现。
- 通过整合空间与时间上下文,克服因外观变化和遮挡导致的性能下降。
- 开发一种实时、高效的跟踪框架,利用多尺度静态与动态模板建模目标外观的演化过程。
- 通过改进的标记剪枝策略,在不牺牲准确率的前提下提升计算效率。
- 建立一种新型基于 Transformer 的上下文感知、渐进式特征编码范式,弥合传统上下文跟踪方法与无上下文方法之间的差距。
提出的方法
- 提出双模板机制:从初始帧提取静态模板,并基于先前跟踪结果动态更新模板,以建模外观变化。
- 采用上下文感知的自注意力模块,联合编码多尺度模板与搜索区域之间的空间与时间上下文。
- 通过重缩放模块重塑并处理所有模板与搜索区域,随后进行分块嵌入与位置编码,以适配 ViT 风格的输入。
- 应用基于保留比例 $\rho$ 的标记剪枝技术,在保持关键特征的同时减少 FLOPs,动态依据注意力图稀疏性调整。
- 使用跟踪头预测边界框,并在帧间通过渐进式优化循环更新动态模板。
- 采用 MAE 预训练以增强特征表示质量,并提升在大规模基准上的泛化能力。
实验结果
研究问题
- RQ1渐进式编码空间与时间上下文是否能提升在快速变化与密集视频序列中的跟踪鲁棒性?
- RQ2与单模板基线相比,多尺度静态与动态模板的整合对跟踪精度有何影响?
- RQ3上下文感知自注意力在 Transformer 跟踪器中在多大程度上增强了特征表示?
- RQ4在实时跟踪中应用标记剪枝时,计算效率与跟踪精度之间的最优权衡是什么?
- RQ5是否可通过统一的渐进式上下文编码框架,在无需额外分支或复杂模块的前提下超越现有最先进方法?
主要发现
- 在采用 MAE 预训练的前提下,ProContEXT 在 GOT-10k 上达到 86.8% AO 和 96.8% SR@0.5,分别优于先前最先进方法 OStrack 0.9%、1.5% 和 2.1%。
- 与仅使用静态模板相比,引入动态模板使 AO 提升 1.2%,SR@0.5 提升 1.4%,证明了时间上下文的价值。
- 使用多个静态模板(如尺度 [2.0, 4.0])使 AO 提升 +1.7%,SR@0.5 提升 +2.2%,证实了空间上下文建模的有效性。
- 消融实验表明,标记剪枝中保留比例 $\rho = 0.7$ 可将 GFLOPs 减少 16.5%(降至 38.0 GFLOPs),同时使 AO 提升 1.1%,SR@0.5 提升 1.3%。
- ProContEXT 在标准硬件上实现 54.3 FPS 的推理速度,证明即使在扩展的上下文建模下仍具备实时性能。
- 该模型在 TrackingNet 上也表现出色,性能优于最先进方法,证实其鲁棒性与可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。