Skip to main content
QUICK REVIEW

[论文解读] Transforming Model Prediction for Tracking

C. Mayer, Martin Danelljan|arXiv (Cornell University)|Mar 21, 2022
Video Surveillance and Tracking Methods被引用 5
一句话总结

本文提出 ToMP,一种新型跟踪框架,用基于 Transformer 的模型预测器替代传统的基于优化的模型预测器,以学习更具表现力的目标模型。通过联合预测判别性目标模型和边界框回归器的权重,ToMP 实现了最先进性能,在 LaSOT 上达到 68.5% 的 AUC,并在多个基准测试中超越先前方法。

ABSTRACT

Optimization based tracking methods have been widely successful by integrating a target model prediction module, providing effective global reasoning by minimizing an objective function. While this inductive bias integrates valuable domain knowledge, it limits the expressivity of the tracking network. In this work, we therefore propose a tracker architecture employing a Transformer-based model prediction module. Transformers capture global relations with little inductive bias, allowing it to learn the prediction of more powerful target models. We further extend the model predictor to estimate a second set of weights that are applied for accurate bounding box regression. The resulting tracker relies on training and on test frame information in order to predict all weights transductively. We train the proposed tracker end-to-end and validate its performance by conducting comprehensive experiments on multiple tracking datasets. Our tracker sets a new state of the art on three benchmarks, achieving an AUC of 68.5% on the challenging LaSOT dataset.

研究动机与目标

  • 为解决判别相关滤波(DCF)跟踪器中基于优化的模型预测器表达能力有限的问题。
  • 通过利用 Transformer 的全局推理机制替代 DCF 优化的归纳偏置,提升跟踪性能。
  • 通过从测试时特征中端到端学习目标模型权重与边界框回归权重,实现端到端训练。
  • 通过在 Transformer 输入中引入目标位置与尺寸的新编码方式,提升定位精度。
  • 在多个标准跟踪基准测试(包括 LaSOT、OTB-100 和 UAV123)上实现最先进性能。

提出的方法

  • 用基于 Transformer 的模型预测器替代标准 DCF 模型优化器,从支持帧和查询帧特征序列中生成目标模型权重。
  • 引入两种新型位置编码:一种用于目标位置,一种用于目标尺寸,以引导 Transformer 关注相关空间信息。
  • 扩展模型预测器,输出第二组权重用于独立的边界框回归器网络,实现定位的归纳性优化。
  • 采用两阶段推理流程:首先预测目标模型权重用于定位,随后使用第二组权重进行精确边界框回归。
  • 通过可微分的优化过程端到端训练整个跟踪器,该过程展开模型预测与回归步骤。
  • 使用 ResNet-50 和 ResNet-101 主干网络提取特征,由 Transformer 同时处理支持与查询特征以预测权重。

实验结果

研究问题

  • RQ1基于 Transformer 的模型预测器是否能在视觉跟踪中超越传统的基于优化的模型预测器?
  • RQ2联合学习目标模型权重与回归权重是否能提升跟踪精度与鲁棒性?
  • RQ3针对目标位置与尺寸的专用编码如何影响基于 Transformer 的跟踪器性能?
  • RQ4能否通过归纳性、测试时的权重预测机制实现优于固定或优化模型的泛化能力?
  • RQ5所提方法是否在主要视觉跟踪基准测试中树立了新的最先进水平?

主要发现

  • ToMP 在 LaSOT 基准测试中达到 68.5% 的新最先进 AUC,显著优于先前方法。
  • ToMP-101 在 VOT2020ST 挑战赛中实现最高鲁棒性与具有竞争力的精度,EAO 得分为 0.309,在仅使用边界框的跟踪器中排名第一。
  • 在 OTB-100 上,ToMP-50 与 ToMP-101 的 AUC 均超过 70%,其中 ToMP-101 与 SuperDiMP 表现相当,并略胜于 TransT。
  • 在 NFS 数据集上,ToMP-101 比 KeepTrack 提升 +0.5% AUC,展现出在高速运动与干扰物密集序列中的强劲性能。
  • 消融实验确认,新型位置编码与双权重预测机制均对性能提升有显著贡献。
  • ToMP 在 LaSOT 数据集的所有属性上均优于所有基于 Transformer 的跟踪器,表明其在多样化跟踪挑战中具备广泛的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。