[论文解读] SwinTrack: A Simple and Strong Baseline for Transformer Tracking
SwinTrack 提出了一种基于完整注意力机制的 Siamese 跟踪器,使用 Swin Transformer 并加入轻量级 motion token 以提供时间上下文,在多个跟踪基准上达到最新的结果,同时保持实时速度。
Recently Transformer has been largely explored in tracking and shown state-of-the-art (SOTA) performance. However, existing efforts mainly focus on fusing and enhancing features generated by convolutional neural networks (CNNs). The potential of Transformer in representation learning remains under-explored. In this paper, we aim to further unleash the power of Transformer by proposing a simple yet efficient fully-attentional tracker, dubbed SwinTrack, within classic Siamese framework. In particular, both representation learning and feature fusion in SwinTrack leverage the Transformer architecture, enabling better feature interactions for tracking than pure CNN or hybrid CNN-Transformer frameworks. Besides, to further enhance robustness, we present a novel motion token that embeds historical target trajectory to improve tracking by providing temporal context. Our motion token is lightweight with negligible computation but brings clear gains. In our thorough experiments, SwinTrack exceeds existing approaches on multiple benchmarks. Particularly, on the challenging LaSOT, SwinTrack sets a new record with 0.713 SUC score. It also achieves SOTA results on other benchmarks. We expect SwinTrack to serve as a solid baseline for Transformer tracking and facilitate future research. Our codes and results are released at https://github.com/LitingLin/SwinTrack.
研究动机与目标
- 推动在 Siamese 跟踪中超越 CNN 基础或混合框架的完全 Transformer 基于表示学习与融合的应用。
- 引入一个轻量级的 motion token 以嵌入历史目标轨迹以实现时间鲁棒性。
- 开发一个基于 Swin Transformer 的简单、高效、完全注意力机制的跟踪框架。
- 在多个大规模基准上展示强性能与高效推理。
提出的方法
- 使用 Swin Transformer 主干提取模板和搜索区域特征(T-tokens 和 S-tokens)。
- 实现基于级联拼接的融合编码器,联合处理模板和搜索令牌以实现跨注意力交互。
- 引入 motion token(E_motion)编码目标轨迹历史,并在基于跨注意力的解码器中进行融合,以生成视觉-运动表征。
- 采用带有 IoU 感知分类损失(varifocal 损失)和广义 IoU 损失回归的头部,在推理阶段进行 Hann 窗口后处理。
- 用 LaSOT、TrackingNet、GOT-10k 和 COCO 进行训练,使用 AdamW 及谨慎的学习率调度以稳定训练。
实验结果
研究问题
- RQ1一个完全注意力机制(Transformer 基础)的跟踪器是否在表征学习和特征融合方面优于 CNN 基础和混合型跟踪器,用于 Siamese 跟踪?
- RQ2引入编码历史轨迹的 motion token 是否能提高对干扰物的鲁棒性和时间一致性?
- RQ3在 Swin Transformer 主干上简单的级联拼接融合是否足以在不同基准上达到最先进的结果?
- RQ4结构选择(位置编码、损失函数和解码策略)对跟踪性能和效率有何影响?
主要发现
- SwinTrack-T-224 在 LaSOT 上达到 0.672 SUC,约 98 fps,跻身其他 Transformer 跟踪器之列。
- SwinTrack-B-384 在 LaSOT 上创下 0.713 SUC 的新记录,并在 LaSOT_ext、TrackingNet、GOT-10k 和 TNL2k 上取得优秀结果。
- Motion token 在各数据集上显著提升性能,尤其在 LaSOT_ext 和 GOT-10k 上,带 motion-token 的变体优于未使用 motion token 的对应版本。
- 轻量级 motion token 提供鲁棒性且计算开销可忽略不计,消融表明基于嵌入的轨迹表示优于简单可学习令牌。
- 与 resnet 主干相比,Swin Transformer 主干显著提升 SUC 得分,在该设置中拼接融合优于跨注意力融合。
- SwinTrack 在多项基准上达到最先进准确度的同时,保持竞争力的速度(对于较轻量变体可达 98 fps)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。