[论文解读] Exploring Lightweight Hierarchical Vision Transformers for Efficient Visual Tracking
本文提出HiT,一种用于高效视觉追踪的轻量化分层视觉变换器家族,通过桥接模块将深层语义特征与浅层高分辨率特征融合,并采用双图像位置编码以增强空间感知能力。HiT在LaSOT数据集上达到64.6%的AUC,且在Jetson AGX边缘设备上实现61 fps的推理速度,优于以往的高效追踪器在速度与精度上的表现。
Transformer-based visual trackers have demonstrated significant progress owing to their superior modeling capabilities. However, existing trackers are hampered by low speed, limiting their applicability on devices with limited computational power. To alleviate this problem, we propose HiT, a new family of efficient tracking models that can run at high speed on different devices while retaining high performance. The central idea of HiT is the Bridge Module, which bridges the gap between modern lightweight transformers and the tracking framework. The Bridge Module incorporates the high-level information of deep features into the shallow large-resolution features. In this way, it produces better features for the tracking head. We also propose a novel dual-image position encoding technique that simultaneously encodes the position information of both the search region and template images. The HiT model achieves promising speed with competitive performance. For instance, it runs at 61 frames per second (fps) on the Nvidia Jetson AGX edge device. Furthermore, HiT attains 64.6% AUC on the LaSOT benchmark, surpassing all previous efficient trackers.
研究动机与目标
- 解决基于变换器的视觉追踪器在资源受限的边缘设备上性能与速度之间的权衡问题。
- 缓解轻量化分层主干网络中因大步长下采样导致的信息丢失问题。
- 通过联合编码模板图像与搜索区域图像的位置信息,提升追踪中的空间建模能力。
- 构建一个可泛化的框架,实现轻量化分层变换器在视觉追踪中的高效部署。
提出的方法
- 引入桥接模块,将深层语义特征与浅层高分辨率特征融合,以恢复下采样过程中丢失的空间细节。
- 提出双图像位置编码,采用对角排列方式为模板和搜索区域分配唯一且不重叠的位置编码,实现联合位置编码。
- 采用单流追踪框架,结合预训练的轻量化分层视觉变换器主干网络(如LeViT或PVT)实现端到端的特征提取与融合。
- 在双图像设置中使用相对位置编码,以建模图像间的空间关系,同时避免引入冗余或重叠的位置信息。
- 设计HiT框架为模块化结构,支持灵活接入不同轻量化分层主干网络,如LeViT-384和PVT-Small。
- 使用标准的追踪损失函数与标准追踪头进行模型训练,同时通过轻量化组件保持推理效率。
实验结果
研究问题
- RQ1尽管存在因大步长下采样导致的信息丢失,轻量化分层视觉变换器是否能有效适配视觉追踪任务?
- RQ2与独立编码相比,模板与搜索区域的联合位置编码在多大程度上提升了追踪性能?
- RQ3所提出的桥接模块是否能有效恢复空间细节,同时在边缘设备上保持高速推理?
- RQ4HiT框架是否能在不同轻量化分层主干网络(如LeViT与PVT)上实现良好泛化?
- RQ5HiT是否能在边缘平台上的高效视觉追踪器中实现最优越的速度-精度权衡?
主要发现
- HiT在LaSOT基准测试中达到64.6%的AUC,超越所有先前的高效追踪器,并与高性能模型相当或更优。
- HiT在Nvidia Jetson AGX Xavier边缘设备上实现61 fps的推理速度,显著优于TransT(13 fps)和FEAR(38 fps)的速度表现。
- HiT-Base在LaSOT上的AUC比FEAR高出11.1%,同时在相同边缘平台上的推理速度快1.6倍。
- 采用PVT-Small主干的HiT在LaSOT上达到63.9%的AUC,在TrackingNet上达到78.4%,展现出在不同主干网络上的强大泛化能力。
- 采用对角排列的双图像位置编码优于绝对编码、独立相对编码、垂直和水平编码方法,取得了最佳的AUC得分。
- HiT在AGX平台上的推理速度比STARK-ST50快4.7倍,同时保持相近的性能,证明其在实时部署中的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。