[论文解读] SiamMan: Siamese Motion-aware Network for Visual Tracking
SiamMan 提出了一种孪生运动感知网络用于视觉跟踪,通过引入定位分支减少对锚框的依赖,增强了对运动变化和遮挡的鲁棒性。通过结合全局上下文模块与多尺度可学习注意力机制,其在四个基准测试中达到最先进性能,推理速度达 45 FPS。
In this paper, we present a novel siamese motion-aware network (SiamMan) for visual tracking, which consists of the siamese feature extraction subnetwork, followed by the classification, regression, and localization branches in parallel. The classification branch is used to distinguish the foreground from background, and the regression branch is adopt to regress the bounding box of target. To reduce the impact of manually designed anchor boxes to adapt to different target motion patterns, we design the localization branch, which aims to coarsely localize the target to help the regression branch to generate accurate results. Meanwhile, we introduce the global context module into the localization branch to capture long-range dependency for more robustness in large displacement of target. In addition, we design a multi-scale learnable attention module to guide these three branches to exploit discriminative features for better performance. The whole network is trained offline in an end-to-end fashion with large-scale image pairs using the standard SGD algorithm with back-propagation. Extensive experiments on five challenging benchmarks, i.e., VOT2016, VOT2018, OTB100, UAV123 and LTB35, demonstrate that SiamMan achieves leading accuracy with high efficiency. Code can be found at https://isrc.iscas.ac.cn/gitlab/research/siamman.
研究动机与目标
- 解决基于锚框的回归在孪生跟踪网络中的局限性,特别是在快速运动、遮挡和尺度变化情况下的表现。
- 通过引入定位分支实现粗略目标定位,以减少对人工设计锚框的依赖,从而指导回归。
- 通过在定位分支中集成全局上下文模块,提升对大目标位移的鲁棒性,以捕捉长距离依赖关系。
- 通过可学习的多尺度注意力模块,在多个尺度上增强特征判别力,引导分类、回归和定位分支。
- 在保持多个基准测试最先进精度的同时,实现端到端训练与高效率、实时推理。
提出的方法
- 使用孪生特征提取子网络,在共享主干网络中处理样本区域与搜索区域的配对。
- 引入三个并行分支:分类(前景/背景)、回归(边界框预测)和定位(粗略目标定位)。
- 在定位分支中集成全局上下文模块,以建模长距离空间依赖关系,提升对大位移的鲁棒性。
- 设计一个多尺度可学习注意力模块,动态融合不同尺度的特征,以引导所有三个分支获得更具判别力的表示。
- 在大规模数据集(MS COCO、ImageNet、YouTube-BoundingBoxes)上使用随机梯度下降(SGD)与反向传播进行端到端训练,实现离线特征学习。
- 推理阶段,仅使用第一帧的边界框作为唯一样本,执行一次检测,无需在线模型更新。
实验结果
研究问题
- RQ1一个能够粗略定位目标的定位分支是否能减少对锚框的依赖,并在复杂运动模式下提升跟踪精度?
- RQ2全局上下文模块在提升视觉跟踪中对大目标位移的鲁棒性方面效果如何?
- RQ3多尺度可学习注意力模块在多样化视觉跟踪场景中,对特征判别力与跟踪器性能的提升程度如何?
- RQ4所提出的 SiamMan 框架是否在多个标准基准测试中均达到最先进性能,同时保持实时推理速度?
- RQ5各个组件(定位、全局上下文、注意力)对整体跟踪性能的贡献在量化上如何?
主要发现
- SiamMan 在 VOT2016 上达到新的最先进 EAO 得分为 0.513,相比第二名 tracker 相对提升 8.9%。
- 在 VOT2018 上,SiamMan 的 EAO 达到 0.462,相比亚军提升 3.6%,展现出在挑战性条件下的强大性能。
- 消融实验表明,移除定位分支后,VOT2016 的 EAO 下降 0.024,VOT2018 下降 0.017,证实其关键作用。
- 全局上下文模块贡献显著,移除后 VOT2016 的 EAO 下降 0.009,VOT2018 下降 0.015。
- 多尺度注意力模块使 VOT2016 的 EAO 提升 0.019,VOT2018 提升 0.016,凸显其在特征选择中的有效性。
- SiamMan 在 UAV123 上表现与最先进方法相当,并保持 45 FPS 的实时推理速度,确保实际部署的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。