[论文解读] COMET: Context-Aware IoU-Guided Network for Small Object Tracking
COMET 提出了一种上下文感知、IoU 引导的双流跟踪器,用于中高海拔航拍视频中的小目标跟踪。它采用离线提议生成策略以增强上下文学习,并使用包含多尺度特征和注意力模块的多任务网络,提升对遮挡和视角变化的鲁棒性,在 UAVDT、VisDrone-2019 和 Small-90 基准上,平均精度相比 ATOM 提升 6.2%,成功分数提升 7%。
We consider the problem of tracking an unknown small target from aerial videos of medium to high altitudes. This is a challenging problem, which is even more pronounced in unavoidable scenarios of drastic camera motion and high density. To address this problem, we introduce a context-aware IoU-guided tracker (COMET) that exploits a multitask two-stream network and an offline reference proposal generation strategy. The proposed network fully exploits target-related information by multi-scale feature learning and attention modules. The proposed strategy introduces an efficient sampling strategy to generalize the network on the target and its parts without imposing extra computational complexity during online tracking. These strategies contribute considerably in handling significant occlusions and viewpoint changes. Empirically, COMET outperforms the state-of-the-arts in a range of aerial view datasets that focusing on tracking small objects. Specifically, COMET outperforms the celebrated ATOM tracker by an average margin of 6.2% (and 7%) in precision (and success) score on challenging benchmarks of UAVDT, VisDrone-2019, and Small-90.
研究动机与目标
- 解决在高海拔航拍视频中目标仅占据少数像素、易受遮挡和视角变化影响的小目标跟踪挑战。
- 克服现有跟踪器因目标表征不足和缺乏上下文建模而难以处理小目标跟踪的局限性。
- 提升在密集、广角航拍场景中对大范围遮挡、视角变化和背景杂波的鲁棒性。
- 通过将复杂上下文学习任务卸载至离线训练,实现高效的在线推理机制,而不增加在线计算负担。
- 通过多尺度特征聚合和聚焦显著目标区域的注意力机制,增强特征表征能力。
提出的方法
- 提出一种离线参考提议生成策略,在训练期间从参考帧中提取高质量提议,以丰富上下文和目标部分表征。
- 采用双流多任务网络,分别处理外观和运动特征,随后进行特征融合以提升定位精度。
- 应用多尺度特征聚合,捕获不同感受野下的空间和语义表征。
- 集成轻量级空间与通道注意力模块,突出相关特征并抑制背景干扰。
- 优化多任务损失函数,结合交并比(IoU)与归一化中心位置误差(CLE),以提升边界框回归的准确性和鲁棒性。
- 利用预测的 IoU 和 CLE 实时优化边界框预测,实现对运动和外观变化的动态自适应。
实验结果
研究问题
- RQ1离线提议生成是否能在不增加在线推理成本的前提下提升小目标跟踪性能?
- RQ2结合注意力机制与多尺度特征的多任务双流网络,在航拍跟踪中对遮挡和视角变化的处理效果如何?
- RQ3IoU 引导的回归在高海拔视频中对极小目标的定位精度提升程度如何?
- RQ4与最先进跟踪器相比,COMET 在遮挡、长宽比变化和光照变化等多样化属性上的表现如何?
- RQ5从目标部分和周围区域进行上下文感知学习,是否能显著提升复杂航拍跟踪场景下的泛化能力?
主要发现
- 在 UAVDT、VisDrone-2019 和 Small-90 基准上,COMET 相较于 ATOM 跟踪器,平均精度提升 6.2%,成功分数提升 7%。
- 在 VisDrone-2019 数据集上,COMET 的 AUC 得分为 64.5,优于 ATOM(57.1)和 DiMP-50(60.8),在所有属性上均表现更优。
- 与 DiMP-50 相比,COMET 在小目标属性上提升最高达 9.5%,在视角变化属性上提升 4.4%。
- 在遮挡相关属性(FOC、POC、LO)上,COMET 相较 SiamMask 提升 12.1%,展现出对部分和完全遮挡的强大鲁棒性。
- 在长时跟踪属性上,COMET 相较 ATOM 提升 4.3%,表明其在长时间目标离屏后具备更强的重新识别与跟踪持续能力。
- 定性结果表明,COMET 在显著长宽比变化和复杂背景杂波下仍能保持高跟踪精度,在具有挑战性的序列中优于 SiamRPN++ 和 SiamMask。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。