Skip to main content
QUICK REVIEW

[论文解读] Jointly Modeling Motion and Appearance Cues for Robust RGB-T Tracking

Pengyu Zhang, Jie Zhao|arXiv (Cornell University)|Jul 4, 2020
Video Surveillance and Tracking Methods参考文献 66被引用 10
一句话总结

本文提出JMMAC,一种鲁棒的RGB-T跟踪框架,通过一种新颖的晚期融合网络(MFNet)联合建模外观和运动线索,自适应地融合RGB与热成像响应。通过将目标运动模型与相机运动模型结合,并引入动态跟踪器切换机制,该方法在三个RGB-T基准测试中实现了最先进性能,在EAO指标和鲁棒性方面显著优于现有方法。

ABSTRACT

In this study, we propose a novel RGB-T tracking framework by jointly modeling both appearance and motion cues. First, to obtain a robust appearance model, we develop a novel late fusion method to infer the fusion weight maps of both RGB and thermal (T) modalities. The fusion weights are determined by using offline-trained global and local multimodal fusion networks, and then adopted to linearly combine the response maps of RGB and T modalities. Second, when the appearance cue is unreliable, we comprehensively take motion cues, i.e., target and camera motions, into account to make the tracker robust. We further propose a tracker switcher to switch the appearance and motion trackers flexibly. Numerous results on three recent RGB-T tracking datasets show that the proposed tracker performs significantly better than other state-of-the-art algorithms.

研究动机与目标

  • 为解决现有RGB-T跟踪器过度依赖外观线索、在遮挡、光照变化或热成像交叉干扰下失效的问题。
  • 通过设计一种基于全局与局部上下文的自适应加权策略,改进RGB-T跟踪中的多模态融合,以动态调整RGB与热成像响应的融合权重。
  • 通过引入运动线索(包括目标运动预测与相机运动补偿)提升外观退化情况下的鲁棒性。
  • 设计一种动态跟踪器切换机制,根据实时线索可靠性灵活选择基于外观或基于运动的跟踪策略。

提出的方法

  • 提出MFNet,一种多模态融合网络,利用离线训练的网络学习RGB与热成像响应图的全局与局部融合权重。
  • 采用RGB与热成像响应图的加权线性组合,融合权重由MFNet确定:$ \textbf{R}_F = w \times \textbf{R}_{RGB} + (1-w) \times \textbf{R}_T $。
  • 引入跟踪器切换器,根据实时线索可靠性在基于外观的跟踪(JMMAC)与基于运动的跟踪(TMP + CME)之间进行选择。
  • 通过运动预测模块建模目标运动,利用历史运动模式预测目标未来位置。
  • 使用仿射变换估计相机运动,以补偿相机移动,提升运动模糊或漂移情况下的跟踪稳定性。
  • 采用YOLOv2的边界框回归头进行边界框精炼,计算开销可忽略不计。

实验结果

研究问题

  • RQ1基于学习的全局与局部融合权重引导的RGB与热成像模态晚期融合,是否能显著提升跟踪鲁棒性,相较于早期融合或简单平均方法?
  • RQ2在外观线索因遮挡或模糊而不可靠时,目标与相机运动模型的集成在维持跟踪精度方面效果如何?
  • RQ3一种根据实时可靠性在基于外观与基于运动的跟踪间动态切换的跟踪器切换机制,是否能全面提升在多样化跟踪挑战下的整体鲁棒性?
  • RQ4所提出的MFNet融合机制是否在不同数据集上具有良好泛化能力,并在准确率与稳定性方面优于现有融合策略?

主要发现

  • MFNet在VOT19-RGBT数据集上取得0.7835的最高EAO得分,显著优于基线融合方法,如基于强度的融合(0.7796)和基于跟踪质量的融合(0.7454)。
  • 跟踪器切换器对参数扰动表现出强鲁棒性,在广泛参数范围内保持高性能,尤其在$ t_{\text{diff}} $上表现突出,表明过拟合程度较低。
  • 在相机运动模型中,仿射变换表现最佳,相比平移、相似变换和投影变换模型,显著提升了跟踪精度。
  • 整体JMMAC跟踪器运行速度约为4 FPS,MFNet与运动模块引入的计算开销极低,使系统适用于实时应用。
  • 在GTOT、RGBT234与VOT19-RGBT数据集上,JMMAC均达到最先进性能,EAO得分持续高于其他竞争的RGB-T跟踪器。
  • 消融实验证实,MFNet与运动建模组件均不可或缺,任一模块的移除均导致性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。