Skip to main content
QUICK REVIEW

[论文解读] RGB-T Tracking via Multi-Modal Mutual Prompt Learning

Yang Luo, Xiqing Guo|arXiv (Cornell University)|Aug 31, 2023
Video Surveillance and Tracking Methods被引用 4
一句话总结

本文提出了一种新型的RGB-T跟踪框架——多模态互激提示学习跟踪器(MPLT),通过基于多头注意力的提示器增强双分支孪生视觉Transformer,实现了可见光与热成像模态之间的双向、轻量级特征融合。该方法在LasHeR和RGBT210等多个基准上实现了最先进性能,兼具高推理速度与低计算成本。

ABSTRACT

Object tracking based on the fusion of visible and thermal im-ages, known as RGB-T tracking, has gained increasing atten-tion from researchers in recent years. How to achieve a more comprehensive fusion of information from the two modalities with fewer computational costs has been a problem that re-searchers have been exploring. Recently, with the rise of prompt learning in computer vision, we can better transfer knowledge from visual large models to downstream tasks. Considering the strong complementarity between visible and thermal modalities, we propose a tracking architecture based on mutual prompt learning between the two modalities. We also design a lightweight prompter that incorporates attention mechanisms in two dimensions to transfer information from one modality to the other with lower computational costs, embedding it into each layer of the backbone. Extensive ex-periments have demonstrated that our proposed tracking ar-chitecture is effective and efficient, achieving state-of-the-art performance while maintaining high running speeds.

研究动机与目标

  • 解决RGB-T跟踪中可见光与热成像模态高效且有效的特征融合挑战。
  • 克服单向提示学习与冻结主干网络架构在降低计算成本和提升模态交互方面的局限性。
  • 设计一种轻量级、可训练的提示模块,实现在特征提取过程中双向、多层级的特征交换。
  • 通过在线模板更新与卡尔曼滤波,提升对光照变化、遮挡及热交叉现象的鲁棒性。
  • 在参数增长极少、FLOPS极低的前提下实现高跟踪精度,支持实时部署。

提出的方法

  • 将视觉Transformer(ViT)主干网络扩展为双分支孪生结构,分别处理RGB图像与热成像。
  • 引入多模态视觉信息提示器(MVIP),结合令牌级与空间级注意力,生成模态特定的权重。
  • 利用MVIP自适应地关注某一模态的特征,并通过加权相加的方式将这些特征注入到另一模态的特征图中,每一层均执行此操作。
  • 将提示模块的输出与主干网络各层的输出融合,实现在特征图上的分层、多级融合。
  • 采用基于分类置信度的在线模板更新策略,以适应外观变化。
  • 引入卡尔曼滤波进行预测框优化,提升在遮挡与运动模糊情况下的鲁棒性。

实验结果

研究问题

  • RQ1与单向提示学习或直接拼接相比,双向、轻量级提示学习是否能提升RGB-T跟踪中的特征融合效果?
  • RQ2在提示模块中集成多头注意力机制是否能增强跨模态特征对齐与表征质量?
  • RQ3一个参数极少的可训练提示器能否实现与冻结主干方法相当或更优的性能,同时降低GPU显存使用?
  • RQ4所提出的在线模板更新与卡尔曼滤波优化在处理外观变化与遮挡方面有多高效?
  • RQ5互激提示学习机制在低光照、热交叉与快速运动等复杂场景中,能在多大程度上提升鲁棒性?

主要发现

  • 在LasHeR数据集上,MPLT取得72.0%的PR与57.1%的SR,优于包括ViPT、TBSI与MACFT在内的最先进方法。
  • 在RGBT210数据集上,MPLT取得86.2%的PR与63.0%的SR,超越所有对比方法,包括CAT、DMCNet与mfDiMP。
  • 消融实验表明,移除MVIP模块后PR下降6.1%,SR下降5.6%,证实其在性能中的关键作用。
  • 在MVIP中移除空间注意力或令牌注意力,PR下降3.5%至4.7%,表明两种注意力机制对有效融合均不可或缺。
  • 冻结主干网络导致PR下降3.8%,SR下降3.1%,但MPLT-F仍优于ViPT,证明互激提示设计具有强鲁棒性。
  • MPLT仅使用97M可训练参数与58.7G FLOPS,显著低于TBSI(307M参数,82.2G FLOPS),证明其卓越的效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。