Skip to main content
QUICK REVIEW

[论文解读] Siamese Infrared and Visible Light Fusion Network for RGB-T Tracking

Jingchao Peng, Haitao Zhao|arXiv (Cornell University)|Mar 12, 2021
Video Surveillance and Tracking Methods参考文献 38被引用 15
一句话总结

本文提出 SiamIVFN,一种用于 RGB-T 视觉追踪的孪生融合网络,通过互补特征融合网络(CFFN)和贡献聚合网络(CAN)结合红外与可见光特征。该方法在两个基准数据集上实现了 147.6 FPS 的推理速度,达到最先进性能,通过自适应特征融合与错位处理,在不同光照条件下表现出强鲁棒性。

ABSTRACT

Due to the different photosensitive properties of infrared and visible light, the registered RGB-T image pairs shot in the same scene exhibit quite different characteristics. This paper proposes a siamese infrared and visible light fusion Network (SiamIVFN) for RBG-T image-based tracking. SiamIVFN contains two main subnetworks: a complementary-feature-fusion network (CFFN) and a contribution-aggregation network (CAN). CFFN utilizes a two-stream multilayer convolutional structure whose filters for each layer are partially coupled to fuse the features extracted from infrared images and visible light images. CFFN is a feature-level fusion network, which can cope with the misalignment of the RGB-T image pairs. Through adaptively calculating the contributions of infrared and visible light features obtained from CFFN, CAN makes the tracker robust under various light conditions. Experiments on two RGB-T tracking benchmark datasets demonstrate that the proposed SiamIVFN has achieved state-of-the-art performance. The tracking speed of SiamIVFN is 147.6FPS, the current fastest RGB-T fusion tracker.

研究动机与目标

  • 为解决 RGB-T 跟踪中红外与可见光图像因感光特性不同而带来的融合挑战。
  • 通过自适应结合两种模态的互补特征,提升在不同光照条件下的追踪鲁棒性。
  • 设计一种轻量化、高速的融合网络,在保持高精度的同时实现实时推理。
  • 通过部分耦合滤波器的特征级融合,处理 RGB 与热成像图像对之间的空间错位。

提出的方法

  • 网络采用孪生架构,通过两条并行分支分别处理可见光与红外图像。
  • 互补特征融合网络(CFFN)在各层使用部分耦合滤波器,实现多层级的双模态特征融合。
  • CFFN 实现了对 RGB 与热成像图像对之间空间错位具有鲁棒性的特征级融合。
  • 贡献聚合网络(CAN)根据当前环境条件,自适应计算红外与可见光特征的重要性。
  • 融合过程动态调整模态贡献,增强了在低光照或强眩光场景下的鲁棒性。
  • 整个网络端到端可训练,并针对实时推理进行优化,在标准基准上实现 147.6 FPS 的推理速度。

实验结果

研究问题

  • RQ1如何有效融合红外与可见光特征,以提升在不同光照条件下追踪的准确性?
  • RQ2在基于深度学习的追踪框架中,处理 RGB 与热成像图像对之间空间错位的最优方法是什么?
  • RQ3具有自适应模态加权的孪生架构能否提升在复杂视觉追踪场景下的鲁棒性?
  • RQ4如何设计特征融合机制,在保持最先进性能的同时实现高推理速度?
  • RQ5在不同环境条件下,红外与可见光特征的贡献比例是多少,以及如何自适应学习该比例?

主要发现

  • SiamIVFN 在两个主要的 RGB-T 跟踪基准上达到最先进性能,优于现有基于融合的追踪器。
  • 该追踪器运行速度达 147.6 FPS,是目前报道中速度最快的 RGB-T 融合追踪器。
  • 贡献聚合网络(CAN)实现了红外与可见光特征的动态加权,显著提升了在低光照与强眩光条件下的鲁棒性。
  • CFFN 中的局部耦合滤波器设计能有效处理 RGB 与热成像图像对之间的空间错位。
  • 消融实验表明,CFFN 与 CAN 均对性能有显著贡献,其中 CAN 在光照变化场景中尤为有效。
  • 由于自适应融合机制与鲁棒的特征表示,该模型在多样化环境中表现出良好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。