Skip to main content
QUICK REVIEW

[论文解读] TAFNet: A Three-Stream Adaptive Fusion Network for RGB-T Crowd Counting

Haihan Tang, Yi Wang|arXiv (Cornell University)|Feb 17, 2022
Video Surveillance and Tracking Methods被引用 5
一句话总结

TAFNet 提出了一种用于 RGB-T 人群计数的三流自适应融合网络,通过主干流处理融合的 RGB-热成像特征,同时利用两条辅助流提取模态特异性特征,并通过信息增强模块(IIM)实现自适应特征融合。该方法在 RGBT-CC 数据集上相较最先进方法,RMSE 和 MAE 指标均提升超过 20%,在明亮与黑暗环境下均表现出优越性能。

ABSTRACT

In this paper, we propose a three-stream adaptive fusion network named TAFNet, which uses paired RGB and thermal images for crowd counting. Specifically, TAFNet is divided into one main stream and two auxiliary streams. We combine a pair of RGB and thermal images to constitute the input of main stream. Two auxiliary streams respectively exploit RGB image and thermal image to extract modality-specific features. Besides, we propose an Information Improvement Module (IIM) to fuse the modality-specific features into the main stream adaptively. Experiment results on RGBT-CC dataset show that our method achieves more than 20% improvement on mean average error and root mean squared error compared with state-of-the-art method. The source code will be publicly available at https://github.com/TANGHAIHAN/TAFNet.

研究动机与目标

  • 解决仅使用 RGB 的方法在低光照条件下人群计数不准确的挑战。
  • 克服两流融合架构在早期融合过程中可能丢失模态特异性细节的局限性。
  • 通过自适应融合组合特征与模态特异性特征,提升 RGB-T 人群计数中的特征表示能力。
  • 在不同光照条件(明亮与黑暗环境)下实现平衡且准确的性能表现。
  • 提出一种新颖的三流架构,结合信息增强模块(IIM),以增强特征融合并减少冗余。

提出的方法

  • 采用三流网络架构:一条主干流处理拼接后的 RGB 与热成像图像对,两条辅助流分别独立处理 RGB 和热成像图像,以提取模态特异性特征。
  • 使用三个 VGG16 主干网络在多个阶段提取特征,确保各流之间融合点的一致性。
  • 引入信息增强模块(IIM),利用可学习的注意力机制,自适应地融合主干流中的组合特征与辅助流中的模态特异性特征。
  • 在 IIM 中集成通道注意力模块(CAO)与空间注意力模块(SAO),以突出融合特征中的关键通道与空间区域。
  • 在主干流的最后卷积层后添加回归头,用于预测最终的密度图。
  • 使用 Adam 优化器进行训练,权重衰减为 1e-4,初始初始学习率为 1e-5,在单张 RTX 2080 Ti GPU 上训练约 11 小时。

实验结果

研究问题

  • RQ1与两流融合架构相比,具有专用模态特异性流的三流架构是否能提升 RGB-T 人群计数中的特征表示?
  • RQ2通过 IIM 实现的组合特征与模态特异性特征的自适应融合,是否优于固定融合或早期融合策略?
  • RQ3所提出的方法是否能在单模态方法失效的明亮与黑暗光照条件下,实现一致且准确的性能表现?
  • RQ4IIM 模块在跨模态融合过程中,是否能有效减少冗余信息并增强相关特征?
  • RQ5三流设计在多大程度上提升了模型在复杂光照条件下的泛化能力与鲁棒性?

主要发现

  • TAFNet 在 RGBT-CC 数据集上取得 22.45 的 RMSE 和 12.38 的 GAME(0),优于先前的 SOTA 方法 CMCRL(RMSE: 28.18,GAME(0): 15.61),GAME(0) 提升 20.7%,RMSE 提升 20.3%。
  • 在明亮条件下,TAFNet 相较 CMCRL 在 GAME(0) 上提升 23.5%,RMSE 提升 25.5%,表明在高光照场景下具有显著优势。
  • 在黑暗条件下,TAFNet 仍优于 CMCRL,GAME(2) 提升 6.4%,RMSE 提升 5.3%,展现出在光照极端情况下的鲁棒性。
  • 消融实验表明,IIM 模块及其 CAO 与 SAO 组件均至关重要,若移除则 GAME(0) 相较完整模型增加 3.96 个点。
  • 结合 IIM 的三流架构在所有评估指标上均取得最低误差,表明模态特异性特征学习与自适应融合对性能至关重要。
  • 与先前方法相比,TAFNet 在明亮与黑暗条件之间的性能更加稳定,而先前方法通常在高光或低光环境下性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。