[论文解读] Spatio-channel Attention Blocks for Cross-modal Crowd Counting
本文提出了一种跨模态空间-通道注意力(CSCA)模块,这是一种即插即用的模块,通过联合建模RGB、热成像和深度模态之间的空间与通道注意力,提升跨模态人群计数性能。该方法在RGB-T和RGB-D数据集上,针对多种主干网络均实现了性能提升,通过低计算开销有效融合多模态特征,达到最先进水平。
Crowd counting research has made significant advancements in real-world applications, but it remains a formidable challenge in cross-modal settings. Most existing methods rely solely on the optical features of RGB images, ignoring the feasibility of other modalities such as thermal and depth images. The inherently significant differences between the different modalities and the diversity of design choices for model architectures make cross-modal crowd counting more challenging. In this paper, we propose Cross-modal Spatio-Channel Attention (CSCA) blocks, which can be easily integrated into any modality-specific architecture. The CSCA blocks first spatially capture global functional correlations among multi-modality with less overhead through spatial-wise cross-modal attention. Cross-modal features with spatial attention are subsequently refined through adaptive channel-wise feature aggregation. In our experiments, the proposed block consistently shows significant performance improvement across various backbone networks, resulting in state-of-the-art results in RGB-T and RGB-D crowd counting.
研究动机与目标
- 解决在不同光照和遮挡条件下,从RGB、热成像和深度等异构模态中融合特征的挑战。
- 开发一种轻量化、可复用的模块,可无缝集成到任意现有基于RGB的人群计数主干网络中,无需重新设计网络架构。
- 克服简单融合策略(如早期或晚期融合)因模态错位和噪声导致性能下降的局限性。
- 实现自适应、动态的特征聚合,捕捉空间和通道维度上的模态间与模态内相关性。
提出的方法
- CSCA模块采用空间级跨模态注意力(SCA)模块,通过在不同模态间计算查询、键和值特征,实现跨模态注意力,以减少计算量的方式建模全局空间相关性。
- SCA在空间层面重新组合特征图,以高效捕捉不同模态之间的长距离依赖关系,避免标准非局部模块带来的高成本。
- 通道级特征聚合(CFA)模块通过学习通道权重,自适应地重新校准空间注意力后的特征,增强特征的判别性表示。
- CSCA模块被设计为即插即用模块,可无需从头训练,直接集成到任意预训练的单模态主干网络(如BL、ResNet)中。
- 该方法采用可学习的注意力机制,能根据模态特异性特征分布动态调整注意力权重,提升对噪声和光照变化的鲁棒性。
- 该架构在RGB-T和RGB-D数据集上进行了评估,结果表明其在多种主干网络和融合策略下均表现出一致的性能增益。
实验结果
研究问题
- RQ1一种轻量化、模块化的注意力机制能否在无需架构重构的前提下,有效融合RGB、热成像和深度等多模态特征用于人群计数?
- RQ2与标准非局部模块或简单融合方法相比,所提出的CSCA模块在准确率和计算效率方面表现如何?
- RQ3在跨模态设置下,CSCA在不同光照条件和噪声水平下能将性能提升到何种程度?
- RQ4多模态数据的互补融合是否在复杂人群计数场景中始终优于单模态(仅RGB或单一模态)方法?
主要发现
- CSCA模块在RGBT-CC和ShanghaiTechRGBD数据集上均达到最先进性能,优于多种主干网络上的现有方法。
- 在ShanghaiTechRGBD数据集上,使用BL主干网络时,该方法的RMSE为24.74,显著优于低光照条件下仅使用RGB(RMSE: 87.29)和仅使用热成像(RMSE: 28.45)的基线模型。
- 消融实验表明,若移除SCA或CFA模块,性能均出现严重下降,证明了两个模块之间的互补作用。
- 将SCA替换为标准非局部模块后,在高分辨率图像(1920×1080)上出现内存溢出错误,凸显CSCA在计算效率上的显著优势。
- 可视化结果表明,CSCA能有效利用低光照场景下的热成像数据,并减少深度数据中的噪声引起的误差,提升定位精度。
- 该方法在不同输入设置(包括单模态RGB、单模态热成像、多模态RGB-T)下均持续提升性能,验证了其鲁棒性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。