[论文解读] DF^2AM: Dual-level Feature Fusion and Affinity Modeling for RGB-Infrared Cross-modality Person Re-identification
本文提出DF²AM,一种用于RGB-红外行人重识别的双层次特征融合与亲和力建模框架。它结合局部与全局注意力机制以增强判别性特征学习,并采用亲和力建模模块,利用类内紧凑性与类间可分性来提升跨模态匹配性能,在SYSU-MM01和RegDB数据集上实现了最先进性能。
RGB-infrared person re-identification is a challenging task due to the intra-class variations and cross-modality discrepancy. Existing works mainly focus on learning modality-shared global representations by aligning image styles or feature distributions across modalities, while local feature from body part and relationships between person images are largely neglected. In this paper, we propose a Dual-level (i.e., local and global) Feature Fusion (DF^2) module by learning attention for discriminative feature from local to global manner. In particular, the attention for a local feature is determined locally, i.e., applying a learned transformation function on itself. Meanwhile, to further mining the relationships between global features from person images, we propose an Affinities Modeling (AM) module to obtain the optimal intra- and inter-modality image matching. Specifically, AM employes intra-class compactness and inter-class separability in the sample similarities as supervised information to model the affinities between intra- and inter-modality samples. Experimental results show that our proposed method outperforms state-of-the-arts by large margins on two widely used cross-modality re-ID datasets SYSU-MM01 and RegDB, respectively.
研究动机与目标
- 解决行人重识别中RGB图像与红外图像之间的大跨模态差异。
- 通过联合建模行人图像中的局部与全局判别性线索,提升特征表示能力。
- 通过利用类内紧凑性与类间可分性来建模行人图像之间的关系,增强匹配鲁棒性。
- 降低类内变化(如遮挡、视角变化与背景杂乱)的影响。
- 在基准RGB-红外重识别数据集上实现最先进性能。
提出的方法
- 双层次特征融合(DF²)模块通过结合局部与全局视图来学习判别性特征的注意力:局部注意力通过在每个局部特征上应用可学习变换计算,而全局注意力则利用全局平均池化来聚合部件级特征。
- 亲和力建模(AM)模块通过将类内紧凑性与类间可分性作为样本相似性中的监督信号,推断最优的跨模态图像匹配。
- AM模块采用邻居推理机制,每个样本根据成对关系将其结构信息传播给邻居,从而增强对缺失或遮挡特征的鲁棒性。
- 该方法采用多尺度特征分割策略,当特征图被划分为四个水平部分时性能最优。
- 提出一种新型损失函数ℒ_A,用于指导亲和力建模,防止早期陷入局部极小值,并提升相似性学习效果。
- 超参数λ和ζ用于平衡DF²模块与基线模型,最优值分别为λ=1.1和ζ=1.5。
实验结果
研究问题
- RQ1如何有效融合局部与全局特征表示,以提升跨模态行人重识别中的判别性特征学习?
- RQ2通过类内紧凑性与类间可分性建模行人图像之间的关系,能否提升匹配准确率?
- RQ3将特征图划分为多少部分时,可使判别能力最大化?
- RQ4不同损失函数与超参数如何影响所提方法的性能?
- RQ5互惠邻居推理的集成是否能提升对遮挡与外观变化的鲁棒性?
主要发现
- 所提出的DF²AM方法在SYSU-MM01数据集的室内搜索模式下达到71.52% mAP,显著优于以往最先进方法。
- 在RegDB数据集上,该方法实现了最先进性能,展现出在不同跨模态基准上的强大泛化能力。
- 消融实验表明,DF²与AM模块均不可或缺,任一模块移除后性能均明显下降。
- 最优的特征图分割部分数为四,此时在SYSU-MM01数据集上mAP达到最高值71.52%。
- 亲和力建模损失ℒ_A相比仅使用ℒ₁损失,使mAP提升2.00个百分点,证明其在避免局部极小值方面的有效性。
- 超参数调优表明,λ=1.1与ζ=1.5时性能最佳,超过此值后准确率开始下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。