[论文解读] Attend to the Difference: Cross-Modality Person Re-identification via Contrastive Correlation
本文提出了一种用于跨模态行人重识别的双路框架,通过3D张量公共空间保留空间结构,并利用无参对比相关网络(CCN)关注RGB与红外图像对之间的差异,从而增强特征判别性。该方法在SYSU-MM01和RegDB数据集上均取得了最先进性能,在完整与简化评估模式下均显著优于先前方法。
The problem of cross-modality person re-identification has been receiving increasing attention recently, due to its practical significance. Motivated by the fact that human usually attend to the difference when they compare two similar objects, we propose a dual-path cross-modality feature learning framework which preserves intrinsic spatial strictures and attends to the difference of input cross-modality image pairs. Our framework is composed by two main components: a Dual-path Spatial-structure-preserving Common Space Network (DSCSN) and a Contrastive Correlation Network (CCN). The former embeds cross-modality images into a common 3D tensor space without losing spatial structures, while the latter extracts contrastive features by dynamically comparing input image pairs. Note that the representations generated for the input RGB and Infrared images are mutually dependant to each other. We conduct extensive experiments on two public available RGB-IR ReID datasets, SYSU-MM01 and RegDB, and our proposed method outperforms state-of-the-art algorithms by a large margin with both full and simplified evaluation modes.
研究动机与目标
- 为解决RGB-红外行人重识别中因光照和传感器条件变化导致的跨模态差异问题。
- 保留特征表示中的空间结构,该结构在传统基于1D向量的公共空间方法中会丢失。
- 通过动态关注配对RGB与红外图像之间的语义差异,提升特征判别性。
- 设计一种无参核生成器,用于对比相关性,通过图像间比较增强特征表示。
- 在公开的RGB-IR ReID基准数据集中,实现完整与简化评估模式下的最先进性能。
提出的方法
- 双路空间结构保持公共空间网络(DSCSN)将RGB与红外图像嵌入基于3D张量的公共特征空间,以保留空间结构。
- 对比相关网络(CCN)从个性化特征图生成动态核,以突出输入图像对之间的差异。
- 核生成器为无参结构,基于各模态个性化核的差异计算对比核。
- 特征表示相互依赖,支持查询引导的动态特征学习,即每张图像的表示依赖于其配对图像。
- 通过联合损失函数端到端训练,该损失函数结合成对二值交叉熵(BCE)和身份(ID)损失。
- 该方法支持完整与简化推理模式,后者在不损失准确率的前提下提升了效率。
实验结果
研究问题
- RQ1与基于1D向量的方法相比,通过3D张量公共空间保留空间结构是否能提升跨模态行人重识别性能?
- RQ2通过动态关注RGB与红外图像对之间的差异,是否能增强ReID中的特征判别性?
- RQ3无参核生成器在无额外可学习参数的情况下,学习对比相关特征的有效性如何?
- RQ4所提出的框架在开放集场景下是否具有泛化能力,即画廊集可能仅包含同模态图像?
- RQ5在联合训练目标中,平衡BCE与ID损失的最佳超参数(λ)是什么?
主要发现
- 在SYSU-MM01数据集上,该方法在完整评估模式下达到CMC-1为33.4%、mAP为37.2%,优于先前最先进方法。
- 在RegDB数据集上,该方法在完整评估模式下达到CMC-1为53.1%、mAP为53.5%,展现出跨数据集的强大泛化能力。
- 最优超参数λ = 0.1时性能最佳,在SYSU-MM01上实现33.4% CMC-1与37.2% mAP,表明损失间具有稳定且鲁棒的权衡。
- 在开放集协议下,该方法在SYSU-MM01上实现78.2% CMC-1与65.3% mAP,表明在包含混合模态画廊的真实场景中具有强鲁棒性。
- 定性可视化结果表明,对比特征图对语义差异较大的图像(如性别或体型不同)响应更强。
- 失败案例主要源于外观变化(如携带背包),表明模型对非身份相关的变化较为敏感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。