Skip to main content
QUICK REVIEW

[论文解读] Enhancing the Discriminative Feature Learning for Visible-Thermal Cross-Modality Person Re-Identification

Haijun Liu, Jian Cheng|arXiv (Cornell University)|Jul 23, 2019
Video Surveillance and Tracking Methods参考文献 30被引用 10
一句话总结

该论文提出了一种简单而有效的方法——增强判别性特征学习(EDFL),通过跳跃连接融合中层特征,并采用双模态三元组损失来减少跨模态差异和模态内变化,从而实现可见光-热成像行人重识别。EDFL在RegDB和SYSU-MM01数据集上均取得了最先进性能,显著优于先前方法。

ABSTRACT

Existing person re-identification has achieved great progress in the visible domain, capturing all the person images with visible cameras. However, in a 24-hour intelligent surveillance system, the visible cameras may be noneffective at night. In this situation, thermal cameras are the best supplemental components, which capture images without depending on visible light. Therefore, in this paper, we investigate the visible-thermal cross-modality person re-identification (VT Re-ID) problem. In VT Re-ID, there are two knotty problems should be well handled, cross-modality discrepancy and intra-modality variations. To address these two issues, we propose focusing on enhancing the discriminative feature learning (EDFL) with two extreme simple means from two core aspects, (1) skip-connection for mid-level features incorporation to improve the person features with more discriminability and robustness, and (2) dual-modality triplet loss to guide the training procedures by simultaneously considering the cross-modality discrepancy and intra-modality variations. Additionally, the two-stream CNN structure is adopted to learn the multi-modality sharable person features. The experimental results on two datasets show that our proposed EDFL approach distinctly outperforms state-of-the-art methods by large margins, demonstrating the effectiveness of our EDFL to enhance the discriminative feature learning for VT Re-ID.

研究动机与目标

  • 解决24小时监控系统中可见光摄像头夜间失效时的可见光-热成像跨模态行人重识别(VT Re-ID)挑战。
  • 克服VT Re-ID中的两大障碍:由于感知模态不同导致的显著跨模态差异,以及姿态和视角变化引起的模态内变化。
  • 通过聚焦中层表征和一种新型训练目标,联合建模跨模态与模态内约束,提升判别性特征学习能力。
  • 证明简单的架构与损失设计选择——跳跃连接与双模态三元组损失——可显著超越复杂的最先进方法。

提出的方法

  • 采用共享层的双流卷积神经网络架构,提取模态特定特征并将其嵌入共享特征空间,实现多模态共享表征学习。
  • 引入来自中层卷积层的跳跃连接,用于拼接并增强判别性特征,提升模型鲁棒性与语义丰富性。
  • 提出双模态三元组损失(DMTL),同时最小化模态内距离并最大化模态间边际,显式建模模态内变化与跨模态差异。
  • 在小批量中采用困难三元组挖掘策略:对每个P个身份,分别采样K张可见光图像与K张热成像图像,形成2PK的批量大小,实现对困难正样本的有效挖掘。
  • 使用端到端优化与DMTL损失训练模型,促使网络学习对模态与姿态变化具有不变性的判别性特征。
  • 利用Grad-CAM可视化注意力图,验证不同网络层聚焦于相关身体部位,从而证实中层特征融合的有效性。

实验结果

研究问题

  • RQ1通过跳跃连接实现的中层特征融合,是否能显著提升可见光-热成像跨模态设置下行人重识别特征的判别能力?
  • RQ2一种同时建模模态内与跨模态约束的双模态三元组损失,是否能比传统对比损失或三元组损失带来更好的泛化性能?
  • RQ3在不同数据集与查询设置下,所提方法在性能与鲁棒性方面相较于最先进方法表现如何?
  • RQ4仅通过简单的架构设计(跳跃连接)与新型损失函数(DMTL)的组合,是否能超越包含对抗训练或图像翻译模块的复杂模型?

主要发现

  • 在RegDB数据集上,所提EDFL方法达到52.58%的Rank-1准确率与52.98%的mAP,分别优于先前最先进方法D2RL 9.18和8.88个百分点。
  • 在SYSU-MM01数据集上,EDFL实现36.94%的Rank-1与40.77%的mAP,分别优于D2RL 8.04和11.57个百分点,展现出一致的优越性。
  • 消融实验表明,中层特征融合(MFI)与双模态三元组损失(DMTL)均能独立提升性能,二者结合效果最佳。
  • 即使仅使用ResNet50主干网络与所提采样策略的基线模型,也已超越DCTR(使用AlexNet与K=1采样),凸显主干网络选择与困难样本挖掘的重要性。
  • 当查询从可见光切换为热成像(热成像到可见光)时,EDFL在RegDB上实现51.89%的Rank-1与52.13%的mAP,表明由于DMTL损失的对称性,模型具备强大的双向泛化能力。
  • EDFL在未使用对抗训练或图像翻译的情况下,仍优于cmGAN与D2RL(二者均使用ResNet50与辅助任务),证明核心组件本身已具备强大有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。