Skip to main content
QUICK REVIEW

[论文解读] Modality Unifying Network for Visible-Infrared Person Re-Identification

Hao Yu, Cheng Xu|arXiv (Cornell University)|Sep 12, 2023
Video Surveillance and Tracking MethodsComputer Science被引用 3
一句话总结

本文提出了一种可见光-红外行人重识别(VI-ReID)的模态统一网络(MUN),通过结合模态内学习器与模态间学习器,动态建模模态特异性特征与共享特征,生成鲁棒的辅助模态。该方法引入身份对齐损失与模态对齐损失,以增强判别性特征学习,在多个基准测试中取得最先进性能,相较于先前的SOTA方法AGW+J,rank-1提升1.08%,mAP提升0.77%。

ABSTRACT

Visible-infrared person re-identification (VI-ReID) is a challenging task due to large cross-modality discrepancies and intra-class variations. Existing methods mainly focus on learning modality-shared representations by embedding different modalities into the same feature space. As a result, the learned feature emphasizes the common patterns across modalities while suppressing modality-specific and identity-aware information that is valuable for Re-ID. To address these issues, we propose a novel Modality Unifying Network (MUN) to explore a robust auxiliary modality for VI-ReID. First, the auxiliary modality is generated by combining the proposed cross-modality learner and intra-modality learner, which can dynamically model the modality-specific and modality-shared representations to alleviate both cross-modality and intra-modality variations. Second, by aligning identity centres across the three modalities, an identity alignment loss function is proposed to discover the discriminative feature representations. Third, a modality alignment loss is introduced to consistently reduce the distribution distance of visible and infrared images by modality prototype modeling. Extensive experiments on multiple public datasets demonstrate that the proposed method surpasses the current state-of-the-art methods by a significant margin.

研究动机与目标

  • 为解决现有VI-ReID方法倾向于抑制模态特异性与身份感知特征,而过度强调模态共享表示的问题。
  • 生成一种鲁棒的辅助模态,以动态平衡模态特异与模态共享模式,从而减少模态间与模态内差异。
  • 通过在不同模态间强制保持一致的特征分布对齐,提升特征在数据损坏下的泛化能力与稳定性。
  • 通过引入基于模态原型的对齐策略,缓解由小批量分布估计引起的训练不一致性问题。
  • 通过基于中心的损失优化实现身份感知特征学习,增强判别能力。

提出的方法

  • 通过双分支模态内学习器(IML)生成辅助模态,IML利用多感受野深度可分离卷积从可见光与红外图像中提取模态特异性与身份感知特征。
  • 模态间学习器(CML)利用空间金字塔池化融合IML输出,提取多尺度、模态共享表征。
  • 引入身份对齐损失,通过对其身份中心进行对齐,使同一身份在可见光、红外与辅助模态中的特征更紧密聚集。
  • 模态对齐损失利用模态原型,最小化可见光与红外特征之间的分布距离,提升模态间一致性。
  • 网络通过三元组损失、身份对齐损失与模态对齐损失的联合优化进行端到端训练,以同步提升特征判别性与模态鲁棒性。
  • 通过T-SNE与Grad-CAM的特征可视化表明,辅助模态能有效保留共享结构模式,同时减少模态差异。

实验结果

研究问题

  • RQ1能否通过动态生成的辅助模态,平衡模态特异与模态共享特征,从而提升VI-ReID性能?
  • RQ2所提出的身份对齐损失在跨模态设置下,对类内紧凑性与类间可分性有何影响?
  • RQ3基于模态原型的对齐在多大程度上减少了可见光与红外特征之间的分布偏移?
  • RQ4辅助模态是否能增强在数据损坏或分布偏移下的鲁棒性?
  • RQ5所提方法在干净数据与损坏数据场景下,能否均超越现有SOTA方法?

主要发现

  • 所提出的MUN方法在SYSU-MM01数据集上达到92.1%的rank-1准确率与81.3%的mAP,相较于先前SOTA方法AGW+J,rank-1提升1.08%,mAP提升0.77%。
  • 在RegDB数据集上,MUN实现86.7%的rank-1与74.5%的mAP,展现出在领域偏移下的强大泛化能力。
  • 在损坏数据评估中,MUN保持一致的性能增益,表明其对图像退化与分布偏移具有鲁棒性。
  • T-SNE可视化显示,辅助模态有效弥合了可见光与红外特征空间,随着训练进行,特征逐渐收敛至身份特定中心。
  • Grad-CAM可视化证实,辅助特征图保留了来自双模态的关键结构与身份相关模式,同时减少了模态特异性噪声。
  • 消融研究验证,身份对齐损失与模态对齐损失均对性能提升有显著贡献,且辅助模态在特征精炼中不可或缺。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。