[论文解读] Learning Modal-Invariant and Temporal-Memory for Video-based Visible-Infrared Person Re-Identification
本文提出了一种新颖的基于视频的可见-红外(RGB-IR)行人重识别方法MITML,通过对抗性训练学习模态不变特征,并通过时间记忆精炼模块捕捉运动不变的时间记忆。在新构建的HITSZ-VCM数据集中,MITML实现了最先进性能,红外到可见检索的R1为64.62%,mAP为47.32%,显著优于现有的基于图像的方法。
Thanks for the cross-modal retrieval techniques, visible-infrared (RGB-IR) person re-identification (Re-ID) is achieved by projecting them into a common space, allowing person Re-ID in 24-hour surveillance systems. However, with respect to the probe-to-gallery, almost all existing RGB-IR based cross-modal person Re-ID methods focus on image-to-image matching, while the video-to-video matching which contains much richer spatial- and temporal-information remains under-explored. In this paper, we primarily study the video-based cross-modal person Re-ID method. To achieve this task, a video-based RGB-IR dataset is constructed, in which 927 valid identities with 463,259 frames and 21,863 tracklets captured by 12 RGB/IR cameras are collected. Based on our constructed dataset, we prove that with the increase of frames in a tracklet, the performance does meet more enhancement, demonstrating the significance of video-to-video matching in RGB-IR person Re-ID. Additionally, a novel method is further proposed, which not only projects two modalities to a modal-invariant subspace, but also extracts the temporal-memory for motion-invariant. Thanks to these two strategies, much better results are achieved on our video-based cross-modal person Re-ID. The code and dataset are released at: https://github.com/VCMproject233/MITML.
研究动机与目标
- 为解决现有基于视频的跨模态行人重识别方法中缺乏同时利用可见光与红外模态空间和时间信息的问题。
- 构建一个大规模、基于视频的RGB-IR行人重识别数据集(HITSZ-VCM),包含927个身份、463,259帧,覆盖12个摄像头。
- 开发一种方法,学习模态不变特征,以减少RGB与IR模态之间的域差距。
- 提取运动不变的时间表征,以提升视频级特征学习效果。
- 通过实证评估证明基于视频的方法在跨模态行人重识别中优于基于图像的方法。
提出的方法
- 采用一种新颖的对抗性学习策略,将RGB与IR特征映射到共享的、模态不变的子空间中,以减少模态特异性偏差。
- 设计了一个时间记忆精炼(TMR)模块,用于捕捉视频帧间的一致性运动特征,增强判别性的时间建模能力。
- TMR模块使用记忆库存储并更新时间特征,结合可学习的注意力机制以精炼运动不变表征。
- 采用多任务损失函数,结合三元组损失与对比损失,通过超参数λ平衡两者,通过端到端训练进行优化。
- 在新的基于视频的RGB-IR数据集(HITSZ-VCM)上进行模型训练与评估,包含11,785个RGB与10,078个IR轨迹片段,来自12个同步摄像头。
- 消融实验证明模态不变学习与时间记忆精炼的有效性,最优性能出现在λ=0.4时。
实验结果
研究问题
- RQ1基于视频的跨模态行人重识别是否在可见-红外行人重识别中显著优于基于图像的方法?
- RQ2对抗性学习是否能有效减少视频行人重识别中RGB与红外模态之间的域差距?
- RQ3时间记忆精炼模块在捕捉视频行人重识别中运动不变特征方面的有效性如何?
- RQ4在所提出的MITML框架中,三元组损失与对比损失的最佳平衡比例如何?
- RQ5所提出方法对轨迹片段长度变化与模态不平衡是否具有鲁棒性?
主要发现
- HITSZ-VCM数据集包含927个身份、463,259帧与21,863条轨迹片段,其中500个身份用于训练,427个用于测试,显著大于现有基于图像的数据集。
- 使用更长轨迹片段的基于视频的行人重识别性能更优,证实了时间信息在跨模态匹配中的价值。
- MITML在红外到可见检索中达到64.62%的R1与47.32%的mAP,优于第二名方法(CAJL)7.15%的R1与3.82%的mAP。
- 最优损失权重λ=0.4时性能最佳,且在λ值的一定范围内结果保持稳定,表明模型具有鲁棒性。
- 最大池化与平均池化优于加权池化,表明对于视频级特征,更简单的聚合方式更有效。
- 消融研究证实,模态不变学习与时间记忆精炼对性能提升均至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。