[论文解读] DeepChange: A Large Long-Term Person Re-Identification Benchmark with Clothes Change
本文提出了 DeepChange,这是首个大规模、真实的长期行人重识别基准,涵盖12个月内的自然服装变化,包含17个摄像头、1,121个身份和178,407个边界框。结果表明,多模态融合——尤其是结合RGB和灰度图像与视觉Transformer——在具有挑战性的服装变化问题上显著优于现有模型,达到最先进性能。
Existing person re-identification (re-id) works mostly consider short-term application scenarios without clothes change. In real-world, however, we often dress differently across space and time. To solve this contrast, a few recent attempts have been made on long-term re-id with clothes change. Currently, one of the most significant limitations in this field is the lack of a large realistic benchmark. In this work, we contribute a large, realistic long-term person re-identification benchmark, named as DeepChange. It has several unique characteristics: (1) Realistic and rich personal appearance (e.g., clothes and hair style) and variations: Highly diverse clothes change and styles, with varying reappearing gaps in time from minutes to seasons, different weather conditions (e.g., sunny, cloudy, windy, rainy, snowy, extremely cold) and events (e.g., working, leisure, daily activities). (2) Rich camera setups: Raw videos were recorded by 17 outdoor varying resolution cameras operating in a real-world surveillance system. (3) The currently largest number of (17) cameras, (1, 121) identities, and (178, 407) bounding boxes, over the longest time span (12 months). Further, we investigate multimodal fusion strategies for tackling the clothes change challenge. Extensive experiments show that our fusion models outperform a wide variety of state-of-the-art models on DeepChange. Our dataset and documents are available at https://github.com/PengBoXiangShang/deepchange.
研究动机与目标
- 为解决长期行人重识别基准中缺乏大规模、真实场景数据的问题,特别是长期自然服装变化的缺失。
- 构建一个基于真实监控环境的数据集,涵盖多样的环境条件、身份外观变化以及长期时间跨度,以更真实地反映现实世界中的重识别挑战。
- 为评估和推进长期行人重识别模型在非约束性服装变化条件下的性能,提供一个全面的基准。
- 研究有效的多模态融合策略——如结合RGB、灰度图和边缘图——以提升对因服装变化导致的外观变化的鲁棒性。
- 在新提出的具有挑战性的基准上,为基于CNN和视觉Transformer的模型建立强基线并实现最先进性能。
提出的方法
- DeepChange 基准基于17个室外、分辨率各异的监控摄像头在真实住宅环境中连续12个月采集的原始视频片段构建。
- 所有摄像头和时间跨度内的人体身份均经人工标注,共获得178,407个边界框,覆盖1,121个独立身份,其外观在服装、发型、天气和活动方面存在显著差异。
- 该数据集捕捉了真实的自然外观变化,包括季节性服装变换、不同天气条件(晴天、雨天、雪天、大风、低温)以及多样的日常活动。
- 评估了多种多模态特征融合策略,包括将RGB、灰度图和边缘图输入进行晚期融合,以增强对服装变化的鲁棒性。
- 评估了多种模型,包括标准CNN(ResNet、DenseNet)、最先进重识别模型(BNNeck、ReIDCaps)以及视觉Transformer(ViT、DeiT),并进行了模态组合的消融实验。
- 性能通过标准指标进行衡量:rank@1 和平均平均精度(mAP),特别关注因服装变化导致的rank@1与mAP之间的性能差距。
实验结果
研究问题
- RQ1与短期基准相比,最先进行人重识别模型在大规模、长期的自然服装变化基准上性能如何退化?
- RQ2多模态融合(如RGB、灰度图、边缘图)在长期重识别中能在多大程度上提升模型对非约束性服装变化的鲁棒性?
- RQ3在长期、外观多变的条件下,深度学习架构中CNN与视觉Transformer哪个表现更优?
- RQ4在长期重识别中,rank@1与mAP得分如何比较?两者之间显著的性能差距由何解释?
- RQ5多种外观模态的联合使用是否能在不同模型架构和重识别设置下持续带来性能提升?
主要发现
- 视觉Transformer(ViT)在DeepChange上所有单模态方法中取得了最高的mAP分数,表明其在建模长期外观变化方面具有卓越能力。
- RGB与灰度图的多模态晚期融合优于单一模态输入,使用ViT处理融合输入时达到最佳mAP结果。
- mAP分数显著低于rank@1(例如,ResNet152的rank@1约为39.84%,mAP约为11.49%),凸显了服装变化带来的严峻挑战。
- 更深的网络(如ResNet152)优于较浅的网络(如ResNet18),且针对重识别设计的模型(如BNNeck和ReIDCaps)在深层架构下表现尤为出色。
- 灰度图由于信息量较少且在ImageNet上预训练,效果不如RGB,但在与RGB融合后仍能带来正向贡献。
- 所提出的多模态融合策略显著提升了标准CNN和最先进重识别模型的性能,证明了其强大的互补效应。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。