Skip to main content
QUICK REVIEW

[论文解读] Deep High-Resolution Representation Learning for Cross-Resolution Person Re-identification

Guoqing Zhang, Yu Ge|arXiv (Cornell University)|May 25, 2021
Video Surveillance and Tracking Methods参考文献 78被引用 102
一句话总结

该论文提出PS-HRNet,一种用于跨分辨率行人重识别的深度高分辨率伪孪生框架,通过结合新颖的VDSR-CA超分辨率模块与HRNet-ReID特征提取器,有效减小了低分辨率与高分辨率特征之间的分布差异。该方法在五个基准数据集上实现了最先进性能,Rank-1准确率提升达3.4%至6.2%。

ABSTRACT

Person re-identification (re-ID) tackles the problem of matching person images with the same identity from different cameras. In practical applications, due to the differences in camera performance and distance between cameras and persons of interest, captured person images usually have various resolutions. We name this problem as Cross-Resolution Person Re-identification which brings a great challenge for matching correctly. In this paper, we propose a Deep High-Resolution Pseudo-Siamese Framework (PS-HRNet) to solve the above problem. Specifically, in order to restore the resolution of low-resolution images and make reasonable use of different channel information of feature maps, we introduce and innovate VDSR module with channel attention (CA) mechanism, named as VDSR-CA. Then we reform the HRNet by designing a novel representation head to extract discriminating features, named as HRNet-ReID. In addition, a pseudo-siamese framework is constructed to reduce the difference of feature distributions between low-resolution images and high-resolution images. The experimental results on five cross-resolution person datasets verify the effectiveness of our proposed approach. Compared with the state-of-the-art methods, our proposed PS-HRNet improves 3.4\%, 6.2\%, 2.5\%,1.1\% and 4.2\% at Rank-1 on MLR-Market-1501, MLR-CUHK03, MLR-VIPeR, MLR-DukeMTMC-reID, and CAVIAR datasets, respectively. Our code is available at \url{https://github.com/zhguoqing}.

研究动机与目标

  • 为解决真实监控系统中行人图像分辨率不一致导致的匹配挑战。
  • 减少行人重识别中低分辨率(LR)与高分辨率(HR)特征分布之间的域偏移。
  • 通过在超分辨率网络中引入通道注意力,提升低分辨率图像的特征表示学习能力。
  • 设计一种基于HRNet的专用主干网络(HRNet-ReID),以更好地捕捉用于重识别的判别性多分辨率特征。
  • 开发一种伪孪生训练策略,联合优化超分辨率与重识别特征。

提出的方法

  • 提出VDSR-CA,一种在VDSR基础上引入通道注意力的改进结构,以增强高频分量恢复能力,并改善低分辨率图像中的语义特征学习。
  • 提出HRNet-ReID,一种专为HRNet-W32设计的新表示头,可有效提取用于行人重识别的多分辨率特征。
  • 采用双分支伪孪生框架:一个分支处理高分辨率图像,另一个分支处理低分辨率图像,以在训练过程中对齐两者的特征分布。
  • 采用两阶段训练策略:首先在高分辨率重识别数据集上预训练HRNet-ReID,然后在跨分辨率数据集上联合微调VDSR-CA与HRNet-ReID。
  • 在HRNet-ReID主干中应用自适应平均池化与最大池化操作,以压缩高维特征图,同时保留纹理信息与全局上下文。
  • 采用基于序列的损失函数(Seq(n), ℓc)以优化网络多阶段的特征学习。

实验结果

研究问题

  • RQ1轻量级的带通道注意力的超分辨率模块是否能在跨分辨率行人重识别任务中超越复杂SR网络?
  • RQ2与标准的ResNet主干网络相比,采用定制表示头的HRNet是否能提升跨分辨率重识别中的特征判别能力?
  • RQ3伪孪生框架是否能有效减小低分辨率与高分辨率特征空间之间的分布差距?
  • RQ4与仅预训练或端到端训练相比,联合训练超分辨率与重识别模块是否更具有效性?
  • RQ5VDSR-CA与HRNet-ReID的结合是否能在多个跨分辨率基准上实现更优性能?

主要发现

  • PS-HRNet在五个跨分辨率行人重识别基准上达到最先进性能,在MLR-Market-1501数据集上Rank-1准确率提升3.4%。
  • VDSR-CA模块在性能上优于SRCNN与原始VDSR,在轻量化架构下达到与RCAN相当的性能。
  • HRNet-ReID在Market-1501与DukeMTMC-reID数据集上显著优于HRNet-W32-C及其他主干网络(如ResNet-50与DenseNet-121)。
  • 在伪孪生框架中,Seq(1)、Seq(4)、Seq(5)与ℓc的组合取得最佳性能,在MLR-Market-1501上达到91.5%的Rank-1准确率。
  • 在伪孪生设置下,VDSR-CA与HRNet-ReID的联合训练有效减小了特征分布偏移,并增强了泛化能力。
  • 在HRNet-ReID中同时使用自适应平均池化与最大池化,相比单独使用任一方法,能获得更高的识别准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。