Skip to main content
QUICK REVIEW

[论文解读] Resolution-invariant Person Re-Identification

Shunan Mao, Shiliang Zhang|arXiv (Cornell University)|Jun 24, 2019
Video Surveillance and Tracking Methods参考文献 28被引用 8
一句话总结

本文提出了一种分辨率不变的行人重识别方法,通过联合训练前景聚焦超分辨率(FFSR)模块与分辨率不变特征提取器(RIFE)。FFSR 使用一种具有跳跃连接的前景聚焦全卷积自编码器来增强低分辨率行人图像,而 RIFE 则利用双分支卷积神经网络与双注意力融合模块,从低分辨率和高分辨率输入中学习鲁棒特征。该方法在多个数据集上达到最先进性能,在 MLR-CUHK03 上取得 73.3% 的 Rank-1 准确率,在 CAVIAR 上取得 36.4% 的 Rank-1 准确率,分别优于先前方法 2.6% 和 2.9%。

ABSTRACT

Exploiting resolution invariant representation is critical for person Re-Identification (ReID) in real applications, where the resolutions of captured person images may vary dramatically. This paper learns person representations robust to resolution variance through jointly training a Foreground-Focus Super-Resolution (FFSR) module and a Resolution-Invariant Feature Extractor (RIFE) by end-to-end CNN learning. FFSR upscales the person foreground using a fully convolutional auto-encoder with skip connections learned with a foreground focus training loss. RIFE adopts two feature extraction streams weighted by a dual-attention block to learn features for low and high resolution images, respectively. These two complementary modules are jointly trained, leading to a strong resolution invariant representation. We evaluate our methods on five datasets containing person images at a large range of resolutions, where our methods show substantial superiority to existing solutions. For instance, we achieve Rank-1 accuracy of 36.4% and 73.3% on CAVIAR and MLR-CUHK03, outperforming the state-of-the art by 2.9% and 2.6%, respectively.

研究动机与目标

  • 解决真实监控系统中极端分辨率变化下的行人重识别(Re-ID)挑战。
  • 克服通用超分辨率方法未针对 Re-ID 准确率进行优化且无法有效区分前景与背景的局限性。
  • 设计一种显式从低分辨率和高分辨率输入中学习的特征提取器,以提升对分辨率变化的鲁棒性。
  • 端到端联合训练超分辨率与特征提取模块,以优化 Re-ID 性能。

提出的方法

  • FFSR 使用带有跳跃连接的全卷积自编码器对行人图像进行上采样,通过前景聚焦损失进行训练,以优先关注身体细节而非背景杂乱。
  • 前景聚焦损失强调对行人身体区域的重建,从而提升 Re-ID 所需的语义相关性。
  • RIFE 采用两条并行的 CNN 流路,分别处理低分辨率和高分辨率输入,各自独立提取特征。
  • 双注意力模块通过学习到的注意力权重,动态融合两条流路的特征,生成分辨率不变的表征。
  • FFSR 与 RIFE 模块通过联合端到端训练,结合 Re-ID 损失,以优化跨分辨率的匹配准确率。
  • 该框架在五个数据集上进行评估,包括新构建的具有大分辨率变化的 VR-Market1501 与 VR-MSMT17。

实验结果

研究问题

  • RQ1联合训练超分辨率与特征提取是否能提升在极端分辨率变化下的行人 Re-ID 性能?
  • RQ2前景聚焦的超分辨率是否能生成优于标准超分辨率方法的 Re-ID 特征?
  • RQ3基于注意力的双分支特征学习与融合是否能增强对分辨率变化的鲁棒性?
  • RQ4所提方法在具有大分辨率差异的数据集上与最先进 Re-ID 模型相比表现如何?

主要发现

  • 在 MLR-CUHK03 上,所提方法达到 73.3% 的 Rank-1 准确率,优于先前最先进方法 CSR-GAN 的 2.6%。
  • 在 CAVIAR 上,方法达到 36.4% 的 Rank-1 准确率,超过最先进方法 2.9%。
  • 仅使用 RIFE 模块即可使 Rank-1 准确率相比 ResNet50 基线提升 5.7%,证明其在处理分辨率变化方面的有效性。
  • 在所有五个数据集上,结合 FFSR 与 RIFE 可获得最佳性能,在 VR-Market1501 上相比 SING 提升 6.4%。
  • 消融实验证实,采用学习到的注意力权重的双分支设计相比等权重融合,性能提升 1.3%。
  • 与 SRCNN 和 VDSR 相比,FFSR 引入的计算开销可忽略不计,同时相比 SRCNN 实现 6.2% 的 Rank-1 准确率提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。