[论文解读] Densely Semantically Aligned Person Re-Identification
本文提出了一种密集语义对齐的人重识别框架,利用密集语义映射(来自DensePose)生成24张密集对齐的部件图像(DSAP-image),实现了在不同姿态和视角下的细粒度空间与语义对齐。采用双流网络结构,将这些DSAP-image用于引导流,以调节主全图流中的特征学习,实现了最先进性能:在Market1501上达到95.7%的rank-1准确率,在CUHK01上达到90.4%,在CUHK03上达到78.9%(采用新协议),且推理仅需主流以保证效率。
We propose a densely semantically aligned person re-identification framework. It fundamentally addresses the body misalignment problem caused by pose/viewpoint variations, imperfect person detection, occlusion, etc. By leveraging the estimation of the dense semantics of a person image, we construct a set of densely semantically aligned part images (DSAP-images), where the same spatial positions have the same semantics across different images. We design a two-stream network that consists of a main full image stream (MF-Stream) and a densely semantically-aligned guiding stream (DSAG-Stream). The DSAG-Stream, with the DSAP-images as input, acts as a regulator to guide the MF-Stream to learn densely semantically aligned features from the original image. In the inference, the DSAG-Stream is discarded and only the MF-Stream is needed, which makes the inference system computationally efficient and robust. To the best of our knowledge, we are the first to make use of fine grained semantics to address the misalignment problems for re-ID. Our method achieves rank-1 accuracy of 78.9% (new protocol) on the CUHK03 dataset, 90.4% on the CUHK01 dataset, and 95.7% on the Market1501 dataset, outperforming state-of-the-art methods.
研究动机与目标
- 解决由于姿态、视角、遮挡和检测误差导致的人重识别中持续存在的身体错位问题。
- 通过密集的3D表面对应关系(UV图),实现在像素级别的细粒度语义对齐。
- 设计一种双流网络,其中基于对齐部件图像的引导流可提升主流中的特征学习质量,同时不影响推理效率。
- 在标准基准上实现最先进性能,同时在部署中保持计算效率。
提出的方法
- 利用DensePose估计每张人像的密集2D到3D表面对应关系(UV坐标),实现在像素级别的细粒度语义标注。
- 通过将原始图像映射到规范的UV空间,生成24张密集语义对齐的部件图像(DSAP-image),确保图像间语义的空间对齐。
- 设计双流网络:主全图流(MF-Stream)用于主要特征学习,以及一个基于对齐部件图像的密集语义对齐引导流(DSAG-Stream),用于监督和调节MF-Stream。
- 在训练过程中采用逐元素相加的方式融合MF-Stream与DSAG-Stream的特征,推理时丢弃DSAG-Stream以保持效率。
- 在两个流中联合训练全局分支与部件感知分支,以增强互补特征学习与鲁棒性。
- 采用多尺度特征学习策略,结合全局与局部分支,以提升判别能力。
实验结果
研究问题
- RQ1通过UV空间映射实现的人像密集语义对齐,能否显著减少由姿态和视角变化引起的位置错位问题?
- RQ2基于密集对齐部件图像的引导流,是否能提升从全图中学习到的特征质量与鲁棒性?
- RQ3一种在推理时丢弃引导流的双流架构,能否在保持高准确率的同时提升计算效率?
- RQ4与粗粒度部件对齐相比,密集语义对齐在人重识别性能上表现如何?
主要发现
- 所提方法在Market1501数据集上达到95.7%的rank-1准确率,超越以往最先进方法。
- 在CUHK01数据集上,方法达到90.4%的rank-1准确率,展现出在具有挑战性且多样化的基准上的强大性能。
- 在CUHK03数据集上采用新协议,方法达到78.9%的rank-1准确率,相比之前方法至少提升10.9个百分点。
- 消融实验表明,与粗粒度对齐相比,密集语义对齐带来+1.6%的rank-1准确率增益,凸显细粒度对齐的优势。
- 流特征的逐元素相加融合在Market1501上实现87.6%的mAP和95.7%的rank-1准确率,显著优于基于拼接的融合方式(81.6% mAP)。
- 同时包含全局与部件感知分支的完整模型达到最高性能,表明互补特征学习可有效提升人重识别准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。