[论文解读] 1st Place Solution to VisDA-2020: Bias Elimination for Domain Adaptive Pedestrian Re-identification
本文提出了一种用于行人重识别的两阶段域自适应框架,以解决域间域差距和域内相机偏差问题。通过利用SPGAN迁移的数据和CamStyle数据增强,并结合使用DBSCAN生成伪标签的双域训练策略及渐进式优化,该方法在VisDA-2020测试集上取得了76.56%的mAP和84.25%的rank-1成绩,优于所有竞争者。
This paper presents our proposed methods for domain adaptive pedestrian re-identification (Re-ID) task in Visual Domain Adaptation Challenge (VisDA-2020). Considering the large gap between the source domain and target domain, we focused on solving two biases that influenced the performance on domain adaptive pedestrian Re-ID and proposed a two-stage training procedure. At the first stage, a baseline model is trained with images transferred from source domain to target domain and from single camera to multiple camera styles. Then we introduced a domain adaptation framework to train the model on source data and target data simultaneously. Different pseudo label generation strategies are adopted to continuously improve the discriminative ability of the model. Finally, with multiple models ensembled and additional post processing approaches adopted, our methods achieve 76.56% mAP and 84.25% rank-1 on the test set. Codes are available at https://github.com/vimar-gu/Bias-Eliminate-DA-ReID
研究动机与目标
- 为解决行人重识别中合成源域与真实世界目标域之间的巨大域差距问题。
- 缓解由相机视角、光照、分辨率和遮挡等变化引起的域内偏差。
- 通过数据增强和域自适应提升模型在域移位下的泛化能力和判别能力。
- 在VisDA-2020基准上实现域自适应行人重识别的最先进性能。
提出的方法
- 利用SPGAN将合成源图像迁移至匹配真实目标域图像的外观,以减少域间域差距。
- 应用基于StarGAN的数据增强方法生成多样化的相机风格图像(CamStyle),提升对相机特异性变化的鲁棒性。
- 采用共享主干网络和域特定分类器的两阶段域自适应框架,同时在源域和目标域上进行训练。
- 使用DBSCAN聚类为目标域数据生成伪标签,并在第二阶段通过添加高置信度、低样本量类别实现渐进式优化。
- 实施两阶段伪标签策略:首先按样本数量选择前500个类别,然后在第二阶段增加200个单样本类别,以提升判别性学习效果。
- 通过集成多个主干网络(ResNet50-ibn-a、ResNet101-ibn-a、HRNetv2-w18)并结合加权距离矩阵融合的后处理方法,显著提升最终性能。
实验结果
研究问题
- RQ1如何在行人重识别中有效减小合成源域与真实世界目标域之间的域差距?
- RQ2监控摄像头之间的相机风格差异在多大程度上损害了模型的泛化能力,又该如何缓解?
- RQ3基于DBSCAN的渐进式伪标签化是否能提升无监督域自适应中行人重识别的模型性能?
- RQ4数据增强(SPGAN和CamStyle)与域自适应在减小域移位中的相对贡献分别是什么?
- RQ5模型集成与后处理如何提升VisDA-2020基准上的最终行人重识别性能?
主要发现
- 所提方法在VisDA-2020测试集上取得了76.56%的mAP和84.25%的rank-1成绩,在竞赛中排名第一。
- 消融实验表明,加入CamStyle数据后,mAP从仅使用SPGAN时的24.7%提升至30.7%,凸显了相机偏差缓解的重要性。
- 采用两阶段伪标签化的域自适应使mAP从44.9%提升至48.6%,证明了渐进式优化的有效性。
- 通过加权距离矩阵融合的后处理方法,mAP相比基线单模型提升了22.3个百分点。
- 在多个主干网络及图像尺寸上进行模型集成,使mAP相比最佳单模型提升了超过5.5个百分点。
- 最终模型在所有竞争者中实现了最高的rank-1准确率(84.25%),证实了该框架的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。