[论文解读] Rethinking Sampling Strategies for Unsupervised Person Re-identification
本文提出了一种名为分组采样(group sampling)的新策略,通过将同类别样本分组以提升统计稳定性并缓解过拟合问题,从而改善无监督行人重识别性能。该方法在纯粹的相机无关设置下,在Market-1501、DukeMTMC-reID和MSMT17数据集上均取得了最先进性能,且无需额外参数或计算开销。
Unsupervised person re-identification (re-ID) remains a challenging task. While extensive research has focused on the framework design and loss function, this paper shows that sampling strategy plays an equally important role. We analyze the reasons for the performance differences between various sampling strategies under the same framework and loss function. We suggest that deteriorated over-fitting is an important factor causing poor performance, and enhancing statistical stability can rectify this problem. Inspired by that, a simple yet effective approach is proposed, termed group sampling, which gathers samples from the same class into groups. The model is thereby trained using normalized group samples, which helps alleviate the negative impact of individual samples. Group sampling updates the pipeline of pseudo-label generation by guaranteeing that samples are more efficiently classified into the correct classes. It regulates the representation learning process, enhancing statistical stability for feature representation in a progressive fashion. Extensive experiments on Market-1501, DukeMTMC-reID and MSMT17 show that group sampling achieves performance comparable to state-of-the-art methods and outperforms the current techniques under purely camera-agnostic settings. Code has been available at https://github.com/ucas-vg/GroupSampling.
研究动机与目标
- 探究为何在模型架构和损失函数完全相同的情况下,采样策略对无监督行人重识别性能有显著影响。
- 识别随机采样下性能下降的主要原因——过拟合的恶化。
- 提出一种分组采样策略,通过将同类别样本分组,提升统计稳定性,实现更一致的特征学习。
- 证明在完全的相机无关设置下,分组采样优于现有方法,其中采样过程不使用相机信息。
提出的方法
- 分组采样将同一身份的样本聚集成组,确保每个小批量中包含代表性的同类别簇,而非随机混合的样本。
- 使用归一化的分组样本进行模型训练,通过降低单个异常样本对类别级优化的影响,稳定特征表示。
- 重新设计异常样本处理方式,将未聚类的异常样本与分组实例隔离,使用专用的异常组(Tre. II)防止对簇表示造成污染。
- 该方法可无缝集成到对比学习基线中,通过保持类级别趋势的一致性,更新伪标签生成与表示学习过程。
- 通过直接分组同类别样本,避免了三元组采样的需求,消除了固定K采样的限制,减少了欠采样与过采样的权衡。
- 通过防止因噪声或主导性单一样本导致的类别级表示崩溃,保持了类内相似性与类间差异性。
实验结果
研究问题
- RQ1为何在模型架构和损失函数完全相同的情况下,随机采样仍会导致无监督行人重识别性能下降?
- RQ2无监督重识别中过拟合恶化的根本原因是什么?如何通过采样设计加以缓解?
- RQ3将同类别样本分组如何提升对比学习中的统计稳定性和表示质量?
- RQ4是否一种简单的采样策略(如分组采样)能在不增加额外参数或相机知识的前提下,实现与最先进方法相当的性能?
- RQ5为何三元组采样优于随机采样?更系统化的分组采样策略能否超越它?
主要发现
- 在DukeMTMC-reID上,分组采样在纯粹的相机无关设置下实现了最高的mAP,优于所有其他方法至少1.8%。
- 在Market-1501上,分组采样在所有方法中排名第二,展现出在不同数据集间的强大泛化能力。
- 在MSMT17上,分组采样在纯粹的相机无关条件下优于最先进技术,而许多SOTA方法依赖于相机特定的采样策略。
- 将分组采样中的异常处理方式从Tre. I替换为Tre. II,性能显著提升,证实了将异常样本与簇隔离的重要性。
- 当从HCD和ICE等最先进方法中移除相机知识后,性能明显下降,凸显了分组采样在真正相机无关设置下的优越性。
- 消融实验表明,分组采样通过降低单一样本的影响,稳定了特征学习,直接缓解了过拟合恶化的现象。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。