[论文解读] Factorized Distillation: Training Holistic Person Re-identification Model by Distilling an Ensemble of Partial ReID Models
本文提出因子分解蒸馏(Factorized Distillation, FD),一种知识蒸馏方法,通过从一组部分ReID模型中蒸馏知识,训练紧凑的整体式行人重识别(ReID)模型。与特征拼接不同,FD对特征图和检索特征均进行因子分解,以模拟多个部分模型,使整体学生模型在无需额外模块的情况下学习到强大的局部注意力,从而在参数更少的情况下实现最先进性能。
Person re-identification (ReID) is aimed at identifying the same person across videos captured from different cameras. In the view that networks extracting global features using ordinary network architectures are difficult to extract local features due to their weak attention mechanisms, researchers have proposed a lot of elaborately designed ReID networks, while greatly improving the accuracy, the model size and the feature extraction latency are also soaring. We argue that a relatively compact ordinary network extracting globally pooled features has the capability to extract discriminative local features and can achieve state-of-the-art precision if only the model's parameters are properly learnt. In order to reduce the difficulty in learning hard identity labels, we propose a novel knowledge distillation method: Factorized Distillation, which factorizes both feature maps and retrieval features of holistic ReID network to mimic representations of multiple partial ReID models, thus transferring the knowledge from partial ReID models to the holistic network. Experiments show that the performance of model trained with the proposed method can outperform state-of-the-art with relatively few network parameters.
研究动机与目标
- 解决训练紧凑整体式ReID模型的挑战,使其在不使用复杂架构的情况下实现强大的局部特征区分能力。
- 通过将来自多个部分ReID模型的知识迁移至单一整体学生网络,降低学习困难身份标签的难度。
- 通过使用因子分解而非特征拼接,避免从大量教师模型蒸馏时的维度爆炸问题。
- 使普通全局特征网络通过知识蒸馏学习到具有区分性的局部特征,无需依赖姿态估计或部件检测头。
- 在远少于现有大规模模型的参数量下,实现最先进水平的ReID性能。
提出的方法
- 该方法使用多个预训练的部分ReID模型(如4条纹和7条纹分割)作为教师,生成监督表示(Supervisory Representations, SRs),作为细粒度软标签。
- SRs 用作度量学习中的锚点:学生模型的特征图被因子分解,以匹配每个SR的表示空间,从而实现局部知识迁移。
- 学生网络通过联合损失函数进行训练:包括用于身份分类的交叉熵损失、用于与SRs对齐的属性学习损失,以及用于强制与SRs保持相似性的度量学习损失。
- 对特征图和最终检索特征均应用因子分解,使学生模型能够在不拼接高维特征的情况下,模仿多个部分模型的注意力模式。
- 该框架具有可扩展性和灵活性,支持添加额外教师模型,如基于人体部位掩码训练的模型或更强的教师网络。
- 采用稳定化全局度量池化(Stabilized Global Metric Pooling, GMP),以提升域泛化能力和跨数据集迁移能力。
实验结果
研究问题
- RQ1紧凑的整体式ReID模型是否能通过从多个部分ReID模型蒸馏知识,实现最先进性能?
- RQ2在保持紧凑检索特征的同时,因子分解蒸馏是否在知识迁移方面优于特征拼接?
- RQ3标准全局特征网络是否能在不显式引入部件检测或姿态估计的情况下,学习到强大的局部注意力机制?
- RQ4教师数量如何影响性能?该方法在教师数量增加时是否具有可扩展性?
- RQ5蒸馏后的模型是否能在不针对目标领域微调的情况下,实现良好的跨数据集泛化?
主要发现
- R50b+FD模型(2770万参数)在CUHK03数据集上优于MGN(7030万参数),达到95.07% Rank-1和87.1% mAP,展现出更优的参数效率。
- 在参数少于1000万的模型组中,S+FD(270万参数)在Market-1501上mAP比HA-CNN(1480万参数)高出2.54%,在DukeMTMC上高出3.34%。
- 在整体模型和部分组1教师(4条纹分割)基础上,增加部分组2教师(7条纹分割)可进一步提升性能,表明方法具备可扩展性与增量增益。
- 消融实验表明,属性学习损失和度量学习损失均显著提升性能,联合使用时效果最佳。
- 跨数据集迁移结果表明泛化能力强:R50b+FD在未微调的Market-1501上达到44.75% Rank-1和26.97% mAP,优于领域自适应方法如SPGAN和PUL。
- 使用ResNet-152主干网络和FD的模型在CUHK03上达到95.07% Rank-1和87.1% mAP,尽管参数比MGN少800万,仍表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。