Skip to main content
QUICK REVIEW

[论文解读] Video Person Re-ID: Fantastic Techniques and Where to Find Them

Priyank Pathak, Amir Erfan Eshratifar|arXiv (Cornell University)|Nov 21, 2019
Video Surveillance and Tracking Methods参考文献 4被引用 7
一句话总结

该论文提出了一种新颖的混合损失函数——注意力与中心损失(Attention and CL loss),结合在线软挖掘(OSM)、中心损失(CL)中心向量以及时间注意力网络中的注意力特征聚合。该方法在MARS和PRID 2011数据集上超越了当前最先进性能,通过使用技巧包(bag-of-tricks)和超参数优化,在PRID 2011上实现了82.9% mAP(重排序后)和96.6% CMC-1的指标。

ABSTRACT

The ability to identify the same person from multiple camera views without the explicit use of facial recognition is receiving commercial and academic interest. The current status-quo solutions are based on attention neural models. In this paper, we propose Attention and CL loss, which is a hybrid of center and Online Soft Mining (OSM) loss added to the attention loss on top of a temporal attention-based neural network. The proposed loss function applied with bag-of-tricks for training surpasses the state of the art on the common person Re-ID datasets, MARS and PRID 2011. Our source code is publicly available on github.

研究动机与目标

  • 通过结合注意力机制与先进的损失函数,提升基于视频的行人重识别准确率。
  • 通过跨视频帧的时间建模,解决行人Re-ID中的遮挡、视角变化和光照变化等挑战。
  • 通过整合中心损失、在线软挖掘和基于注意力的帧加权机制,提升模型的鲁棒性与泛化能力。
  • 通过架构与训练策略的创新组合,在MARS和PRID 2011基准数据集上超越现有最先进结果。

提出的方法

  • 模型使用预训练的ResNet-50提取帧级特征,随后通过时间注意力机制计算帧间加权和。
  • 一种混合损失函数——注意力与CL损失,结合了注意力损失、OSM损失和中心损失(CL),并引入类别感知的中心向量,以抑制噪声帧。
  • 注意力损失定义为:基于二值标签(1表示相关帧,0表示被擦除帧)加权的帧级注意力分数平均值,以促进对干净、信息丰富帧的关注。
  • 训练过程中应用随机擦除增强技术以模拟遮挡,被擦除区域的帧通过注意力损失被显式惩罚。
  • 技巧包训练策略包括标签平滑、热身学习率、分类前的批量归一化,以及余弦边缘三元组损失。
  • 使用Facebook的Ax工具进行超参数优化,以在MARS和PRID 2011数据集上微调模型性能。

实验结果

研究问题

  • RQ1结合OSM、中心损失与注意力机制的混合损失是否能将视频行人Re-ID性能提升至超越现有SOTA方法?
  • RQ2将中心损失中的中心向量作为类别表征,如何增强帧级注意力机制并提升模型鲁棒性?
  • RQ3随机擦除增强与基于注意力的损失相结合,在遮挡与视觉变化下,能在多大程度上提升模型泛化能力?
  • RQ4将技巧包技术与所提出的注意力与CL损失结合,是否能在多个基准数据集上持续带来性能提升?
  • RQ5注意力机制抑制噪声帧的能力,如何具体贡献于MARS和PRID 2011数据集上mAP与CMC分数的提升?

主要发现

  • 所提方法在MARS数据集上实现了82.9% mAP(重排序后)和88.6% CMC-1,优于此前SOTA的81.2% mAP与86.2% CMC-1(未重排序)。
  • 在PRID 2011数据集上,模型在MARS上预训练后,实现了96.6% CMC-1,优于同一数据集上SOTA的96.1% CMC-1。
  • 技巧包与注意力和CL损失的结合在MARS上实现了82.9% mAP与88.6% CMC-1,相较于基线模型提升了6.2%。
  • 在OSM损失中使用CL中心向量,提升了帧选择的准确性,能够更精确地识别并降低高方差、噪声帧的权重。
  • 重排序进一步提升了性能,在最佳配置下,MARS上达到98.5% CMC-20,PRID 2011上达到100% CMC-20。
  • 发现在分类层前使用批量归一化可生成比非归一化特征更鲁棒的特征,有助于提升泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。