Skip to main content
QUICK REVIEW

[论文解读] Spatial-Temporal Synergic Residual Learning for Video Person Re-Identification

Xinxing Su, Yingtian Zou|arXiv (Cornell University)|Jul 16, 2018
Video Surveillance and Tracking Methods参考文献 6被引用 4
一句话总结

本文提出空间-时间协同残差网络(STSRN),一种用于视频行人重识别的参数高效深度学习框架,通过整合空间残差特征提取、时间残差RNN处理以及一种新颖的空间-时间平滑模块(STSM),提升了对噪声的鲁棒性并改善了特征表示。STSRN在iLIDS-VID、PRID2011和MARS数据集上均取得了最先进性能,且参数量显著少于先前方法。

ABSTRACT

We tackle the problem of person re-identification in video setting in this paper, which has been viewed as a crucial task in many applications. Meanwhile, it is very challenging since the task requires learning effective representations from video sequences with heterogeneous spatial-temporal information. We present a novel method - Spatial-Temporal Synergic Residual Network (STSRN) for this problem. STSRN contains a spatial residual extractor, a temporal residual processor and a spatial-temporal smooth module. The smoother can alleviate sample noises along the spatial-temporal dimensions thus enable STSRN extracts more robust spatial-temporal features of consecutive frames. Extensive experiments are conducted on several challenging datasets including iLIDS-VID, PRID2011 and MARS. The results demonstrate that the proposed method achieves consistently superior performance over most of state-of-the-art methods.

研究动机与目标

  • 为解决在行人重识别中从具有异质性空间-时间信息的视频序列中学习鲁棒且判别性表征的挑战。
  • 克服现有模型在视频数据中对噪声、错位以及长程时间依赖性处理能力不足的局限。
  • 开发一种参数高效、端到端的框架,以支持监控系统中的实时部署。

提出的方法

  • 该模型采用空间残差提取器,利用感受野增大的残差块学习判别性帧级特征。
  • 基于残差RNN(ResRNN)的时间残差处理器用于建模长程依赖性并减少序列帧间的冗余。
  • 引入空间-时间平滑模块(STSM),以平滑地过渡空间与时间域之间的表征,降低转换过程中的噪声。
  • 框架采用身份损失与验证损失进行端到端训练,实现特征学习与度量学习的联合优化。
  • 网络架构设计轻量化,避免使用GoogLeNet等重型主干网络,以提升推理效率。

实验结果

研究问题

  • RQ1如何协同学习空间与时间特征,以提升视频行人重识别的鲁棒性?
  • RQ2在空间与时间分支中采用残差学习,能在多大程度上增强特征表示能力与抗噪能力?
  • RQ3轻量化、参数高效的网络是否能在视频Re-ID基准测试中超越复杂且更大的模型?

主要发现

  • 在iLIDS-VID数据集上,STSRN在使用DoubleResBlocks+TemRes+STSM配置时,rank-1准确率达到70.0%,相比基线模型(60.3%)提升了9.7个百分点。
  • 在PRID2011数据集上,模型达到88.0%的rank-1准确率,相较于基线模型(75.0%)提升了13.0个百分点。
  • 与未使用STSM的模型相比,添加STSM模块使iLIDS-VID上的rank-1准确率提升约2.0%,在PRID2011上提升约1.3%。
  • 时间残差RNN(TemRes)相比非残差版本,在iLIDS-VID上带来2.0%的rank-1准确率增益,在PRID2011上带来1.0%的增益,表明其具备更强的抗噪能力。
  • 在PRID2011上的跨数据集评估验证了模型的泛化能力,尽管存在领域偏移,仍表现出优异性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。