Skip to main content
QUICK REVIEW

[论文解读] Video-based Person Re-identification Using Spatial-Temporal Attention Networks

Shivansh Rao, Tanzila Rahman|arXiv (Cornell University)|Oct 26, 2018
Video Surveillance and Tracking Methods参考文献 4被引用 7
一句话总结

本文提出了一种用于基于视频的人重新识别的时空注意力网络,该网络直接从帧特征计算帧级注意力分数,实现并行计算并提升性能。通过多跳空间注意力和高效的时序聚合,该方法在iLIDS-VID和PRID-2011数据集上的rank-1准确率分别优于先前方法4%和11%,达到最先进水平。

ABSTRACT

We consider the problem of video-based person re-identification. The goal is to identify a person from videos captured under different cameras. In this paper, we propose an efficient spatial-temporal attention based model for person re-identification from videos. Our method generates an attention score for each frame based on frame-level features. The attention scores of all frames in a video are used to produce a weighted feature vector for the input video. Unlike most existing deep learning methods that use global representation, our approach focuses on attention scores. Extensive experiments on two benchmark datasets demonstrate that our method achieves the state-of-the-art performance. This is a technical report.

研究动机与目标

  • 解决在不同摄像头视角、光照条件和遮挡情况下的基于视频的人重新识别挑战。
  • 通过注意力机制聚焦于信息丰富的帧,改善特征表示。
  • 设计一种计算高效的注意力机制,避免序列化处理,支持GPU并行化。
  • 探究多跳空间注意力对模型性能的影响。
  • 在基准视频重新识别数据集上实现最先进性能。

提出的方法

  • 该方法直接从视觉特征向量计算每帧的注意力分数,绕过循环神经网络,实现并行计算。
  • 对每帧应用多跳空间注意力机制,聚焦于不同身体部位,提升空间特征表示。
  • 通过学习到的注意力权重聚合帧级特征,建模时序注意力,形成视频级表示。
  • 最终的视频表示是帧特征的加权和,其中权重由注意力分数决定。
  • 使用三元组损失进行网络训练,以最小化正样本对之间的距离,同时最大化负样本对之间的距离。
  • 使用标准的CMC排名指标在iLIDS-VID和PRID-2011上对模型进行评估。

实验结果

研究问题

  • RQ1基于帧特征的直接非循环注意力机制是否能在基于视频的人重新识别中优于基于RNN的注意力机制?
  • RQ2空间注意力跳数对模型性能有何影响?
  • RQ3可并行化的注意力机制是否能实现优于序列化RNN方法的性能?
  • RQ4所提出的时空注意力机制是否能有效抑制噪声或遮挡帧?
  • RQ5在性能与复杂度之间取得平衡的最优注意力层数是多少?

主要发现

  • 所提方法在iLIDS-VID上达到66%的rank-1准确率,优于先前最先进方法约4%。
  • 在PRID-2011上,该方法达到88%的rank-1准确率,较先前最先进方法提升11%。
  • 具有三层空间注意力的模型性能最佳,当层数超过三层时性能下降。
  • 移除空间注意力(零层)导致准确率显著下降,iLIDS-VID上rank-1准确率降至60%,PRID-2011上降至80%。
  • 消融实验表明,直接从帧特征计算注意力分数比基于RNN的注意力机制更有效。
  • 定性结果表明,真实匹配样本在检索列表中始终排名靠前,表明特征学习具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。