Skip to main content
QUICK REVIEW

[论文解读] Video-based Person Re-identification via 3D Convolutional Networks and Non-local Attention

Xingyu Liao, Lingxiao He|arXiv (Cornell University)|Jul 12, 2018
Video Surveillance and Tracking Methods参考文献 51被引用 5
一句话总结

本文提出一种结合非局部注意力模块的3D卷积神经网络用于基于视频的人重识别,能够联合建模时空依赖性并处理空间错位问题。该方法在MARS数据集上相比先前工作将mAP提升2.0%,在PRID2011和iLIDS-VID上也优于现有方法,达到最先进性能。

ABSTRACT

Video-based person re-identification (ReID) is a challenging problem, where some video tracks of people across non-overlapping cameras are available for matching. Feature aggregation from a video track is a key step for video-based person ReID. Many existing methods tackle this problem by average/maximum temporal pooling or RNNs with attention. However, these methods cannot deal with temporal dependency and spatial misalignment problems at the same time. We are inspired by video action recognition that involves the identification of different actions from video tracks. Firstly, we use 3D convolutions on video volume, instead of using 2D convolutions across frames, to extract spatial and temporal features simultaneously. Secondly, we use a non-local block to tackle the misalignment problem and capture spatial-temporal long-range dependencies. As a result, the network can learn useful spatial-temporal information as a weighted sum of the features in all space and temporal positions in the input feature map. Experimental results on three datasets show that our framework outperforms state-of-the-art approaches by a large margin on multiple metrics.

研究动机与目标

  • 解决基于视频的人重识别中时间依赖性和空间错位的挑战。
  • 通过捕捉长程时空关系,改进视频序列中的特征聚合。
  • 克服平均/最大池化方法以及基于RNN的方法在同时建模时间动态与空间错位方面的局限性。
  • 将空间与时间注意力机制整合至端到端的3D CNN框架中,实现判别性表征学习。
  • 在多种真实世界条件下(如遮挡、视角变化)展示优越性能。

提出的方法

  • 使用3D卷积网络直接从视频体积中提取联合时空特征,替代跨帧的2D卷积。
  • 集成非局部模块以显式建模空间与时间上的长程依赖,实现对所有位置特征的加权聚合。
  • 将非局部模块用作时空注意力机制,缓解形变或遮挡帧中的空间错位问题。
  • 采用监督对比学习与三元组损失在视频轨迹对上端到端训练模型。
  • 在Kinetics数据集上预训练3D ResNet3D-50主干网络,相比ImageNet或重识别专用数据集,能为基于视频的重识别提供更优初始化。
  • 应用特征归一化与度量学习,增强最终嵌入的判别能力。

实验结果

研究问题

  • RQ1与使用递归池化的2D-CNN相比,3D卷积网络是否能更有效地学习用于视频重识别的联合时空表征?
  • RQ2非局部模块如何通过建模长程依赖与处理视频序列中的空间错位来提升性能?
  • RQ3端到端训练的3D CNN结合非局部注意力是否优于使用独立注意力或RNN模块的现有方法?
  • RQ4在视频动作识别数据集(如Kinetics)上进行预训练在多大程度上提升了人重识别中的泛化能力?
  • RQ5在遮挡、视角变化和背景杂乱等挑战性条件下,所提方法表现如何?

主要发现

  • 在MARS数据集上,该方法达到91.2%的rank-1准确率与77.0%的mAP,相比之前最先进结果(82.3% mAP)提升了2.0个百分点。
  • 在PRID2011上,该方法实现91.2%的rank-1准确率,略低于先前最先进结果(93.2%),但具有更高效且端到端的架构。
  • 在iLIDS-VID上,该方法达到81.3%的rank-1准确率,超过先前最先进结果(80.2%),展现出强大的泛化能力。
  • 在Kinetics上预训练可获得最佳性能(MARS上mAP达84.3%),显著优于ImageNet和重识别专用预训练。
  • 消融实验表明,ResNet3D-50结合非局部模块使MARS上的性能从80.0%提升至84.3%,证明了非局部注意力的有效性。
  • 非局部模块能有效缓解空间错位问题并增强特征聚合,尤其在遮挡与形变情况下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。