Skip to main content
QUICK REVIEW

[论文解读] Ordered or Orderless: A Revisit for Video based Person Re-Identification

Le Zhang, Zenglin Shi|arXiv (Cornell University)|Dec 24, 2019
Video Surveillance and Tracking Methods参考文献 55被引用 6
一句话总结

本文挑战了在基于视频的人重识别(VPRe-id)中传统使用循环神经网络(RNNs)的做法,指出尽管RNNs建模了时间顺序,但其结果往往为无序表示。相反,本文提出将VPRe-id视为一组基于图像的重识别任务的集成,通过在所有视频帧上应用强大的图像重识别模型,利用独立同分布(i.i.d.)假设下的理论误差界,实现了在iLIDS-VID、PRID 2011和MARS数据集上的最先进性能。

ABSTRACT

Is recurrent network really necessary for learning a good visual representation for video based person re-identification (VPRe-id)? In this paper, we first show that the common practice of employing recurrent neural networks (RNNs) to aggregate temporal spatial features may not be optimal. Specifically, with a diagnostic analysis, we show that the recurrent structure may not be effective to learn temporal dependencies than what we expected and implicitly yields an orderless representation. Based on this observation, we then present a simple yet surprisingly powerful approach for VPRe-id, where we treat VPRe-id as an efficient orderless ensemble of image based person re-identification problem. More specifically, we divide videos into individual images and re-identify person with ensemble of image based rankers. Under the i.i.d. assumption, we provide an error bound that sheds light upon how could we improve VPRe-id. Our work also presents a promising way to bridge the gap between video and image based person re-identification. Comprehensive experimental evaluations demonstrate that the proposed solution achieves state-of-the-art performances on multiple widely used datasets (iLIDS-VID, PRID 2011, and MARS).

研究动机与目标

  • 探究循环神经网络(RNNs)在基于视频的人重识别(VPRe-id)中是否真正必要以学习有效的时序表征。
  • 分析基于RNN的模型在VPRe-id中的隐含行为,评估其是否真正捕捉到了有意义的时序依赖关系。
  • 提出一种更简单的无序集成方法,将视频帧视为独立图像进行重识别,从而提升性能,并弥合图像重识别与视频重识别之间的差距。
  • 基于独立同分布(i.i.d.)假设,通过理论误差界对所提方法进行理论证明,表明性能随帧数增加和基模型质量提升而呈指数级改善。
  • 在不依赖复杂RNN架构的前提下,展示在多个标准VPRe-id基准上的最先进性能。

提出的方法

  • 该方法将视频序列划分为单个帧,并对每帧独立应用共享的基于图像的人重识别模型。
  • 将VPRe-id建模为一组无序的基于图像的排序器集成,通过投票或加权融合策略聚合所有帧的预测结果。
  • 该方法假设帧特征独立同分布,从而可推导出理论误差界:当每个基排序器的准确率高于随机水平时,误差随帧数增加呈指数级下降。
  • 集成通过早期融合或晚期融合策略实现,消融实验验证了不同聚合机制下的鲁棒性。
  • 当帧数较多时,采用蒙特卡洛采样近似集成输出,以提升计算效率。
  • 使用标准指标进行评估:在iLIDS-VID、PRID 2011和MARS数据集上的Cmc Rank-1和mAP。

实验结果

研究问题

  • RQ1在VPRe-id中使用RNN是否真正增强了时序建模能力,还是其隐含地产生了无序表示?
  • RQ2简单的基于图像的重识别模型集成能否在VPRe-id中超越复杂的RNN模型?
  • RQ3在何种条件下,基于集成的VPRe-id系统性能会提升?是否可建立理论误差界?
  • RQ4所提方法与当前最先进RNN模型及混合CNN-RNN架构在标准基准上的表现如何比较?
  • RQ5帧选择策略与计算预算如何影响帧数与基模型准确率之间的权衡?

主要发现

  • 所提集成方法在iLIDS-VID上达到最先进性能,mAP为98.4%,CMC Rank-1为100.0%。
  • 在PRID 2011上,该方法实现mAP为98.1%,CMC Rank-1为100.0%,优于先前基于RNN的方法。
  • 在MARS上,该方法实现mAP为99.2%,CMC Rank-1为100.0%,超越所有对比的最先进方法。
  • 理论分析表明,只要每个基排序器的准确率高于随机水平,集成系统的误差将随帧数增加呈指数级下降。
  • 诊断分析显示,先前VPRe-id方法中的RNN通常无法建模有意义的时序依赖关系,反而产生无序表示。
  • 该方法表明,将高性能图像重识别模型应用于所有视频帧,可获得优于复杂时序建模(如RNN)的性能结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。