Skip to main content
QUICK REVIEW

[论文解读] VRSTC: Occlusion-Free Video Person Re-Identification

Ruibing Hou, Bingpeng Ma|arXiv (Cornell University)|Jul 19, 2019
Video Surveillance and Tracking Methods参考文献 38被引用 17
一句话总结

本文提出 VRSTC,一种视频行人重识别框架,通过使用时空补全网络(STCnet)显式处理部分遮挡问题,以恢复被遮挡帧中的缺失身体部位。STCnet 利用空间身体结构和时间运动模式生成逼真的遮挡区域,随后将这些恢复的区域与可见部分结合,以提升重识别准确率,在 MARS、DukeMTMC-VideoReID 和 iLIDS-VID 上实现了最先进性能。

ABSTRACT

Video person re-identification (re-ID) plays an important role in surveillance video analysis. However, the performance of video re-ID degenerates severely under partial occlusion. In this paper, we propose a novel network, called Spatio-Temporal Completion network (STCnet), to explicitly handle partial occlusion problem. Different from most previous works that discard the occluded frames, STCnet can recover the appearance of the occluded parts. For one thing, the spatial structure of a pedestrian frame can be used to predict the occluded body parts from the unoccluded body parts of this frame. For another, the temporal patterns of pedestrian sequence provide important clues to generate the contents of occluded parts. With the Spatio-temporal information, STCnet can recover the appearance for the occluded parts, which could be leveraged with those unoccluded parts for more accurate video re-ID. By combining a re-ID network with STCnet, a video re-ID framework robust to partial occlusion (VRSTC) is proposed. Experiments on three challenging video re-ID databases demonstrate that the proposed approach outperforms the state-of-the-art.

研究动机与目标

  • 为解决行人或环境物体导致的部分遮挡所引发的视频行人重识别性能严重下降问题。
  • 克服现有方法因丢弃被遮挡帧而损失宝贵时空信息的局限性。
  • 开发一种补全网络,利用空间和时间线索恢复被遮挡身体部位的真实外观。
  • 将补全后的帧集成到重识别框架中,以提升在遮挡条件下的鲁棒性和准确性。
  • 在 DukeMTMC-VideoReID 上建立新的最先进基线,并在多个基准上实现一致的性能提升。

提出的方法

  • 提出 STCnet,一种双分支网络,其中空间结构生成器基于单帧内的可见部分预测被遮挡的身体部位。
  • 引入时间注意力生成器,利用视频序列中相邻帧的运动模式对空间补全特征进行优化。
  • 采用新颖的时间注意力层对时间维度上的特征进行加权聚合,以提升恢复的遮挡区域质量。
  • 将 STCnet 与标准重识别网络结合,形成 VRSTC 框架,其中仅使用未被遮挡的帧进行训练和推理,但补全帧有助于提升特征学习效果。
  • 通过卷积神经网络提取特征,随后进行时间池化和注意力机制操作,生成鲁棒的视频级表征。
  • 采用交叉熵损失和三元组损失端到端联合训练整个框架,以优化行人重识别性能。

实验结果

研究问题

  • RQ1深度学习模型能否有效利用空间和时间上下文,在视频帧中恢复被遮挡身体部位的外观?
  • RQ2与直接丢弃被遮挡帧相比,恢复被遮挡区域是否能提升部分遮挡条件下的行人重识别准确率?
  • RQ3该补全网络是否能在不依赖光学流等额外输入的情况下,增强重识别特征的判别能力?
  • RQ4所提出的 VRSTC 框架在标准视频重识别基准上与最先进方法相比表现如何?
  • RQ5补全帧的集成在多大程度上提升了特征表征能力并增强了对遮挡的鲁棒性?

主要发现

  • 在 MARS 数据集上,VRSTC 达到 88.5% 的 rank-1 准确率和 82.3% 的 mAP,分别较之前的 SOTA 方法 Snippet+OF 提升 2.2% 和 6.2%。
  • 在 DukeMTMC-VideoReID 上,VRSTC 实现 95.0% 的 rank-1 和 93.5% 的 mAP,较基线模型分别提升 7.8% 和 11.7%。
  • 在 iLIDS-VID 上,VRSTC 达到 83.4% 的 rank-1 和 99.5% 的 rank-20,较无光学流的 Snippet 方法分别提升 3.6% 和 3.7%。
  • 可视化结果表明,STCnet 成功恢复了被遮挡的身体部位,减少了特征图中背景和其他行人带来的干扰。
  • 消融实验证明,STCnet 的空间与时间组件均不可或缺,且时间模块相比仅空间补全带来了显著性能增益。
  • VRSTC 在无需依赖光学流的情况下实现优越性能,与部分 SOTA 方法不同,使其在真实场景部署中更具实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。