Skip to main content
QUICK REVIEW

[论文解读] Temporal Complementary Learning for Video Person Re-Identification

Ruibing Hou, Hong Chang|arXiv (Cornell University)|Jul 18, 2020
Video Surveillance and Tracking Methods参考文献 46被引用 15
一句话总结

本文提出了一种用于视频行人重识别的时序互补学习网络(TCLNet),通过引入时序显著性擦除(TSE)模块,逐步提取跨帧的互补特征,以及时序显著性增强(TSB)模块,保留并增强显著特征,从而提升特征多样性与表征能力。TCLNet 在多个基准测试中取得最先进性能,top-1 准确率最高提升 1.2%,mAP 最高提升 2.7%。

ABSTRACT

This paper proposes a Temporal Complementary Learning Network that extracts complementary features of consecutive video frames for video person re-identification. Firstly, we introduce a Temporal Saliency Erasing (TSE) module including a saliency erasing operation and a series of ordered learners. Specifically, for a specific frame of a video, the saliency erasing operation drives the specific learner to mine new and complementary parts by erasing the parts activated by previous frames. Such that the diverse visual features can be discovered for consecutive frames and finally form an integral characteristic of the target identity. Furthermore, a Temporal Saliency Boosting (TSB) module is designed to propagate the salient information among video frames to enhance the salient feature. It is complementary to TSE by effectively alleviating the information loss caused by the erasing operation of TSE. Extensive experiments show our method performs favorably against state-of-the-arts. The source code is available at https://github.com/blue-blue272/VideoReID-TCLNet.

研究动机与目标

  • 为解决行人重识别中连续视频帧提取特征时存在的冗余问题,即模型常关注相同的局部区域。
  • 发现跨帧间多样化的互补视觉线索,以构建更完整且更具判别性的身份表征。
  • 通过增强视频序列中显著特征的传播,缓解 TSE 模块中显著性擦除导致的信息损失。
  • 通过在现有 CNN 中插入模块,实现无需架构大规模改动的高效互补特征学习,支持端到端训练。

提出的方法

  • 时序显著性擦除(TSE)模块通过显著性擦除操作抑制前一帧激活的特征,迫使后续学习器发现新的互补区域。
  • TSE 采用有序学习器序列,每个学习器在擦除先前学习器关注区域后处理当前帧,从而促进特征多样性。
  • 时序显著性增强(TSB)模块利用时序线索在帧间传播显著特征,增强最具判别性的部分的表征能力。
  • TSB 仅选择性传播显著信息,与 TSE 互补,降低引入噪声或错误的风险。
  • TSE 和 TSB 模块为即插即用设计,可插入任意 CNN 主干网络,支持使用标准 re-ID 损失函数进行端到端训练。
  • 该方法在三个标准基准 MARS、DukeMTMC 和 Market-1501 上进行评估,采用 mAP 和 top-1 准确率作为评价指标。

实验结果

研究问题

  • RQ1在视频帧间渐进擦除先前激活的特征,是否能提升行人重识别中学习表征的多样性与判别性?
  • RQ2在帧间传播显著特征,是否能增强最具判别性视觉线索的鲁棒性与表征能力?
  • RQ3与标准数据增强或基于注意力的池化方法相比,该互补学习策略在性能与特征多样性方面表现如何?
  • RQ4所提出的 TSE 与 TSB 模块能否有效结合,超越现有最先进方法在视频 re-ID 中的表现?

主要发现

  • 在 MARS 基准上,TCLNet 达到 88.8% 的 top-1 准确率与 83.0% 的 mAP,相比之前最先进方法,top-1 准确率提升 1.2%,mAP 提升 2.7%。
  • 仅使用 TSE 模块,mAP 提升 2.7%,top-1 准确率提升 1.3%,显著优于随机擦除与 DropBlock 方法。
  • 当与非局部(NL)模块结合时,TCLNet(TSE+TSB)相比 base.+TSE+NL 模型,top-1 准确率高出 1.2%,证明了 TSB 与其他特征增强技术的互补性。
  • TSB 模块在准确率与效率方面均优于 3D 卷积与非局部方法,参数量更低,且对低质量帧更具鲁棒性。
  • t-SNE 可视化结果表明,TCLNet 学习到的特征分布更具可分性,尤其在外观相似的身份(如蓝色上衣)中,显著减少了特征重叠。
  • 特征图可视化显示,TSE 使不同帧关注不同的身体部位(如上半身 vs. 下半身),从而提升判别能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。