Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Multiple Person Tracking using AutoEncoder-Based Lifted Multicuts

Kalun Ho, Janis Keuper|arXiv (Cornell University)|Feb 4, 2020
Video Surveillance and Tracking Methods参考文献 52被引用 8
一句话总结

该论文提出了一种完全无监督的多目标跟踪方法,利用时空线索和基于自编码器的潜在空间,学习无需人工标注的鲁棒外观特征。通过在自编码器训练中注入提升的多路切割约束,模型学习到身份不变的表征,从而实现准确的长距离重识别,在 MOT17 基准上实现了 48.1% 的竞争性 MOTA,且完全无监督。

ABSTRACT

Multiple Object Tracking (MOT) is a long-standing task in computer vision. Current approaches based on the tracking by detection paradigm either require some sort of domain knowledge or supervision to associate data correctly into tracks. In this work, we present an unsupervised multiple object tracking approach based on visual features and minimum cost lifted multicuts. Our method is based on straight-forward spatio-temporal cues that can be extracted from neighboring frames in an image sequences without superivison. Clustering based on these cues enables us to learn the required appearance invariances for the tracking task at hand and train an autoencoder to generate suitable latent representation. Thus, the resulting latent representations can serve as robust appearance cues for tracking even over large temporal distances where no reliable spatio-temporal features could be extracted. We show that, despite being trained without using the provided annotations, our model provides competitive results on the challenging MOT Benchmark for pedestrian tracking.

研究动机与目标

  • 开发一种完全无监督的多目标跟踪方法,不依赖人工标注数据进行行人重识别。
  • 学习在姿态、视角和遮挡变化下仍能跨长时间跨度泛化的鲁棒外观表征。
  • 将时空线索整合到深度自编码器中,以在潜在空间中强制身份一致性。
  • 在 MOT17 基准上实现与监督方法具有竞争力的跟踪性能,且不使用任何真实标注或预训练模型。
  • 证明通过提升多路切割进行自监督学习,可为 MOT 生成具有竞争力的外观度量。

提出的方法

  • 该方法使用最小代价提升多路切割对基于时空线索(如相邻帧之间的 IoU)的检测结果进行聚类,形成初始轨迹段。
  • 这些轨迹段用于训练卷积自编码器,以最小化属于同一轨迹段的检测在潜在表示中的距离。
  • 自编码器通过聚类损失进行训练,以在潜在空间中强制身份一致性,学习时间上的外观不变性。
  • 由此得到的潜在表征可作为重识别的鲁棒外观特征,即使在时空线索失效的长时序间隔下依然有效。
  • 在 10、20 和 30 帧的距离上添加提升边,以建模长距离关联。
  • 最终的跟踪结果通过同时使用时空特征和学习到的外观特征求解最小代价提升多路切割问题获得。

实验结果

研究问题

  • RQ1完全无监督的方法能否在不依赖人工标注数据的情况下学习到有效的多目标跟踪外观特征?
  • RQ2能否利用相邻帧的时空线索来监督深度自编码器中身份不变表征的学习?
  • RQ3将轨迹段级别的聚类信息注入自编码器是否能提升长距离重识别性能?
  • RQ4由此生成的潜在空间能否在无任何监督的情况下实现 MOT17 基准上的有竞争力的跟踪性能?
  • RQ5在长距离上集成提升边如何影响跟踪精度和身份切换次数的减少?

主要发现

  • 所提出的无监督方法在 MOT17 测试集上实现了 48.1% 的 MOTA,证明了其在无任何人工标注情况下的强竞争力。
  • 自编码器训练过程中引入聚类损失显著提升了模型性能,相比无聚类监督的基线自编码器,MOTA 提升了 10.6 个百分点。
  • 身份切换次数相比基线减少了 116 次,表明身份一致性得到显著改善。
  • 使用 SDP 检测器时性能最佳(MOTA 57.7%),而在噪声更大的 DPM 检测结果上性能下降,尤其在 MOT17-08 等挑战性序列中表现更差。
  • 在 10–30 帧距离上添加长距离提升边可提高跟踪精度并减少身份切换,最优设置在训练数据上实现了 49.9% 的 MOTA。
  • 该方法在无监督方法中达到最先进性能,在 MOT17 基准上优于其他完全无监督方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。