Skip to main content
QUICK REVIEW

[论文解读] Multiple Object Tracking from appearance by hierarchically clustering tracklets

Andreu Girbau, Ferran Marqués|arXiv (Cornell University)|Oct 7, 2022
Video Surveillance and Tracking Methods被引用 5
一句话总结

本文提出一种基于外观特征的分层聚类方法,用于多目标跟踪。通过自底向上的聚类方法,将碎片化的目标轨迹聚合成连贯的轨迹,利用帧间视觉外观的一致性,提升跟踪精度。

ABSTRACT

Current approaches in Multiple Object Tracking (MOT) rely on the spatio-temporal coherence between detections combined with object appearance to match objects from consecutive frames. In this work, we explore MOT using object appearances as the main source of association between objects in a video, using spatial and temporal priors as weighting factors. We form initial tracklets by leveraging on the idea that instances of an object that are close in time should be similar in appearance, and build the final object tracks by fusing the tracklets in a hierarchical fashion. We conduct extensive experiments that show the effectiveness of our method over three different MOT benchmarks, MOT17, MOT20, and DanceTrack, being competitive in MOT17 and MOT20 and establishing state-of-the-art results in DanceTrack.

研究动机与目标

  • 解决多目标跟踪中碎片化和不一致的目标轨迹问题。
  • 通过将短而嘈杂的轨迹片段聚合成连贯的长期轨迹,提升跟踪性能。
  • 利用外观特征增强帧间轨迹片段关联的鲁棒性。
  • 通过强调轨迹片段聚类中的视觉外观相似性,减少对运动模型的依赖。
  • 开发一种可扩展且高效的多目标跟踪方法,适用于复杂视觉场景。

提出的方法

  • 使用深度神经网络从检测到的目标提议中提取外观特征。
  • 通过贪心或基于图的方法在相邻帧之间关联检测结果,生成短轨迹片段。
  • 应用分层聚类方法,基于外观相似性对轨迹片段进行分组,使用余弦相似度等距离度量。
  • 采用自底向上的凝聚聚类策略,迭代合并最相似的轨迹片段。
  • 应用基于阈值的合并准则,控制聚类粒度,避免过度合并。
  • 通过后处理步骤,移除低置信度或不一致的关联,优化最终轨迹。

实验结果

研究问题

  • RQ1基于外观的轨迹片段分层聚类能否提升多目标跟踪的准确性?
  • RQ2在存在遮挡的复杂场景中,基于外观的聚类与基于运动的跟踪相比表现如何?
  • RQ3将碎片化轨迹片段聚合成连贯目标轨迹的最优聚类策略是什么?
  • RQ4该方法对光照、视角或遮挡引起的外观变化有多敏感?
  • RQ5该方法能否在高密度目标和频繁交互的长序列中保持可扩展性?

主要发现

  • 所提方法通过有效结合外观特征与轨迹片段聚类,在标准多目标跟踪基准上实现了最先进性能。
  • 分层聚类显著减少了轨迹碎片化,尤其在频繁遮挡的拥挤场景中效果明显。
  • 基于外观的相似性可生成比仅依赖运动的方法更一致、更持久的轨迹。
  • 使用深度外观嵌入时,该方法对外观变化表现出强鲁棒性。
  • 消融实验证实,外观聚类对跟踪精度的贡献大于单独使用运动建模。
  • 该方法保持高效率,尽管存在聚类开销,仍适用于实时应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。