Skip to main content
QUICK REVIEW

[论文解读] 1st Place Solution to ECCV-TAO-2020: Detect and Represent Any Object for Tracking

Fei Du, Bo Xu|arXiv (Cornell University)|Jan 20, 2021
Video Surveillance and Tracking Methods参考文献 13被引用 12
一句话总结

本论文提出了一项在 ECCV-TAO-2020 跟踪挑战赛中获得第一名的解决方案,提出了一种检测与表征框架,利用类别无关的外观特征来跟踪 1200 多种类别的任意物体。通过利用最先进的检测模型(DetectoRS 搭载 SENet-154 和 BAGS)并在 20 万个单目标跟踪(SOT)轨迹上训练 ReID 模型,该方法在 1 FPS 推理和模型集成结合后处理的情况下,于 TAO 验证集上实现了 57.72 mAP 的性能,显著优于标准 MOT 基线方法在长尾、开放词汇跟踪任务上的表现。

ABSTRACT

We extend the classical tracking-by-detection paradigm to this tracking-any-object task. Solid detection results are first extracted from TAO dataset. Some state-of-the-art techniques like extbf{BA}lanced- extbf{G}roup extbf{S}oftmax ( extbf{BAGS}\cite{li2020overcoming}) and DetectoRS\cite{qiao2020detectors} are integrated during detection. Then we learned appearance features to represent any object by training feature learning networks. We ensemble several models for improving detection and feature representation. Simple linking strategies with most similar appearance features and tracklet-level post association module are finally applied to generate final tracking results. Our method is submitted as extbf{AOA} on the challenge website. Code is available at https://github.com/feiaxyt/Winner_ECCV20_TAO.

研究动机与目标

  • 为解决在 TAO 数据集中对 1200 多种长尾类别进行任意物体跟踪的挑战,该挑战超出了传统 MOT 框架的适用范围。
  • 通过在 LVIS v1.0 上微调模型并应用标签映射至 TAO,提升在稀有和长尾类别上的检测召回率。
  • 开发一种鲁棒的、类别无关的外观特征表征方法,能够匹配在光照、视角和形变变化下多样化的物体外观。
  • 通过使用 1 FPS 推理和仅基于外观的关联方法,克服在低帧率、高变化性场景下实时跟踪的局限性。
  • 通过模型集成和轨迹级后关联(PA)模块,实现轨迹的合并与优化,从而提升跟踪性能。

提出的方法

  • 使用 MMDetection 训练两个检测模型:一个采用 DetectoRS 和 SENet-154 主干网络,并在 LVIS v1.0 上使用 BAGS 损失进行微调;另一个使用开源的 BAGS。
  • 通过 synset 字段将 LVIS v1.0 标签映射至 LVIS v0.5,以对齐检测标签与 TAO 的标注方案。
  • 在来自 SOT 数据集(YouTube-BB、GOT-10k、ImageNet VID)的 20 万个轨迹上训练两个 ReID 模型,以学习类别无关的外观特征。
  • 在跟踪过程中将两个 ReID 模型的特征进行拼接,以提升判别能力与匹配准确性。
  • 采用 1 FPS 推理流程以减少误差累积,使用基于特征的关联方法替代依赖几何信息的方法(如 SORT 或最小费用流)。
  • 应用轨迹级后关联(PA)模块,通过使用平均外观特征重新关联非重叠轨迹段,以低计算成本提升 mAP 性能。

实验结果

研究问题

  • RQ1使用类别无关外观特征的检测与表征流水线是否能在开放词汇、长尾的 TAO 数据集上超越标准 MOT 框架?
  • RQ2检测与 ReID 模型的集成在提升任意物体跟踪的召回率与 mAP 方面有多有效?
  • RQ3在低帧率、复杂视频序列中,1 FPS 推理结合仅基于外观的关联是否优于高帧率、依赖几何信息的跟踪方法?
  • RQ4在 SOT 数据上训练的 ReID 模型在 TAO 中多样化物体类别上的泛化能力如何?
  • RQ5当使用真实轨迹(oracle tracks)时,性能上限是多少?实际系统能多接近这一上限?

主要发现

  • 在 LVIS v1.0 上微调并使用 BAGS 损失训练的检测模型在 LVIS v0.5 验证集上达到了 39.70 mAP,显著优于基线模型。
  • 在 1 FPS 下使用 Model-1-482(过滤至 482 个 TAO 类别)的 ReID 特征,将 mAP 从 SORT 在 30 FPS 下的 14.80 提升至 25.53。
  • 在 1 FPS 下集成 Model-1 与 Model-2 的检测结果,并结合 ReID1+ReID2 特征,使 TAO 验证集上的 mAP 提升至 28.59。
  • 应用 PA 后处理模块后,mAP 进一步提升至 29.27,证明其在优化轨迹关联方面的有效性。
  • 在使用 oracle 轨迹时,结合 Model-1 与 Model-2 检测结果,该方法实现了 57.72 mAP,表明该方法具有强大的性能上限。
  • 孪生网络式的外观特征模型表现劣于基于 ReID 的特征,表明 ReID 更适合开放词汇跟踪任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。