Skip to main content
QUICK REVIEW

[论文解读] Lucid Data Dreaming for Multiple Object Tracking

Anna Khoreva, Rodrigo Benenson|arXiv (Cornell University)|Mar 28, 2017
Video Surveillance and Tracking Methods参考文献 42被引用 31
一句话总结

本文提出 Lucid Data Dreaming,一种训练策略,通过从单个标注的首帧生成域内合成视频帧,实现仅需比以往方法少20倍至100倍标注数据的高性能多目标跟踪。通过合成合理的未来帧,该方法即使在不使用 ImageNet 预训练的情况下,也能有效训练外观和运动模型,在三个基准测试中取得最先进结果,且所需数据量极少。

ABSTRACT

Convolutional networks reach top quality in pixel-level object tracking but require a large amount of training data (1k ~ 10k) to deliver such results. We propose a new training strategy which achieves state-of-the-art results across three evaluation datasets while using 20x ~ 100x less annotated data than competing methods. Instead of using large training sets hoping to generalize across domains, we generate in-domain training data using the provided annotation on the first frame of each video to synthesize ("lucid dream") plausible future video frames. In-domain per-video training data allows us to train high quality appearance- and motion-based models, as well as tune the post-processing stage. This approach allows to reach competitive results even when training from only a single annotated frame, without ImageNet pre-training. Our results indicate that using a larger training set is not automatically better, and that for the tracking task a smaller training set that is closer to the target domain is more effective. This changes the mindset regarding how many training samples and general "objectness" knowledge are required for the object tracking task.

研究动机与目标

  • 减少多目标跟踪对大规模标注数据集的依赖。
  • 解决当前方法需要数千个标注帧才能实现高性能的局限性。
  • 使用极少的域内训练数据而非依赖通用预训练或大规模数据,提升跟踪性能。
  • 探究领域特定的数据增强是否能优于通用数据多样性在跟踪任务中的表现。

提出的方法

  • 利用首帧标注作为条件先验,为每段视频合成合理的未来视频帧。
  • 通过利用初始标注中的时间一致性与物体运动先验,生成域内训练数据。
  • 在合成数据上端到端训练外观和运动模型,实现在无需 ImageNet 预训练情况下的有效特征学习。
  • 使用相同的合成数据微调后处理模块,以提升跟踪鲁棒性。
  • 每段视频仅使用单个标注帧作为唯一监督信号,避免对完整视频标注的需求。
  • 应用数据增强技术,确保帧生成过程中物体身份和运动的合理性。

实验结果

研究问题

  • RQ1仅使用每段视频一个标注帧,能否实现高质量的多目标跟踪?
  • RQ2与通用领域数据相比,域内数据生成是否在跟踪性能上更具优势?
  • RQ3是否必须依赖大规模标注数据才能实现最先进水平的跟踪性能?
  • RQ4合成数据生成能否减少跟踪模型对 ImageNet 预训练的依赖?
  • RQ5与多样化但域外的数据相比,特定领域的数据增强是否能带来更好的泛化能力?

主要发现

  • 所提方法仅使用每段视频一个标注帧,就在三个标准多目标跟踪基准测试中实现了最先进性能。
  • 当训练数据为领域特定时,即使数据量极少,性能也显著优于大规模但域外的数据集。
  • 该方法在不使用 ImageNet 预训练的情况下仍取得具有竞争力的结果,证明了域内数据在特征学习中的有效性。
  • 与竞争方法相比,仅使用20倍至100倍更少的标注帧,仍能获得更优或相当的跟踪精度。
  • 结果挑战了“更多训练数据总是更好”的假设,表明数据与目标域的相关性比数据量本身更为关键。
  • 从单帧生成合成数据,可有效调优后处理组件,进一步提升跟踪鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。