Skip to main content
QUICK REVIEW

[论文解读] ClickBAIT-v2: Training an Object Detector in Real-Time

Ervin Teng, Rui Huang|arXiv (Cornell University)|Mar 27, 2018
Advanced Neural Network Applications参考文献 16被引用 6
一句话总结

ClickBAIT-v2 通过利用单点点击通过交互式分割生成边界框,并借助目标跟踪减少人工标注工作量,实现了在实时视频流上的人机协同、实时的目标检测器训练。与逐帧点击相比,该系统使每位用户交互的训练效率提高了3至4倍,从而使得无人机等动态环境中的在线模型适应成为可能。

ABSTRACT

Modern deep convolutional neural networks (CNNs) for image classification and object detection are often trained offline on large static datasets. Some applications, however, will require training in real-time on live video streams with a human-in-the-loop. We refer to this class of problem as time-ordered online training (ToOT). These problems will require a consideration of not only the quantity of incoming training data, but the human effort required to annotate and use it. We demonstrate and evaluate a system tailored to training an object detector on a live video stream with minimal input from a human operator. We show that we can obtain bounding box annotation from weakly-supervised single-point clicks through interactive segmentation. Furthermore, by exploiting the time-ordered nature of the video stream through object tracking, we can increase the average training benefit of human interactions by 3-4 times.

研究动机与目标

  • 解决在实时视频流上以最少人工标注进行目标检测器训练的挑战。
  • 通过用单点点击替代手动绘制边界框,减少在线训练中的人工工作量。
  • 通过利用目标跟踪实现的时间连续性,提升每次人工交互的有效性。
  • 评估在时间有序在线训练(ToOT)场景中,每次用户交互带来的增量训练收益。
  • 为面对不可预见环境变化的自主系统(如无人机)提供持续、现场的模型自适应能力。

提出的方法

  • 将用户在视频帧中点击目标对象作为输入,送入交互式分割模型以生成精确的对象掩码。
  • 将分割得到的掩码转换为紧密的边界框,用于目标检测器的训练。
  • 使用检测到的边界框初始化目标跟踪,以在后续帧中无需额外用户输入即可传播标注结果。
  • 利用时间有序的视频序列,跨帧复用标注结果,减少冗余的用户交互。
  • 采用增量训练收益(ITB)作为度量指标,量化每次用户交互对模型性能的影响。
  • 比较启用与不启用跟踪时的训练效率,跨多种场景测量每次交互的平均ITB。

实验结果

研究问题

  • RQ1单点点击标注在实时目标检测中生成边界框的效率如何?
  • RQ2在时间有序在线训练中,目标跟踪在多大程度上放大了每次人工交互的训练收益?
  • RQ3增量训练收益(ITB)在不同帧之间如何变化?是否存在某些帧比其他帧更具价值?
  • RQ4结合弱监督点击输入与跟踪,能否在显著减少用户交互次数的情况下实现相近的模型性能?
  • RQ5视频流的时间结构是否相比逐帧标注能实现更高效的在线学习?

主要发现

  • 在 CarChaser 场景中,目标跟踪使每次用户交互的平均增量训练收益(ITB)提升4.50倍。
  • 在 PersonFinder 场景中,目标跟踪使平均ITB提升3.07倍,用户交互次数从197次减少至65次。
  • 在启用跟踪的情况下,CarChaser 场景的最终平均精度(Pf)达到76.5%,PersonFinder 场景达到58.1%,且用户交互次数显著减少。
  • 早期训练帧,尤其是背景稀疏的帧,对模型性能提升贡献较小,表现为初始ITB值较低。
  • 启用跟踪的策略产生更稀疏但更具影响力的训练轮次,在CarChaser场景中总交互次数为96次,而未启用跟踪时为435次。
  • 结果表明,目标跟踪可使人工输入的有效性提升3至4倍,从而使自主系统实现真正的实时在线训练成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。