[论文解读] ClickBAIT-v2: Training an Object Detector in Real-Time
ClickBAIT-v2 通过利用单点点击通过交互式分割生成边界框,并借助目标跟踪减少人工标注工作量,实现了在实时视频流上的人机协同、实时的目标检测器训练。与逐帧点击相比,该系统使每位用户交互的训练效率提高了3至4倍,从而使得无人机等动态环境中的在线模型适应成为可能。
Modern deep convolutional neural networks (CNNs) for image classification and object detection are often trained offline on large static datasets. Some applications, however, will require training in real-time on live video streams with a human-in-the-loop. We refer to this class of problem as time-ordered online training (ToOT). These problems will require a consideration of not only the quantity of incoming training data, but the human effort required to annotate and use it. We demonstrate and evaluate a system tailored to training an object detector on a live video stream with minimal input from a human operator. We show that we can obtain bounding box annotation from weakly-supervised single-point clicks through interactive segmentation. Furthermore, by exploiting the time-ordered nature of the video stream through object tracking, we can increase the average training benefit of human interactions by 3-4 times.
研究动机与目标
- 解决在实时视频流上以最少人工标注进行目标检测器训练的挑战。
- 通过用单点点击替代手动绘制边界框,减少在线训练中的人工工作量。
- 通过利用目标跟踪实现的时间连续性,提升每次人工交互的有效性。
- 评估在时间有序在线训练(ToOT)场景中,每次用户交互带来的增量训练收益。
- 为面对不可预见环境变化的自主系统(如无人机)提供持续、现场的模型自适应能力。
提出的方法
- 将用户在视频帧中点击目标对象作为输入,送入交互式分割模型以生成精确的对象掩码。
- 将分割得到的掩码转换为紧密的边界框,用于目标检测器的训练。
- 使用检测到的边界框初始化目标跟踪,以在后续帧中无需额外用户输入即可传播标注结果。
- 利用时间有序的视频序列,跨帧复用标注结果,减少冗余的用户交互。
- 采用增量训练收益(ITB)作为度量指标,量化每次用户交互对模型性能的影响。
- 比较启用与不启用跟踪时的训练效率,跨多种场景测量每次交互的平均ITB。
实验结果
研究问题
- RQ1单点点击标注在实时目标检测中生成边界框的效率如何?
- RQ2在时间有序在线训练中,目标跟踪在多大程度上放大了每次人工交互的训练收益?
- RQ3增量训练收益(ITB)在不同帧之间如何变化?是否存在某些帧比其他帧更具价值?
- RQ4结合弱监督点击输入与跟踪,能否在显著减少用户交互次数的情况下实现相近的模型性能?
- RQ5视频流的时间结构是否相比逐帧标注能实现更高效的在线学习?
主要发现
- 在 CarChaser 场景中,目标跟踪使每次用户交互的平均增量训练收益(ITB)提升4.50倍。
- 在 PersonFinder 场景中,目标跟踪使平均ITB提升3.07倍,用户交互次数从197次减少至65次。
- 在启用跟踪的情况下,CarChaser 场景的最终平均精度(Pf)达到76.5%,PersonFinder 场景达到58.1%,且用户交互次数显著减少。
- 早期训练帧,尤其是背景稀疏的帧,对模型性能提升贡献较小,表现为初始ITB值较低。
- 启用跟踪的策略产生更稀疏但更具影响力的训练轮次,在CarChaser场景中总交互次数为96次,而未启用跟踪时为435次。
- 结果表明,目标跟踪可使人工输入的有效性提升3至4倍,从而使自主系统实现真正的实时在线训练成为可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。