Skip to main content
QUICK REVIEW

[论文解读] ClickBAIT: Click-based Accelerated Incremental Training of Convolutional Neural Networks

Ervin Teng, João Diogo Falcão|arXiv (Cornell University)|Sep 15, 2017
Advanced Neural Network Applications参考文献 12被引用 6
一句话总结

本文提出 ClickBAIT,一种用于在小型无人航空器系统(UAS)上实时进行目标检测的卷积神经网络(CNN)的时间有序在线训练(ToOT)加速系统。通过结合局部学习与基于光流的对象跟踪,与标准的单帧一标记方法相比,ClickBAIT 将训练收益最高提升 8 倍,显著减少了在实时视频流上进行增量训练时的人工用户交互次数。

ABSTRACT

Today's general-purpose deep convolutional neural networks (CNN) for image classification and object detection are trained offline on large static datasets. Some applications, however, will require training in real-time on live video streams with a human-in-the-loop. We refer to this class of problem as Time-ordered Online Training (ToOT) - these problems will require a consideration of not only the quantity of incoming training data, but the human effort required to tag and use it. In this paper, we define training benefit as a metric to measure the effectiveness of a sequence in using each user interaction. We demonstrate and evaluate a system tailored to performing ToOT in the field, capable of training an image classifier on a live video stream through minimal input from a human operator. We show that by exploiting the time-ordered nature of the video stream through optical flow-based object tracking, we can increase the effectiveness of human actions by about 8 times.

研究动机与目标

  • 为解决在实时视频流中以最少人工输入进行 CNN 训练的挑战,特别是针对动态或未知目标。
  • 定义并量化“训练收益”作为评估每次人工交互在在线训练场景中有效性的指标。
  • 设计并实现一种系统,支持在小型 UAS 上进行机载、增量式 CNN 分类器训练,使用人工标注的视频流。
  • 探索通过光流跟踪实现的视频流时间一致性,如何减少冗余标注并提升学习效率。
  • 证明将局部学习与光流跟踪相结合,可显著提升每次用户交互的增量训练收益。

提出的方法

  • 该系统利用光流在连续视频帧之间跟踪对象,实现时间上一致的边界框标注,从而减少冗余的人工输入。
  • 通过仅在跟踪对象周围的感兴趣区域(ROI)上训练 CNN,而非整帧图像,实现局部学习,提升样本效率。
  • 将用户交互建模为“点击”以标注正样本或负样本,每次点击触发模型权重的增量更新。
  • 训练策略对比半在线学习(每点击一次更新一帧)与局部学习及光流增强学习,使用批量大小为 2 和 8。
  • 系统计算每次用户交互的增量训练收益(ITB)以评估有效性,以平均 ITB 作为主要性能指标。
  • 在嵌入式硬件(如 NVIDIA Jetson)上部署自定义训练流水线,实现实时推理与在实时视频处理过程中的增量更新。

实验结果

研究问题

  • RQ1如何利用视频流的时间有序性,以减少在实时目标检测中训练 CNN 所需的人工投入?
  • RQ2基于光流的对象跟踪对每次用户交互的增量训练收益有何影响?
  • RQ3与全帧训练相比,局部学习在训练收益和收敛速度方面表现如何?
  • RQ4在在线增量训练环境中,减小批量大小在多大程度上能提升训练收益?
  • RQ5通过利用视频数据的时间一致性,人机协同系统能否以显著更少的用户交互次数实现高模型准确率?

主要发现

  • 当批量大小为 2 时,与半在线训练相比,ClickBAIT 将平均增量训练收益(ITB)最高提升 8 倍。
  • 在 PersonFinder 场景中,局部学习与光流的结合使所需用户交互次数减少 85%(从 37 次减少到 30 次)。
  • 在 PersonFinder 场景中,平均 ITB 从半在线训练的 1.08×10⁻³ 提升至使用光流和批量大小为 2 时的 7.61×10⁻³。
  • 系统表明,早期训练样本的 ITB 往往较低,说明背景稀疏的图像不如后期更具判别力的帧信息丰富。
  • 在 PersonFinder 场景中,将批量大小从 8 减少到 2,使平均 ITB 提升 100%,表明在结合光流时,较小批量可提升学习效率。
  • 光流跟踪显著减少了达到目标准确率(Af = 0.671)所需的用户交互次数,其训练收益比基线方法高出 5–8 倍。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。