Skip to main content
QUICK REVIEW

[论文解读] Efficient Golf Ball Detection and Tracking Based on Convolutional Neural Networks and Kalman Filter

Tianxiao Zhang, Xiaohan Zhang|arXiv (Cornell University)|Dec 17, 2020
Video Analysis and Summarization参考文献 42被引用 10
一句话总结

本文提出了一种基于 YOLOv3、YOLOv4、Faster R-CNN、SSD 和 RefineDet 的实时高尔夫球检测与跟踪系统,用于在裁剪图像块上进行目标检测,并结合卡尔曼滤波器进行运动预测。该方法在准确率和速度方面表现优异,其中 Faster R-CNN 在 IOU 为 0.25 时实现了最佳跟踪性能(mAP 46.78%),而 YOLOv3 tiny 则提供了最快的推理速度。

ABSTRACT

This paper focuses on the problem of online golf ball detection and tracking from image sequences. An efficient real-time approach is proposed by exploiting convolutional neural networks (CNN) based object detection and a Kalman filter based prediction. Five classical deep learning-based object detection networks are implemented and evaluated for ball detection, including YOLO v3 and its tiny version, YOLO v4, Faster R-CNN, SSD, and RefineDet. The detection is performed on small image patches instead of the entire image to increase the performance of small ball detection. At the tracking stage, a discrete Kalman filter is employed to predict the location of the ball and a small image patch is cropped based on the prediction. Then, the object detector is utilized to refine the location of the ball and update the parameters of Kalman filter. In order to train the detection models and test the tracking algorithm, a collection of golf ball dataset is created and annotated. Extensive comparative experiments are performed to demonstrate the effectiveness and superior tracking performance of the proposed scheme.

研究动机与目标

  • 解决在视频序列中实时检测和跟踪小尺寸、高速运动的高尔夫球的挑战。
  • 克服传统计算机视觉和目标跟踪方法因球体尺寸过小和运动模糊而失效的局限性。
  • 通过使用小尺寸图像块而非全分辨率图像帧,提高对极小目标的检测准确率。
  • 构建一个包含精确标注的自定义高尔夫球数据集,用于训练和评估检测模型。
  • 集成卡尔曼滤波器以预测球体运动,在动态条件下降低检测延迟和误差。

提出的方法

  • 在小尺寸裁剪图像块上应用多种最先进的基于卷积神经网络的目标检测器(YOLOv3、YOLOv4、Faster R-CNN、SSD、RefineDet),以增强对极小高尔夫球的检测能力。
  • 使用离散卡尔曼滤波器基于先前状态预测高尔夫球的下一个位置,从而实现高效感兴趣区域裁剪。
  • 在卡尔曼滤波器预测位置周围裁剪一个小图像块,以减少计算负载并提高检测准确率。
  • 利用目标检测器精修检测到的球体位置,并迭代更新卡尔曼滤波器参数,以实现鲁棒跟踪。
  • 在 Faster R-CNN 中自定义锚框尺度(8, 16, 32),以更好地匹配数据集中高尔夫球的小尺寸。
  • 在新创建的、带有标注的高尔夫球数据集上训练并评估模型,该数据集包含挥杆和推杆序列。

实验结果

研究问题

  • RQ1基于卷积神经网络的目标检测器在视频序列中检测小尺寸、高速运动的高尔夫球时,能否实现高准确率和实时性能?
  • RQ2与全帧检测相比,使用基于卡尔曼滤波器预测中心的图像块是否能显著提升检测准确率?
  • RQ3不同最先进的目标检测器(如 YOLOv3、Faster R-CNN、SSD)在高尔夫球跟踪任务中的速度、精度和成功率方面表现如何比较?
  • RQ4标注误差在多大程度上影响小尺寸目标(如高尔夫球)的 mAP 评估?IOU 阈值的选择如何影响性能表现?
  • RQ5基于卡尔曼滤波器的跟踪框架是否能显著提升对极小尺寸、高动态目标的鲁棒性和效率?

主要发现

  • Faster R-CNN 在 IOU 为 0.25 时实现了最高的平均精度(mAP 46.78%),在跟踪准确率方面优于其他模型。
  • YOLOv3 tiny 在保持良好准确率的同时提供了最快的推理速度,因此特别适合实时应用。
  • 当使用小图像块而非全分辨率图像时,检测性能显著提升,原因是球体在裁剪区域中显得更大。
  • 所提方法即使在高尔夫球缩小至 6×6 像素时,仍能实现稳定且准确的跟踪,而传统方法通常在此情况下失效。
  • 标注误差对 IOU 评估有显著影响——尤其当球体较小时(例如 1 像素误差在 6×6 尺寸下可导致高达 33% 的 IOU 下降),这解释了为何采用 IOU 0.25 作为 mAP 评估阈值是合理的。
  • 自建的高尔夫球数据集包含 10 个序列(6 个挥杆,4 个推杆),有效支持了模型的训练与评估,且在不同运动模式下均表现出一致的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。