Skip to main content
QUICK REVIEW

[论文解读] Self-Learning for Player Localization in Sports Video

Kenji Okuma, David Lowe|arXiv (Cornell University)|Jul 27, 2013
Human Pose and Action Recognition参考文献 2被引用 10
一句话总结

本文提出一种自学习框架,通过利用外观、运动和场地颜色线索,在体育视频中自动发现额外的球员标签,仅需极少的初始标注即可显著提升检测性能。通过迭代使用高置信度的误检样本和场地分割区域对可变形部件模型进行再训练,该方法即使仅使用五张标注图像,也能使平均精度提升超过20%。

ABSTRACT

This paper introduces a novel self-learning framework that automates the label acquisition process for improving models for detecting players in broadcast footage of sports games. Unlike most previous self-learning approaches for improving appearance-based object detectors from videos, we allow an unknown, unconstrained number of target objects in a more generalized video sequence with non-static camera views. Our self-learning approach uses a latent SVM learning algorithm and deformable part models to represent the shape and colour information of players, constraining their motions, and learns the colour of the playing field by a gentle Adaboost algorithm. We combine those image cues and discover additional labels automatically from unlabelled data. In our experiments, our approach exploits both labelled and unlabelled data in sparsely labelled videos of sports games, providing a mean performance improvement of over 20% in the average precision for detecting sports players and improved tracking, when videos contain very few labelled images.

研究动机与目标

  • 通过自动化标签获取来降低体育视频目标检测中的高成本人工标注。
  • 在摄像机非静态且球员数量未知的转播视频中,提升球员检测性能。
  • 开发一种自学习框架,同时利用已标注和未标注数据,无需人工重新标注。
  • 通过利用运动约束和比赛场地分割,实现完全自动化的标签发现,减少对人工标注数据的依赖。

提出的方法

  • 该框架使用带有潜在SVM的可变形部件模型(DPM)来表示球员的形状和颜色,并结合运动约束以指导标签发现。
  • 采用一种温和的Adaboost算法来学习比赛场地的颜色,有助于消除候选检测中的误报。
  • 一种数据选择算法识别出最具信息量的未标注帧——即最自信和最不自信的检测结果——用于迭代模型再训练。
  • 系统通过使用新发现的标签迭代再训练检测器,随着时间推移逐步提高检测置信度和定位精度。
  • 利用帧间运动的一致性来验证候选检测结果,尤其针对最初被检测器遗漏的球员。
  • 基于球员尺度的均值和标准差设置大小先验,以限制计算搜索空间并加快推理速度。

实验结果

研究问题

  • RQ1当仅有少量标注帧可用时,自学习框架能否从无标注体育视频数据中自动发现有用的标签?
  • RQ2运动约束和场地颜色分割在非静态摄像机拍摄的视频中,如何提升自动生成标签的可靠性?
  • RQ3在训练数据极度稀疏的情况下,自学习能在多大程度上提升球员检测性能?
  • RQ4该方法能否泛化到每帧中球员数量未知且无约束的视频中?

主要发现

  • 即使仅使用五张标注图像进行初始训练,该方法在体育视频数据集上的球员检测平均精度仍提升了超过20%。
  • 在四轮自学习迭代后,曲棍球视频序列中的平均精度从0.55提升至0.67,显示出持续改进。
  • 通过利用运动一致性和场地分割,系统成功发现并修正了误检样本——尤其在复杂场景中表现显著。
  • 场地颜色分割的使用显著减少了误报检测,提升了自动生成标签的可靠性。
  • 该框架在曲棍球和篮球视频中均表现出稳健性能,得益于更优的检测输入,跟踪结果也得到改善。
  • 在计算方面,系统在8核机器上耗时约4天CPU时间,其中超过80%的时间用于检测推理和模型再训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。