Skip to main content
QUICK REVIEW

[论文解读] Knock, knock. Who's there? -- Identifying football player jersey numbers with synthetic data

Divya Bhargavi, Erika Pelaez Coyotl|arXiv (Cornell University)|Mar 1, 2022
Video Analysis and Summarization被引用 4
一句话总结

本文提出一种轻量级、两阶段的方法,用于在低数据量、高度不平衡的数据集上检测足球球衣号码,通过合成数据增强和姿态引导定位实现。通过利用预训练的人体检测模型和人体姿态估计模型来裁剪躯干区域,并在合成数据集(Simple2D 和 Complex2D)上训练轻量级卷积神经网络(CNN),该方法实现了 89% 的准确率,相比基线模型提升了 9%,展示了在极少标注工作量下的最先进性能。

ABSTRACT

Automatic player identification is an essential and complex task in sports video analysis. Different strategies have been devised over the years, but identification based on jersey numbers is one of the most common approaches given its versatility and relative simplicity. However, automatic detection of jersey numbers is still challenging due to changing camera angles, low video resolution, small object size in wide-range shots and transient changes in the player's posture and movement. In this paper we present a novel approach for jersey number identification in a small, highly imbalanced dataset from the Seattle Seahawks practice videos. Our results indicate that simple models can achieve an acceptable performance on the jersey number detection task and that synthetic data can improve the performance dramatically (accuracy increase of ~9% overall, ~18% on low frequency numbers) making our approach achieve state of the art results.

研究动机与目标

  • 解决足球球衣号码检测中低数据量、高度不平衡数据集的挑战。
  • 通过消除对号码位置边界框标注的需求,减少标注负担。
  • 通过合成数据提升模型在低资源环境下的泛化能力和性能。
  • 开发一种可扩展、最小监督的流程,适用于真实世界数据有限的体育视频分析。
  • 证明轻量级模型结合合成预训练可在球衣号码检测中实现最先进结果。

提出的方法

  • 三步流程从预训练的人体检测模型开始,用于在视频帧中定位并裁剪球员。
  • 使用预训练的人体姿态估计模型识别躯干关键点,以定位球衣区域,避免对号码位置进行手动边界框标注。
  • 将裁剪后的躯干图像(平均大小为 20×25px)输入两个轻量级 CNN:一个用于多类别两位数识别,另一个用于多标签逐位检测。
  • 使用两种合成数据生成器——Simple2D(字体和颜色)和 Complex2D(叠加在 COCO 图像上)——来增强训练数据并提高鲁棒性。
  • 模型在合成数据上进行预训练,并在真实世界的西雅图海鹰队训练视频上进行微调,以提升泛化能力。
  • 多类别与多标签模型的集成实现了最终 89% 的准确率。

实验结果

研究问题

  • RQ1合成数据生成是否能显著提升低数据量、不平衡球衣号码检测任务的性能?
  • RQ2姿态估计是否能有效用于在无边界框标注的情况下定位球衣号码?
  • RQ3在合成数据上进行预训练是否能带来可测量的准确率提升,特别是对低频号码?
  • RQ4当结合合成数据与姿态引导裁剪时,轻量级 CNN 是否能实现最先进性能?
  • RQ5在高度不平衡的真实世界体育视频数据集中,合成数据在多大程度上增强了泛化能力?

主要发现

  • 集成模型在测试集上实现了 89% 的准确率,相比仅在真实数据上训练的基线模型提升了 9%。
  • 使用合成数据使低频球衣号码的准确率提升了 18%,表明对罕见类别具有强大的泛化能力。
  • 在 Complex2D 合成数据上进行预训练的模型表现最佳,集成模型准确率达到 83.06%。
  • 该方法在不修改数据采集流程或增加额外硬件传感器的情况下实现了最先进性能。
  • 输入图像的质量和分辨率被证明是关键因素,置信度与输入清晰度直接相关。
  • 数据复制或标准图像增强未带来性能提升,凸显了高质量合成数据相较于简单增强的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。