[论文解读] SoccerNet-Tracking: Multiple Object Tracking Dataset and Benchmark in Soccer Videos
本论文介绍了SoccerNet-Tracking,一个大规模多目标跟踪(MOT)数据集,包含200个30秒的视频片段以及一个完整的45分钟中场视频,所有内容均以边界框和轨迹ID对球员、足球和裁判进行了完整标注。该基准测试揭示了在快速运动和严重遮挡情况下的显著挑战,当前最先进MOT方法仍表现不佳,尤其在角球和进球等场景中,凸显了在体育视频分析中改进检测与重识别的迫切需求。
Tracking objects in soccer videos is extremely important to gather both player and team statistics, whether it is to estimate the total distance run, the ball possession or the team formation. Video processing can help automating the extraction of those information, without the need of any invasive sensor, hence applicable to any team on any stadium. Yet, the availability of datasets to train learnable models and benchmarks to evaluate methods on a common testbed is very limited. In this work, we propose a novel dataset for multiple object tracking composed of 200 sequences of 30s each, representative of challenging soccer scenarios, and a complete 45-minutes half-time for long-term tracking. The dataset is fully annotated with bounding boxes and tracklet IDs, enabling the training of MOT baselines in the soccer domain and a full benchmarking of those methods on our segregated challenge sets. Our analysis shows that multiple player, referee and ball tracking in soccer videos is far from being solved, with several improvement required in case of fast motion or in scenarios of severe occlusion.
研究动机与目标
- 解决足球视频中多目标跟踪缺乏大规模、完整标注数据集的问题。
- 实现在不使用侵入式传感器的情况下,自动提取球员和球队统计数据(如跑动距离、控球时间、阵型等)。
- 建立一个基准,用于评估MOT方法在真实且具有挑战性的足球场景(包括遮挡和快速运动)下的表现。
- 识别当前最先进跟踪器在高遮挡和高速事件中的主要失败模式。
- 通过一个完整的45分钟、完全标注的中场视频,推动长期跟踪和鲁棒重识别的研究。
提出的方法
- 该数据集包含从12场比赛中选取的200个短片段(每个30秒),聚焦于11个具有挑战性的足球动作,如进球、角球和任意球。
- 一个完整的45分钟中场视频被密集标注,用于长期跟踪评估,以25 fps的频率提供边界框和轨迹ID。
- 标注内容包括球员、足球和裁判,并赋予轨迹ID,以支持使用标准MOT指标进行跟踪评估。
- 数据集被划分为训练集和评估集,后者被保留用于未来开放挑战,以防止过拟合。
- 在数据集上评估了当前最先进MOT基线方法——FairMOT、ByteTrack和YOLOX,使用标准指标如MOTA、HOTA和AssA。
- 在SoccerNet-Tracking数据上微调预训练检测器,显著提升了检测与关联性能,尤其减少了观众区域引起的误报,并改善了足球检测。
实验结果
研究问题
- RQ1当前最先进的多目标跟踪方法在具有复杂遮挡和快速运动的大规模真实足球视频数据集上的表现如何?
- RQ2现有MOT模型在足球视频中的主要失败模式是什么,特别是在角球、进球和任意球等场景中?
- RQ3与直接使用预训练检测器相比,在SoccerNet-Tracking数据上微调检测器在检测与关联性能上的提升程度如何?
- RQ4不同跟踪场景(如换人、黄牌和庆祝)如何影响MOT模型在检测与关联准确率方面的表现?
- RQ545分钟的中场视频能否作为体育视频分析中长期跟踪的有意义基准?
主要发现
- FairMOT在测试集上取得了最高的MOTA(68.9)和HOTA(62.1)得分,优于ByteTrack和YOLOX,表明其在检测与关联方面表现更优。
- 在SoccerNet-Tracking数据上微调预训练检测器显著提升了检测与关联性能,FairMOT的MOTA从58.7提升至68.9。
- 最困难的跟踪场景是角球和进球,主要由于遮挡严重和球员密集聚集,导致频繁的ID切换和较低的AssA得分。
- 换人和黄牌等场景最容易跟踪,因为其运动量小且遮挡少,因此检测准确率较高。
- 当提供真实标注的检测结果时,挑战性场景(如进球和点球)的性能显著提升,表明瓶颈在于检测而非关联。
- 定性分析表明,当前模型在快速移动物体和密集遮挡场景(尤其是任意球)中表现不佳,凸显了对更好重识别与运动建模的迫切需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。