Skip to main content
QUICK REVIEW

[论文解读] Sports Camera Calibration via Synthetic Data

Jianhui Chen, James J. Little|arXiv (Cornell University)|Oct 25, 2018
Human Pose and Action Recognition参考文献 24被引用 5
一句话总结

本文提出了一种基于合成数据与深度学习的高自动性体育摄像机标定方法。该方法引入了一种新颖的三参数摄像机位姿引擎,用于生成合成边缘图像,训练孪生网络以实现紧凑特征学习,并采用双生成对抗网络(two-GAN)模型实现鲁棒的场地标记检测;该方法在标准足球数据集上达到最先进性能,在排球数据集上实现97.6%的平均交并比(mean IoU)。

ABSTRACT

Calibrating sports cameras is important for autonomous broadcasting and sports analysis. Here we propose a highly automatic method for calibrating sports cameras from a single image using synthetic data. First, we develop a novel camera pose engine. The camera pose engine has only three significant free parameters so that it can effectively generate a lot of camera poses and corresponding edge (i.e, field marking) images. Then, we learn compact deep features via a siamese network from paired edge image and camera pose and build a feature-pose database. After that, we use a novel two-GAN (generative adversarial network) model to detect field markings in real images. Finally, we query an initial camera pose from the feature-pose database and refine camera poses using truncated distance images. We evaluate our method on both synthetic and real data. Our method not only demonstrates the robustness on the synthetic data but also achieves the state-of-the-art accuracy on a standard soccer dataset and very high performance on a volleyball dataset.

研究动机与目标

  • 开发一种完全自动化的体育视频摄像机标定方法,最大限度减少人工干预。
  • 解决在不同摄像机位置和场地标记条件下,从单张图像中估计摄像机位姿的挑战。
  • 利用合成数据与深度学习,提升在不同体育场馆及光照条件下标定的鲁棒性与准确性。
  • 利用体育摄像机部署的空间与角度先验(如靠近中线、倾斜角度有限)简化位姿估计问题。
  • 实现在真实世界数据集上的高精度标定,特别是在场地标记有限或分布不均的场景下。

提出的方法

  • 设计了一种仅包含三个显著自由参数(偏航角、俯仰角、焦距)的新型摄像机位姿引擎,用于生成多样化的摄像机位姿及其对应的合成场地边缘图像。
  • 训练一个孪生深度神经网络,从成对的边缘图像与摄像机位姿中学习紧凑的16维特征,从而实现高效特征-位姿数据库的构建。
  • 引入一种双生成对抗网络(two-GAN)模型:一个生成对抗网络执行场地标记的实例分割,另一个执行类似光流的密集变形(基于Lucas-Kanade方法)以优化检测结果。
  • 通过将学习到的特征映射到对应摄像机位姿,构建特征-位姿数据库,实现在推理阶段的快速最近邻检索。
  • 从数据库中检索初始摄像机位姿,并利用截断距离图像(truncated distance images)进行优化,该图像编码了从检测到的场地标记中提取的几何约束。
  • 采用混合方法:使用合成数据进行训练,通过生成对抗网络在真实图像中进行检测,并通过几何优化提升精度。

实验结果

研究问题

  • RQ1能否仅使用单张图像和合成数据构建高度自动化的摄像机标定系统,且在推理阶段无需人工标注?
  • RQ2如何利用体育摄像机部署的空间与角度先验(如靠近中线、倾斜角度有限)来简化并提升标定精度?
  • RQ3具有紧凑特征(16维)的孪生网络在多大程度上能泛化到真实世界中从边缘图像检索摄像机位姿?
  • RQ4双生成对抗网络架构能否在阴影或部分遮挡等挑战性条件下,有效检测稀疏且不规则的场地标记?
  • RQ5与现有最先进方法相比,该方法在标准与非标准体育数据集上的精度与鲁棒性如何?

主要发现

  • 该方法在标准足球数据集上达到最先进性能,摄像机位姿估计精度优于以往方法。
  • 在排球数据集上,该方法实现97.6%的平均交并比(mean IoU)与98.8%的中位数交并比(median IoU),即使可见标记较少,仍表现出极高水平性能。
  • 双生成对抗网络模型显著提升了场地标记检测性能,消融研究显示,分割生成对抗网络与基于LK的形变模块均对最终精度有贡献。
  • 当场地标记部分被遮挡或分布不均时,该方法仍保持鲁棒性,但严重阴影会降低检测性能,从而影响位姿估计。
  • HOG特征基线方法在精度上表现相当,但其特征维度远高于本方法(1,860D vs. 16D),凸显了所提孪生网络在效率方面的优势。
  • 该方法对不同场馆中摄像机位置的变化具有鲁棒性,因其仅依赖于摄像机位置的粗略先验,而无需精确已知位置,优于依赖精确位置信息的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。