Skip to main content
QUICK REVIEW

[论文解读] Optimizing Through Learned Errors for Accurate Sports Field Registration

Wei Jiang, Juan Camilo Gamboa Higuera|arXiv (Cornell University)|Sep 17, 2019
Video Analysis and Summarization参考文献 48被引用 5
一句话总结

本文提出了一种新颖的两阶段深度学习框架,通过在学习到的误差曲面上进行优化,实现广播视频中体育场地的精确配准。与依赖单阶段前馈推理的方法不同,该方法使用一个独立的网络回归配准误差,并通过基于梯度的优化迭代精炼单应矩阵,即使在训练数据有限的情况下也能实现最先进性能。

ABSTRACT

We propose an optimization-based framework to register sports field templates onto broadcast videos. For accurate registration we go beyond the prevalent feed-forward paradigm. Instead, we propose to train a deep network that regresses the registration error, and then register images by finding the registration parameters that minimize the regressed error. We demonstrate the effectiveness of our method by applying it to real-world sports broadcast videos, outperforming the state of the art. We further apply our method on a synthetic toy example and demonstrate that our method brings significant gains even when the problem is simplified and unlimited training data is available.

研究动机与目标

  • 提升广播视频中体育场地模板配准的准确性,突破单阶段前馈深度学习方法的局限。
  • 解决在增强现实与体育分析中保持高精度的挑战,因为微小的配准误差会降低性能或沉浸感。
  • 探究学习回归误差并结合基于优化的推理是否能超越端到端前馈流水线。
  • 评估该方法在数据稀缺条件下的鲁棒性,这对实际部署至关重要。
  • 通过一个合成的线条拟合简化示例,证明该方法在体育场地之外任务中的泛化能力。

提出的方法

  • 该框架使用两个独立的深度神经网络:一个初始配准网络,从输入图像回归单应矩阵估计值。
  • 第二个网络,即配准误差网络,通过处理输入图像和扭曲后的模板,估计当前单应矩阵的误差。
  • 该方法通过反向传播穿过误差网络计算梯度,对单应矩阵参数进行迭代优化。
  • 两个网络采用解耦训练方式——先训练初始网络,再训练误差网络——以防止误差网络过拟合于初始网络的错误。
  • 通过在单应矩阵参数上进行梯度下降优化,以误差网络的输出作为损失函数进行最小化。
  • 该方法在真实体育广播数据和一个合成的线条拟合任务上进行了验证,以证明其泛化能力和鲁棒性。

实验结果

研究问题

  • RQ1通过在学习到的误差曲面上进行优化,是否能将配准精度提升至超越单阶段前馈网络的水平?
  • RQ2对初始姿态估计器和误差回归器进行解耦训练,是否能带来更好的泛化能力和鲁棒性?
  • RQ3当训练数据极度稀缺(如仅209张图像)时,该方法表现如何?
  • RQ4该框架是否能泛化到体育场地配准之外的其他回归任务?
  • RQ5即使在数据无限的简化合成任务中,基于优化的推理策略是否仍能带来可测量的性能提升?

主要发现

  • 所提方法在真实体育广播视频上实现了最先进性能,优于现有的前馈基线方法。
  • 仅使用209张训练图像,该方法仍实现了卓越的准确性,证明其在数据稀缺条件下的强大泛化能力。
  • 在合成线条拟合任务中,该方法将平均误差从5.1(前馈)降低至3.0,中位数误差从4.4降至1.5,表现出显著改进。
  • 解耦训练策略可防止误差网络过拟合于初始网络的错误,从而提升鲁棒性。
  • 即使在数据无限的简化任务中,基于优化的方法仍优于前馈推理,证明其内在优势。
  • 该方法通过在帧间复用优化状态,实现了视频序列中的时间一致性,如补充结果所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。