Skip to main content
QUICK REVIEW

[论文解读] Deep 360 Pilot: Learning a Deep Agent for Piloting through 360° Sports Video

Hou-Ning Hu, Yen-Chen Lin|arXiv (Cornell University)|May 4, 2017
Video Analysis and Summarization参考文献 52被引用 13
一句话总结

本文提出 Deep 360 Pilot,一种深度强化学习智能体,可实时预测最优观看角度,自动导航 360° 体育视频。通过使用最先进目标检测器识别感兴趣的目标候选对象,并利用 RNN 选择主要目标,该智能体采用策略梯度训练回归平滑的视角移动,相较于 AUTOCAM 等先前方法,在准确性和用户偏好方面表现更优。

ABSTRACT

Watching a 360° sports video requires a viewer to continuously select a viewing angle, either through a sequence of mouse clicks or head movements. To relieve the viewer from this "360 piloting" task, we propose "deep 360 pilot" -- a deep learning-based agent for piloting through 360° sports videos automatically. At each frame, the agent observes a panoramic image and has the knowledge of previously selected viewing angles. The task of the agent is to shift the current viewing angle (i.e. action) to the next preferred one (i.e., goal). We propose to directly learn an online policy of the agent from data. We use the policy gradient technique to jointly train our pipeline: by minimizing (1) a regression loss measuring the distance between the selected and ground truth viewing angles, (2) a smoothness loss encouraging smooth transition in viewing angle, and (3) maximizing an expected reward of focusing on a foreground object. To evaluate our method, we build a new 360-Sports video dataset consisting of five sports domains. We train domain-specific agents and achieve the best performance on viewing angle selection accuracy and transition smoothness compared to [51] and other baselines.

研究动机与目标

  • 为解决在快节奏体育内容播放过程中,用户需不断手动调整视场范围所带来的负担。
  • 开发一种在线、实时的智能体,通过选择显著目标并平滑过渡视角,模仿人类操控行为。
  • 减少在 360° 视频播放中因画面抖动或突兀切换造成的用户不适。
  • 训练一种领域特定的智能体,基于视觉显著性和时间上下文选择观看角度,从而同时提升准确性和感知质量。

提出的方法

  • 使用最先进目标检测器在每个全景帧中检测感兴趣的目标候选对象,以边界框表示。
  • 通过循环神经网络(RNN)基于空间和时间上下文从候选检测结果中选择主要目标。
  • 智能体通过可微分回归头,基于当前视角回归视角移动量,并使用策略梯度进行训练。
  • 训练目标结合三个部分:预测视角与真实视角之间的回归损失、减少抖动的平滑性损失,以及鼓励聚焦前景目标的奖励信号。
  • 整个流程通过策略梯度方法联合优化,以平衡准确性、平滑性和显著性。
  • 该方法在线运行,仅依赖当前和历史帧,适用于如视锥渲染等流媒体应用。

实验结果

研究问题

  • RQ1深度强化学习智能体能否学会在 360° 体育视频中自动选择最优观看角度,模仿人类操控行为?
  • RQ2智能体如何在目标显著性定位的准确性与视角切换的平滑性之间取得平衡,以提升用户舒适度?
  • RQ3通过 RNN 引入时间上下文后,与逐帧基线方法相比,视角预测性能提升程度如何?
  • RQ4与现有方法(如 AUTOCAM)相比,所提方法在定量指标和用户偏好方面表现如何?
  • RQ5该智能体能否在真实世界 360° 体育视频序列中实现与人工标注视角相当的性能?

主要发现

  • 在 BMX 领域,该方法相较 AUTOCAM 实现了 22% 的相对 MO(平均目标重叠)提升,且在舞蹈领域至少提升了 3%。
  • 在用户偏好测试中,该方法显著优于 AUTOCAM,二项检验 p 值 < 0.001,表明具有强统计优越性。
  • 与无回归头的消融变体相比,该方法在统计上更优(p < 0.05),表明即使目标追踪准确性相近,平滑性仍能显著改善用户感知。
  • 在用户研究中,该方法在滑板(p < 0.405)和舞蹈(p < 0.242)任务中与人工标注的真值无显著差异,表明其具有极高的感知质量。
  • 与 AUTOCAM 相比,该方法生成的视角轨迹更平滑,轨迹对比图中可直观确认,抖动更少,突变更少。
  • 在公开可用视频的一个子集上,该方法相较基线 [53] 的定量指标性能提升了 140%,证明了其强大的泛化能力和可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。