Skip to main content
QUICK REVIEW

[论文解读] Making 360$^{\circ}$ Video Watchable in 2D: Learning Videography for Click Free Viewing

Yu-Chuan Su, Kristen Grauman|arXiv (Cornell University)|Mar 1, 2017
Advanced Vision and Imaging参考文献 32被引用 10
一句话总结

本文提出了一种基于学习的虚拟电影制作系统,通过控制相机位姿和视场角(FOV),自动从360°视频生成可观看的2D视频,采用粗到精的优化策略,实现高效、多样且类人的相机轨迹。该方法相比基线模型将视频质量提升最高达43.4%,计算成本相比先前工作降低84%。

ABSTRACT

360$^{\circ}$ video requires human viewers to actively control "where" to look while watching the video. Although it provides a more immersive experience of the visual content, it also introduces additional burden for viewers; awkward interfaces to navigate the video lead to suboptimal viewing experiences. Virtual cinematography is an appealing direction to remedy these problems, but conventional methods are limited to virtual environments or rely on hand-crafted heuristics. We propose a new algorithm for virtual cinematography that automatically controls a virtual camera within a 360$^{\circ}$ video. Compared to the state of the art, our algorithm allows more general camera control, avoids redundant outputs, and extracts its output videos substantially more efficiently. Experimental results on over 7 hours of real "in the wild" video show that our generalized camera control is crucial for viewing 360$^{\circ}$ video, while the proposed efficient algorithm is essential for making the generalized control computationally tractable.

研究动机与目标

  • 为解决被动式360°视频观看的问题,即用户需手动导航内容,导致体验不佳。
  • 通过支持动态视场角(FOV)控制(包括变焦)来推广Pano2Vid任务,以更好地模拟人类视频拍摄。
  • 开发一种计算高效的算法,使其可扩展至真实世界的360°视频,同时保持高质量输出。
  • 生成多样、多模态的相机轨迹,避免冗余,并反映多种合理的类人剪辑选择。

提出的方法

  • 该方法提出了一种广义化的Pano2Vid问题,同时控制相机位姿与可变FOV,支持变焦以增强真实感。
  • 采用粗到精的搜索策略,通过逐步缩小搜索空间来迭代优化相机轨迹,从而降低计算量。
  • 在人类编辑的视频上训练可微分的“捕获价值”模型,以预测哪些视频片段最适合作为相机构图。
  • 通过动态规划结合多样性促进目标,实现多样化的轨迹搜索,避免输出冗余。
  • 使用时空瞥见(ST-glimpses)来表示随时间和空间变化的候选相机视角,实现高效处理。
  • 算法同时优化轨迹平滑性与与人类编辑视频的可区分性,平衡自然运动与内容相关性。

实验结果

研究问题

  • RQ1动态视场角控制(包括变焦)是否能显著提升从360°视频自动生成的2D视频质量?
  • RQ2如何设计一种计算高效的算法,以应对360°视频相机控制的高维搜索空间?
  • RQ3基于学习的方法能否生成多样、非冗余的相机轨迹,以反映人类视频制作的多模态特性?
  • RQ4与手工设计的启发式方法及基于显著性的基线相比,所提方法在感知质量与计算成本方面表现如何?

主要发现

  • 所提方法在人类评估中,与人类编辑视频的可区分性方面,相比现有基线最高提升43.4%。
  • 粗到精优化将运行时间相比未优化版本降低84%,使该方法在真实360°视频处理中具备实用性。
  • 与非多样性变体相比,该方法生成的独立相机轨迹多出2至3倍,显著优于基于显著性的基线在输出多样性方面的表现。
  • 该系统与人类编辑视频的轨迹重叠度高于所有基线(包括AutoCam),表明其更符合人类剪辑偏好。
  • 在除“人类到自动转移能力”外的所有指标上,该方法均优于基于显著性的方法,表明显著性是视频质量的弱代理。
  • 平滑性约束在快速运动场景中偶尔会限制响应速度,且模型未能完全捕捉上下文感知偏好(如聚焦于家庭成员)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。