Skip to main content
QUICK REVIEW

[论文解读] Semantic-driven Generation of Hyperlapse from $360^\circ$ Video

Wei‐Sheng Lai, Yujia Huang|arXiv (Cornell University)|Mar 31, 2017
Image and Video Stabilization参考文献 27被引用 9
一句话总结

本论文提出首个基于语义驱动的 $360^\circ$ 视频超时间轴生成系统,通过利用视觉显著性、场景语义和用户定义的对象兴趣,实现空间与时间的非均匀采样。该系统首先稳定输入视频,计算显著性与语义得分,优化平滑相机路径,并应用自适应2D稳定化处理,生成视觉稳定且聚焦注意力的超时间轴,其在用户偏好方面优于当前最先进方法。

ABSTRACT

We present a system for converting a fully panoramic ($360^\circ$) video into a normal field-of-view (NFOV) hyperlapse for an optimal viewing experience. Our system exploits visual saliency and semantics to non-uniformly sample in space and time for generating hyperlapses. In addition, users can optionally choose objects of interest for customizing the hyperlapses. We first stabilize an input $360^\circ$ video by smoothing the rotation between adjacent frames and then compute regions of interest and saliency scores. An initial hyperlapse is generated by optimizing the saliency and motion smoothness followed by the saliency-aware frame selection. We further smooth the result using an efficient 2D video stabilization approach that adaptively selects the motion model to generate the final hyperlapse. We validate the design of our system by showing results for a variety of scenes and comparing against the state-of-the-art method through a user study.

研究动机与目标

  • 为解决观看长时间沉浸式 $360^\circ$ 视频的挑战,自动生成简洁、稳定且视觉上引人入胜的超时间轴。
  • 通过引入视觉显著性和语义分割来指导空间与时间上的相机路径规划,提升观看体验。
  • 通过允许用户选择感兴趣对象,实现个性化超时间轴生成的用户自定义功能。
  • 通过自适应2D视频稳定化(每帧选择运动模型)确保最终超时间轴的视觉平滑性。
  • 通过大规模用户研究对比感知质量和偏好,验证本系统在性能上优于现有方法。

提出的方法

  • 系统首先通过基于四元数的运动估计和带有高斯加权核的球面线性插值(Slerp),平滑帧间旋转过渡,实现对 $360^\circ$ 视频的稳定化处理。
  • 利用光流和运动视差计算空间上的兴趣区域与显著性得分,并通过语义分割识别物体类别。
  • 通过动态规划优化显著性、运动平滑度与时间连贯性的组合,生成初始超时间轴。
  • 系统应用一种鲁棒的2D视频稳定技术,自适应地为每帧选择运动模型(如平移、旋转、仿射变换),以减少最终输出中的抖动。
  • 通过在光流向量上使用霍夫变换估计扩张中心(FOE)与收缩中心(FOC),在未检测到显著区域时提供运动先验。
  • 最终的超时间轴通过沿优化相机路径对稳定后的 $360^\circ$ 视频进行投影映射生成,用户指定的对象在路径规划中享有优先权。

实验结果

研究问题

  • RQ1在空间与时间上采用语义与显著性驱动的采样,是否能提升 $360^\circ$ 视频超时间轴的质量与吸引力?
  • RQ2引入用户定义的兴趣对象后,生成的超时间轴在感知质量与个人相关性方面有何影响?
  • RQ3自适应2D稳定化是否能显著减少 $360^\circ$ 超时间轴中的视觉抖动,同时保持运动平滑性?
  • RQ4与现有最先进方法(如 Pano2Vid)相比,本系统在用户偏好与感知质量方面表现如何?
  • RQ5语义分割与显著性估计对最终超时间轴的稳定性与注意力聚焦有何影响?

主要发现

  • 在大规模用户研究中,本系统生成的超时间轴显著优于当前最先进方法,多数参与者在视觉质量和吸引力方面给予更高评分。
  • 语义分割与显著性得分的整合使相机路径更具连贯性与注意力聚焦性,尤其在存在移动物体的复杂场景中表现更优。
  • 自适应2D稳定化方法有效减少了视觉抖动,即使原始 $360^\circ$ 视频存在明显抖动,生成的超时间轴依然平滑。
  • 系统能有效处理多样化场景,包括动态城市环境与静态全景画面,展现出在不同类型内容下的鲁棒性。
  • 通过兴趣对象选择实现的用户自定义功能,显著提升了超时间轴的个性化与用户满意度,研究中的用户反馈已验证此结论。
  • 本系统是首个真正从 $360^\circ$ 视频生成超时间轴(短于输入时长)的系统,而 Pano2Vid 仅生成全时长的NFOV序列。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。