Skip to main content
QUICK REVIEW

[论文解读] A Deep Ranking Model for Spatio-Temporal Highlight Detection from a 360 Video

Youngjae Yu, Sang-Ho Lee|arXiv (Cornell University)|Jan 31, 2018
Video Analysis and Summarization参考文献 26被引用 7
一句话总结

本文提出一种深度排序模型——组合视图评分(Composition View Score, CVS),用于在360°视频中进行时空亮点检测。该方法通过生成球面构图评分图来识别最优正常视场(NFOV)片段,并选择排名靠前的子片段以实现时间总结。该方法的推理速度比AutoCam快16倍,并在定量指标和用户研究中均优于当前最先进方法。

ABSTRACT

We address the problem of highlight detection from a 360 degree video by summarizing it both spatially and temporally. Given a long 360 degree video, we spatially select pleasantly-looking normal field-of-view (NFOV) segments from unlimited field of views (FOV) of the 360 degree video, and temporally summarize it into a concise and informative highlight as a selected subset of subshots. We propose a novel deep ranking model named as Composition View Score (CVS) model, which produces a spherical score map of composition per video segment, and determines which view is suitable for highlight via a sliding window kernel at inference. To evaluate the proposed framework, we perform experiments on the Pano2Vid benchmark dataset and our newly collected 360 degree video highlight dataset from YouTube and Vimeo. Through evaluation using both quantitative summarization metrics and user studies via Amazon Mechanical Turk, we demonstrate that our approach outperforms several state-of-the-art highlight detection methods. We also show that our model is 16 times faster at inference than AutoCam, which is one of the first summarization algorithms of 360 degree videos

研究动机与目标

  • 解决长时360°视频在空间上(选择最优NFOV视角)和时间上(生成简洁亮点)总结的挑战。
  • 克服现有方法仅关注空间总结或因冗余视角评分导致高推理复杂度的局限。
  • 开发一种深度学习模型,通过对比同一360°视频内容中专业、非专业及随机NFOV视角的排序,学习视觉构图质量。
  • 通过为每个视频片段生成完整的球面评分图,减少重叠视角间的冗余计算,实现实现高效推理。
  • 在Pano2Vid基准和从YouTube与Vimeo新收集的360°亮点数据集上评估该框架。

提出的方法

  • 提出一种全卷积神经网络的深度排序模型——组合视图评分(CVS)模型,为每个360°视频片段生成表示各视角构图质量的球面评分图。
  • 使用三元组排序损失训练CVS模型,通过比较专业NFOV镜头(正样本)、非专业NFOV镜头(正样本)和随机采样的NFOV镜头(负样本),学习按构图保真度对视角进行排序。
  • 采用高斯位置池化方法聚合球面上各处的空间评分,实现高效滑动窗口推理以进行视角选择。
  • 通过在球面评分图上使用滑动窗口核,为每个视频片段选择得分最高的NFOV视角,完成空间总结。
  • 通过在整段视频中选择排名前N的NFOV子片段,完成时间总结,作为最终亮点输出。
  • CVS-Fusion变体通过融合空间与时间特征,增强了对动态事件(如跳舞或亲吻时刻)的检测能力。

实验结果

研究问题

  • RQ1通过对比专业、非专业及随机NFOV视角,深度排序模型能否有效学习360°视频中的视觉构图质量?
  • RQ2与现有方法中逐视角评分相比,为每个视频片段生成球面评分图是否能显著降低推理时间?
  • RQ3三元组排序损失相较于成对排序损失,在多大程度上提升了亮点检测性能?
  • RQ4与当前最先进基线相比,该方法在从YouTube和Vimeo收集的真实世界360°视频上泛化能力如何?
  • RQ5用户研究是否能证实,所检测到的亮点比现有方法更具信息量且更具吸引力?

主要发现

  • CVS-Fusion模型在新构建的360°视频亮点数据集上取得了最高的mAP,优于RankNet、TS-DCNN及基于成对损失的变体。
  • 与成对损失基线相比,三元组排序损失在Wedding和MV数据集上分别将mAP提升了5.98和4.73个百分点。
  • 通过Amazon Mechanical Turk进行的用户研究显示,72.5%的标注者更偏好CVS-Fusion模型生成的亮点,而非RankNet和TS-DCNN的结果。
  • CVS模型的推理速度比AutoCam快16倍,显著降低了由冗余视角评分带来的计算开销。
  • 定性分析表明,高构图评分始终被分配给构图良好、主体突出且包含动态事件(如跳舞或亲吻)的视角。
  • 球面评分图能有效突出显著内容(如人物、动作中心),同时为无信息区域(如天空或空旷背景)分配低分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。