Skip to main content
QUICK REVIEW

[论文解读] Co-Regularized Deep Representations for Video Summarization

Olivier Morère, Hanlin Goh|arXiv (Cornell University)|Jan 30, 2015
Video Analysis and Summarization参考文献 21被引用 5
一句话总结

本文提出了一种协同正则化的深度学习框架,结合了深度卷积神经网络(DCNNs)与受限玻尔兹曼机(RBMs),以生成紧凑、信息丰富且视觉上吸引人的基于关键帧的视频摘要。通过协同正则化的RBMs联合学习主体-场景关联,该方法在用户研究中优于均匀采样、k-means聚类以及Dailymotion的生产算法,尤其在小规模摘要(K=4–8)中表现更优,吸引力偏好度高达97.73%,信息量偏好度达94.32%。

ABSTRACT

Compact keyframe-based video summaries are a popular way of generating viewership on video sharing platforms. Yet, creating relevant and compelling summaries for arbitrarily long videos with a small number of keyframes is a challenging task. We propose a comprehensive keyframe-based summarization framework combining deep convolutional neural networks and restricted Boltzmann machines. An original co-regularization scheme is used to discover meaningful subject-scene associations. The resulting multimodal representations are then used to select highly-relevant keyframes. A comprehensive user study is conducted comparing our proposed method to a variety of schemes, including the summarization currently in use by one of the most popular video sharing websites. The results show that our method consistently outperforms the baseline schemes for any given amount of keyframes both in terms of attractiveness and informativeness. The lead is even more significant for smaller summaries.

研究动机与目标

  • 解决为长视频生成紧凑、多样化且具有代表性的基于关键帧的视频摘要的挑战。
  • 通过利用多模态深度表征学习高层主体-场景关联,提升视频摘要质量。
  • 开发一种协同正则化方案,增强视频帧中主体与场景之间联合表征的学习。
  • 通过全面的用户研究,将该方法与真实世界基线(包括Dailymotion的生产算法)进行实证对比评估。
  • 证明所提出方法在小关键帧数量下,生成的摘要比现有方法更具吸引力和信息量。

提出的方法

  • 该方法使用两个预训练的DCNN——VGG-ILSVRC-2014-D用于主体识别,Places-CNN用于场景识别——以1 fps的间隔从视频帧中提取深度描述符。
  • 并行训练一对受限玻尔兹曼机(RBMs):一个用于主体,一个用于场景,通过协同正则化强制对齐主体与场景表征。
  • 协同正则化通过惩罚主体RBMs与场景RBMs之间隐藏单元激活的偏差,促使模型学习有意义的主体-场景关联。
  • 帧级描述符被生成为两个协同正则化RBMs输出的线性组合,形成紧凑的多模态表征。
  • 关键帧根据其与学习到的联合表征的接近程度进行选择,确保多样性与相关性。
  • 通过用户研究对框架进行评估,将该方法与均匀采样、k-means聚类以及Dailymotion的生产算法在11集《行星地球》视频中进行对比。

实验结果

研究问题

  • RQ1协同正则化的RBMs能否有效学习联合主体-场景表征,从而改善视频摘要中的关键帧选择?
  • RQ2与均匀采样和k-means聚类相比,该方法在用户感知的摘要吸引力和信息量方面表现如何?
  • RQ3该方法是否在生成紧凑视频摘要方面优于Dailymotion当前使用的生产算法?
  • RQ4该方法的性能提升是否在较小的关键帧数量(如K=4)下更为显著?
  • RQ5所学习的主体-场景关联在多大程度上提升了视频摘要的可解释性与质量?

主要发现

  • 在所有关键帧数量(K=4,6,8)下,该方法在吸引力方面相对于均匀采样和k-means的偏好率分别为79.55%至97.73%。
  • 在信息量方面,该方法相对于相同基线的偏好率为78.41%至94.32%,且在K=4时提升最为显著。
  • 与Dailymotion的生产算法相比,该方法在吸引力方面获得77.27%的偏好率,在信息量方面为78.41%,表明有显著改进。
  • 协同正则化方案成功学习到了有意义的主体-场景关联,包括主体(如北极熊与王企鹅)在同一场景(如冰山)中出现但不在同一帧中的情况。
  • 该方法表现出持续的优越性,尤其在紧凑摘要中,表明其在最小化冗余的同时最大化视觉与语义多样性方面具有有效性。
  • 用户对吸引力与信息量的感知高度相关,表明视觉上引人注目的摘要也更具信息量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。