Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Object-Level Video Summarization with Online Motion Auto-Encoder

Yujia Zhang, Xiaodan Liang|arXiv (Cornell University)|Jan 2, 2018
Video Analysis and Summarization参考文献 7被引用 6
一句话总结

本文提出了一种无监督、在线的运动自编码器(在线运动-AE),用于物体级视频摘要,能够从视频流中识别关键物体运动片段。通过使用堆叠稀疏LSTM自编码器学习时间运动模式,并以重建损失作为摘要得分,该方法在细粒度和帧级视频摘要任务上均取得了当前最优性能,且在新收集和公开的数据集上得到了验证。

ABSTRACT

Unsupervised video summarization plays an important role on digesting, browsing, and searching the ever-growing videos every day, and the underlying fine-grained semantic and motion information (i.e., objects of interest and their key motions) in online videos has been barely touched. In this paper, we investigate a pioneer research direction towards the fine-grained unsupervised object-level video summarization. It can be distinguished from existing pipelines in two aspects: extracting key motions of participated objects, and learning to summarize in an unsupervised and online manner. To achieve this goal, we propose a novel online motion Auto-Encoder (online motion-AE) framework that functions on the super-segmented object motion clips. Comprehensive experiments on a newly-collected surveillance dataset and public datasets have demonstrated the effectiveness of our proposed method.

研究动机与目标

  • 解决缺乏能够同时捕捉代表性物体及其关键运动的细粒度、无监督视频摘要的问题。
  • 实现适用于实时处理不断增长的视频流的在线、可扩展视频摘要。
  • 开发一种方法,联合学习运动特征并无需监督即可识别显著的物体运动片段。
  • 提供一个基准数据集,用于评估监控场景下的物体级视频摘要。

提出的方法

  • 以在线、顺序的方式处理视频序列,基于运动线索通过超分割提取物体运动片段。
  • 应用堆叠稀疏LSTM自编码器,从物体运动片段中学习时间运动表征。
  • 使用自编码器的重建误差作为摘要得分的代理,以识别关键运动片段。
  • 实时持续更新自编码器,通过新片段的输入,模拟在线字典学习,实现对运动模式的动态记忆。
  • 通过将关键物体运动片段聚合为帧级摘要,将方法扩展至帧级摘要。
  • 在输入自编码器前,利用预训练的ResNet152特征提取运动表征。

实验结果

研究问题

  • RQ1无监督、在线方法能否有效识别代表视频中最显著事件的关键物体运动片段?
  • RQ2所提出的在线运动-AE模型在包括监控和动作视频在内的多样化视频领域中,泛化能力如何?
  • RQ3关键物体运动在帧级视频摘要性能中起到了多大程度的贡献?
  • RQ4深度自编码器的重建误差能否作为视频摘要的可靠、自监督信号?

主要发现

  • 所提出的在线运动-AE在SumMe和TVSum数据集上的帧级视频摘要任务中,优于现有的无监督基线方法。
  • 在新收集的OrangeVille监控数据集上,该方法获得了更优的主观评估得分,且15名人类评判者评分一致。
  • 与基线方法相比,该方法在帧级数据集上的性能差距小于细粒度任务,表明物体运动是摘要相关性的重要组成部分。
  • 在用户研究中,该方法表现出强鲁棒性和一致性,人类评估得分的方差低于对比模型。
  • 堆叠稀疏LSTM自编码器能有效捕捉信息丰富的时序运动模式,从而准确识别关键运动片段。
  • 自编码器的重建损失可作为可靠的无监督摘要得分代理,支持端到端无监督训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。