[论文解读] Unsupervised Object-Level Video Summarization with Online Motion Auto-Encoder
本文提出了一种无监督、在线的运动自编码器(在线运动-AE),用于物体级视频摘要,能够从视频流中识别关键物体运动片段。通过使用堆叠稀疏LSTM自编码器学习时间运动模式,并以重建损失作为摘要得分,该方法在细粒度和帧级视频摘要任务上均取得了当前最优性能,且在新收集和公开的数据集上得到了验证。
Unsupervised video summarization plays an important role on digesting, browsing, and searching the ever-growing videos every day, and the underlying fine-grained semantic and motion information (i.e., objects of interest and their key motions) in online videos has been barely touched. In this paper, we investigate a pioneer research direction towards the fine-grained unsupervised object-level video summarization. It can be distinguished from existing pipelines in two aspects: extracting key motions of participated objects, and learning to summarize in an unsupervised and online manner. To achieve this goal, we propose a novel online motion Auto-Encoder (online motion-AE) framework that functions on the super-segmented object motion clips. Comprehensive experiments on a newly-collected surveillance dataset and public datasets have demonstrated the effectiveness of our proposed method.
研究动机与目标
- 解决缺乏能够同时捕捉代表性物体及其关键运动的细粒度、无监督视频摘要的问题。
- 实现适用于实时处理不断增长的视频流的在线、可扩展视频摘要。
- 开发一种方法,联合学习运动特征并无需监督即可识别显著的物体运动片段。
- 提供一个基准数据集,用于评估监控场景下的物体级视频摘要。
提出的方法
- 以在线、顺序的方式处理视频序列,基于运动线索通过超分割提取物体运动片段。
- 应用堆叠稀疏LSTM自编码器,从物体运动片段中学习时间运动表征。
- 使用自编码器的重建误差作为摘要得分的代理,以识别关键运动片段。
- 实时持续更新自编码器,通过新片段的输入,模拟在线字典学习,实现对运动模式的动态记忆。
- 通过将关键物体运动片段聚合为帧级摘要,将方法扩展至帧级摘要。
- 在输入自编码器前,利用预训练的ResNet152特征提取运动表征。
实验结果
研究问题
- RQ1无监督、在线方法能否有效识别代表视频中最显著事件的关键物体运动片段?
- RQ2所提出的在线运动-AE模型在包括监控和动作视频在内的多样化视频领域中,泛化能力如何?
- RQ3关键物体运动在帧级视频摘要性能中起到了多大程度的贡献?
- RQ4深度自编码器的重建误差能否作为视频摘要的可靠、自监督信号?
主要发现
- 所提出的在线运动-AE在SumMe和TVSum数据集上的帧级视频摘要任务中,优于现有的无监督基线方法。
- 在新收集的OrangeVille监控数据集上,该方法获得了更优的主观评估得分,且15名人类评判者评分一致。
- 与基线方法相比,该方法在帧级数据集上的性能差距小于细粒度任务,表明物体运动是摘要相关性的重要组成部分。
- 在用户研究中,该方法表现出强鲁棒性和一致性,人类评估得分的方差低于对比模型。
- 堆叠稀疏LSTM自编码器能有效捕捉信息丰富的时序运动模式,从而准确识别关键运动片段。
- 自编码器的重建损失可作为可靠的无监督摘要得分代理,支持端到端无监督训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。