Skip to main content
QUICK REVIEW

[论文解读] Query-Aware Sparse Coding for Multi-Video Summarization

Zhong Ji, Yaru Ma|arXiv (Cornell University)|Jul 13, 2017
Video Analysis and Summarization参考文献 22被引用 6
一句话总结

本文提出了一种新型无监督多视频摘要方法——查询感知稀疏编码(QUASC),该方法在稀疏编码框架内整合网络搜索图像作为与查询相关的偏好信号,以提升相关性并减少冗余。此外,还引入了一种基于多图融合的事件关键帧展示(EKP)结构,实现用户友好的摘要呈现。该方法在新发布的 MVS1K 数据集上取得了优越的客观与主观性能表现。

ABSTRACT

Given the explosive growth of online videos, it is becoming increasingly important to relieve the tedious work of browsing and managing the video content of interest. Video summarization aims at providing such a technique by transforming one or multiple videos into a compact one. However, conventional multi-video summarization methods often fail to produce satisfying results as they ignore the user's search intent. To this end, this paper proposes a novel query-aware approach by formulating the multi-video summarization in a sparse coding framework, where the web images searched by the query are taken as the important preference information to reveal the query intent. To provide a user-friendly summarization, this paper also develops an event-keyframe presentation structure to present keyframes in groups of specific events related to the query by using an unsupervised multi-graph fusion method. We release a new public dataset named MVS1K, which contains about 1, 000 videos from 10 queries and their video tags, manual annotations, and associated web images. Extensive experiments on MVS1K dataset validate our approaches produce superior objective and subjective results against several recently proposed approaches.

研究动机与目标

  • 解决传统多视频摘要方法无法捕捉用户搜索意图的局限性。
  • 通过在稀疏编码框架中引入用户查询检索的网络图像作为偏好信号,提升摘要质量。
  • 通过利用查询感知特性和稀疏表示,减少关键帧选择中的冗余与无关性。
  • 开发一种基于无监督多图融合的用户友好摘要展示方式,通过语义事件对关键帧进行分组。
  • 发布一个大规模公开基准 MVS1K,用于多视频摘要研究。

提出的方法

  • 将多视频摘要建模为稀疏编码问题,其中候选关键帧和网络图像作为基向量。
  • 采用稀疏编码目标函数,选择最少数量的关键帧以重建视频内容和与查询相关的网络图像。
  • 引入一种查询感知正则化项,优先选择与搜索查询语义意图一致的关键帧。
  • 采用无监督多图融合方法,基于视觉、语义和时间特征将关键帧聚类为与事件相关的组别。
  • 设计一种事件关键帧展示(EKP)结构,将关键帧组织为分层事件簇,以提升可解释性。
  • 利用视频标签和人工标注增强图结构构建,提升事件一致性。

实验结果

研究问题

  • RQ1将网络搜索图像整合进稀疏编码框架是否能提升多视频摘要对用户查询的相关性?
  • RQ2与现有基于学习和基于搜索的摘要方法相比,所提出的 QUASC 方法在冗余性和相关性方面表现如何?
  • RQ3基于事件的关键帧展示(EKP)结构是否相比平铺的关键帧列表更能提升用户理解力与满意度?
  • RQ4该方法在多样化的查询和视频内容上具有多大程度的泛化能力?
  • RQ5多图融合方法在将关键帧聚类为语义一致的事件方面效果如何?

主要发现

  • QUASC 方法在 MVS1K 数据集上取得了 51.3 的最高平均 F1 分数,优于基线方法如聚类方法(46.5)、TVSum(47.3)和 MSR(47.0)。
  • 主观用户研究显示,83.3% 的用户更偏好 QUASC 生成的摘要,其平均满意度得分为 83.3%,高于聚类方法的 81.9% 和 TVSum 的 82.4%。
  • EKP 展示结构显著提升了用户偏好,58.3% 的投票选择事件结构化展示而非平铺的关键帧列表。
  • 所提出的 MVS1K 数据集包含约 1,000 个视频,涵盖 10 个查询,附带网络图像、标签和人工标注,是迄今为止最大的公开多视频摘要基准。
  • 该方法有效减少了语义与视觉冗余,视觉对比显示其生成的关键帧冗余和无关性更少,优于现有方法。
  • 统计分析证实用户偏好在参与者间具有一致性,表明评估结果可靠且无偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。