Skip to main content
QUICK REVIEW

[论文解读] Adaptive Video Highlight Detection by Learning from User History

Mrigank Rochan, Mahesh Kumar Krishna Reddy|arXiv (Cornell University)|Jul 19, 2020
Video Analysis and Summarization参考文献 54被引用 4
一句话总结

本文提出 Adaptive-H-FCSN,一种用户自适应的视频精彩片段检测框架,通过利用用户先前创建的精彩GIF片段历史记录来个性化精彩片段预测。通过引入一种时间自适应实例归一化(T-AIN)层,该层基于编码的用户历史动态调节精彩片段检测网络,该模型在大规模数据集上显著提升了准确率与个性化程度,优于通用模型及先前的自适应模型。

ABSTRACT

Recently, there is an increasing interest in highlight detection research where the goal is to create a short duration video from a longer video by extracting its interesting moments. However, most existing methods ignore the fact that the definition of video highlight is highly subjective. Different users may have different preferences of highlight for the same input video. In this paper, we propose a simple yet effective framework that learns to adapt highlight detection to a user by exploiting the user's history in the form of highlights that the user has previously created. Our framework consists of two sub-networks: a fully temporal convolutional highlight detection network $H$ that predicts highlight for an input video and a history encoder network $M$ for user history. We introduce a newly designed temporal-adaptive instance normalization (T-AIN) layer to $H$ where the two sub-networks interact with each other. T-AIN has affine parameters that are predicted from $M$ based on the user history and is responsible for the user-adaptive signal to $H$. Extensive experiments on a large-scale dataset show that our framework can make more accurate and user-specific highlight predictions.

研究动机与目标

  • 为解决视频精彩片段的主观性问题,将检测个性化为个体用户的偏好。
  • 克服通用精彩片段检测模型忽略用户特定兴趣的局限性。
  • 开发一种有效利用视觉用户历史(先前创建的GIF精彩片段)进行自适应预测的方法。
  • 设计一种计算效率高的框架,可处理完整视频,无需依赖镜头边界检测。
  • 证明所学习的精彩片段检测模型在小规模数据集上的视频摘要任务中具有可迁移性。

提出的方法

  • 该框架由两个子网络组成:一个全时序卷积精彩片段检测网络(H)和一个处理用户历史的的历史编码网络(M)。
  • 在H中引入一种新颖的时间自适应实例归一化(T-AIN)层,其中仿射参数(γ 和 δ)基于用户历史由M预测得出。
  • T-AIN层通过使用历史编码嵌入调节特征归一化,实现对精彩片段检测网络的用户特定自适应。
  • 模型使用大规模用户创建的精彩GIF数据集进行端到端训练,避免了对预计算镜头边界的需求。
  • 历史编码器M处理用户历史中的多个精彩GIF片段,并生成紧凑表示,用于调节H中的T-AIN层。
  • 该框架避免了片段级采样,而是直接处理完整视频,从而保留了长距离时间依赖性。

实验结果

研究问题

  • RQ1以用户先前创建的精彩GIF形式存在的用户历史,是否能提升视频精彩片段检测的准确率与个性化程度?
  • RQ2所提出的T-AIN层与用户历史和视频特征的直接拼接或早期融合相比,在建模用户偏好方面表现如何?
  • RQ3该模型对用户历史的大小有多敏感?随着历史片段数量的增加,性能是否持续提升?
  • RQ4在大规模用户创建精彩片段数据集上预训练的精彩片段检测模型,能否在小规模数据集的视频摘要任务中有效泛化?
  • RQ5与现有的基于排序或片段级方法相比,该方法在用户特定准确率和计算效率方面是否表现更优?

主要发现

  • Adaptive-H-FCSN 在 PHD-GIFs 数据集上达到 16.73% 的 F-score,显著优于通用 H-FCSN(15.04%)和 H-FCSN-aggregate(15.73%)模型。
  • 即使用户历史中仅有一段精彩片段,Adaptive-H-FCSN 仍优于通用 H-FCSN,证明了在极小数据量下用户历史的有效性。
  • 随着历史大小的增加,Adaptive-H-FCSN 的性能稳步提升,当使用完整历史时达到 16.73% 的 F-score,表明其在更多用户数据下具有强大可扩展性。
  • 该模型在 SumMe 视频摘要数据集上达到 44.4% 的 F-score,无需任何微调,优于需要在 SumMe 上进行训练的监督方法,表现处于最先进水平。
  • 消融实验证实,T-AIN 优于直接特征融合及其他归一化策略,验证了其在用户自适应学习中的设计优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。