Skip to main content
QUICK REVIEW

[论文解读] Learning Trailer Moments in Full-Length Movies

Lezi Wang, Dong Liu|arXiv (Cornell University)|Aug 19, 2020
Video Analysis and Summarization参考文献 40被引用 6
一句话总结

本文提出CCANet,一种弱监督模型,利用官方预告片作为弱监督信号,检测长时电影中的预告片片段。通过利用电影与预告片镜头之间的协同注意力生成弱标签,并引入对比注意力模块以增强特征判别能力,该方法在公开基准上实现了最先进性能,在TVSum数据集上比监督方法高出6.5% mAP,在TMDD数据集上甚至超越了监督基线方法。

ABSTRACT

A movie's key moments stand out of the screenplay to grab an audience's attention and make movie browsing efficient. But a lack of annotations makes the existing approaches not applicable to movie key moment detection. To get rid of human annotations, we leverage the officially-released trailers as the weak supervision to learn a model that can detect the key moments from full-length movies. We introduce a novel ranking network that utilizes the Co-Attention between movies and trailers as guidance to generate the training pairs, where the moments highly corrected with trailers are expected to be scored higher than the uncorrelated moments. Additionally, we propose a Contrastive Attention module to enhance the feature representations such that the comparative contrast between features of the key and non-key moments are maximized. We construct the first movie-trailer dataset, and the proposed Co-Attention assisted ranking network shows superior performance even over the supervised approach. The effectiveness of our Contrastive Attention module is also demonstrated by the performance improvement over the state-of-the-art on the public benchmarks.

研究动机与目标

  • 通过利用官方发布的预告片作为弱监督信号,解决电影预告片片段检测中缺乏标注数据的问题。
  • 开发一种弱监督学习框架,在避免昂贵人工标注的同时保持高检测精度。
  • 通过在特征空间中建模预告片片段与非预告片片段之间的对比关系,增强特征表示能力。
  • 构建首个大规模电影-预告片数据集TMDD,以支持未来在预告片片段检测方面的研究。
  • 证明当通过基于注意力的监督与特征增强进行合理设计时,弱监督模型可超越监督基线方法。

提出的方法

  • 利用长时电影镜头与其对应官方预告片镜头之间的协同注意力,估算‘预告片程度’分数,并生成弱正/负样本训练对。
  • 引入对比注意力模块,最大化预告片片段特征之间的相似性,同时增强与非预告片特征的对比度,形成紧凑的特征簇。
  • 采用3D CNN主干网络进行时空特征提取,随后通过排序头基于其预告片程度对每个镜头进行打分。
  • 使用对比排序损失端到端训练模型,鼓励与预告片高度对齐的镜头获得更高分数。
  • 应用UMAP可视化,证明对比注意力增强后特征可分性显著提升。
  • 构建包含150部长时电影及其官方预告片的TMDD数据集,总视频时长超过300小时。

实验结果

研究问题

  • RQ1能否有效利用官方电影预告片作为弱监督信号,在无需人工标注的情况下训练模型以检测关键预告片片段?
  • RQ2如何利用电影与预告片镜头之间的协同注意力,生成可靠的弱标签用于训练?
  • RQ3对比注意力机制是否能提升预告片与非预告片片段之间的特征判别能力,从而实现更好的泛化性能?
  • RQ4弱监督模型在公开视频亮点检测基准上是否优于现有监督方法?
  • RQ5通过对比注意力实现的特征增强在多大程度上提升了模型的鲁棒性与性能?

主要发现

  • 所提出的CCANet模型在TVSum数据集上超越所有监督基线方法,mAP比表现最佳的基线方法LM高出6.5%。
  • 在TVSum数据集上,CCANet达到0.628的top-5 mAP,较最先进的监督方法SubMod高出16.7%。
  • 在YouTube Highlight数据集上,CCANet的mAP达到0.691,较最佳基线LSVM高出15.5%。
  • UMAP可视化结果证实,对比注意力显著提升了亮点片段与非亮点片段之间的特征可分性。
  • 协同注意力机制成功识别出预告片与电影中视觉相似的镜头,并为相关电影镜头分配高分。
  • TMDD数据集作为首个同类数据集,支持了预告片片段检测的评估,并揭示了未来改进的广阔空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。