Skip to main content
QUICK REVIEW

[论文解读] Moviescope: Large-scale Analysis of Movies using Multiple Modalities

Paola Cascante-Bonilla, K. Sitaraman|arXiv (Cornell University)|Aug 8, 2019
Video Analysis and Summarization参考文献 39被引用 14
一句话总结

本文介绍了Moviescope,一个大规模多模态数据集,包含5,000部电影的视频预告片、音频、电影海报、剧情简介和元数据,并提出了简单而有效的编码方法——fastVideo和fastText,通过平均池化技术对视频和文本进行表征。结果表明,内容特征(尤其是音频和文本)在预测电影预算方面优于元数据,多模态融合可提升类型预测性能,深度学习模型在文本和视频输入上的表现达到或超过人类水平。

ABSTRACT

Film media is a rich form of artistic expression. Unlike photography, and short videos, movies contain a storyline that is deliberately complex and intricate in order to engage its audience. In this paper we present a large scale study comparing the effectiveness of visual, audio, text, and metadata-based features for predicting high-level information about movies such as their genre or estimated budget. We demonstrate the usefulness of content-based methods in this domain in contrast to human-based and metadata-based predictions in the era of deep learning. Additionally, we provide a comprehensive study of temporal feature aggregation methods for representing video and text and find that simple pooling operations are effective in this domain. We also show to what extent different modalities are complementary to each other. To this end, we also introduce Moviescope, a new large-scale dataset of 5,000 movies with corresponding movie trailers (video + audio), movie posters (images), movie plots (text), and metadata.

研究动机与目标

  • 开发一个全面的、大规模的多模态电影理解数据集,涵盖5,000部电影的视频预告片、音频、海报、剧情简介和元数据。
  • 评估视觉、音频、文本和元数据特征在预测电影高级属性(如类型和预算)方面的有效性。
  • 探究基于内容的表征(视频、音频、文本)是否能在电影理解任务中超越元数据或人类判断。
  • 将简单的特征聚合技术(如平均池化,即fastVideo和fastText)与更复杂的模型(如LSTM)在多模态视频和文本表征中的表现进行基准对比。

提出的方法

  • 提出fastVideo方法,通过帧级特征的平均池化将视频预告片编码为固定大小的嵌入向量。
  • 采用fastText对文本进行编码,通过对电影剧情中词级嵌入进行平均池化实现。
  • 构建Moviescope数据集,为5,000部电影建立视频预告片、电影海报、剧情简介和元数据之间的精心对齐映射。
  • 采用多模态融合策略,通过后期融合与后期交互层,结合视频、音频、文本、海报和元数据特征。
  • 分别以I3D和音频嵌入作为视频和音频模态的基线特征。
  • 通过Amazon Mechanical Turk开展用户研究,比较人类与模型在不同类型模态下进行类型分类的性能。

实验结果

研究问题

  • RQ1基于内容的特征(视频、音频、文本)能否有效预测电影的高级属性(如类型和预算),并优于元数据或人类判断?
  • RQ2与更复杂的RNN模型相比,基于池化的编码方法(fastVideo、fastText)在电影理解任务中对视频和文本表征的有效性如何?
  • RQ3不同模态(视频、音频、文本、海报、元数据)在预测电影属性方面具有多大程度的互补性?
  • RQ4深度学习模型在使用不同模态进行电影类型分类时,其性能与人类表现相比如何?
  • RQ5电影预告片中的音频是否比视觉内容提供更强的预算估计信号?

主要发现

  • 在预算估计任务中,电影预告片的音频特征实现了最高的mAP(35.7%),优于视频(32.9%)和文本(36.1%)。
  • 元数据特征在预算预测中达到最高的准确率(91.0% mAP),显著优于所有基于内容的模态。
  • fastVideo和fastText编码方法表现具有竞争力,其中fastVideo在某些情况下优于基于I3D的模型,并在类型分类任务中与或超过基于LSTM的方法。
  • 在类型预测任务中,人类在视频模态上的表现高于模型(视频:63.0 mAP vs. VAPTM的68.6 mAP),但模型在文本模态上优于人类(文本:72.7 mAP vs. 非观看者69.7 mAP)。
  • 使用所有模态(视频、音频、文本、海报、元数据)的模型在类型预测中达到最高的mAP(75.3%),证明了各模态之间存在显著的互补性。
  • 类型与预算等级之间并无强相关性——奇幻和动作类型主导高预算等级,但科幻类型则分布于所有等级,表明类型与预算之间存在复杂的动态关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。