Skip to main content
QUICK REVIEW

[论文解读] Using Mise-En-Scène Visual Features based on MPEG-7 and Deep Learning for Movie Recommendation

Yashar Deldjoo, Massimo Quadrana|arXiv (Cornell University)|Apr 20, 2017
Video Analysis and Summarization参考文献 32被引用 11
一句话总结

本文提出利用从电影预告片中自动提取的场景视觉特征——具体为MPEG-7描述符和基于深度学习的特征——以提升电影推荐性能。结果表明,这些低层次视觉特征在Top-N推荐任务中优于传统的由人工生成的属性(如类型和标签),且两种特征类型的融合可获得最佳效果。

ABSTRACT

Item features play an important role in movie recommender systems, where recommendations can be generated by using explicit or implicit preferences of users on traditional features (attributes) such as tag, genre, and cast. Typically, movie features are human-generated, either editorially (e.g., genre and cast) or by leveraging the wisdom of the crowd (e.g., tag), and as such, they are prone to noise and are expensive to collect. Moreover, these features are often rare or absent for new items, making it difficult or even impossible to provide good quality recommendations. In this paper, we show that user's preferences on movies can be better described in terms of the mise-en-scène features, i.e., the visual aspects of a movie that characterize design, aesthetics and style (e.g., colors, textures). We use both MPEG-7 visual descriptors and Deep Learning hidden layers as example of mise-en-scène features that can visually describe movies. Interestingly, mise-en-scène features can be computed automatically from video files or even from trailers, offering more flexibility in handling new items, avoiding the need for costly and error-prone human-based tagging, and providing good scalability. We have conducted a set of experiments on a large catalogue of 4K movies. Results show that recommendations based on mise-en-scène features consistently provide the best performance with respect to richer sets of more traditional features, such as genre and tag.

研究动机与目标

  • 通过利用自动提取的视觉特征而非成本高昂的人工生成属性,解决电影推荐中的新物品问题。
  • 探究低层次视觉风格特征(场景)是否能在推荐性能上超越传统的高层次特征(如类型、标签和演员阵容)。
  • 评估从电影预告片中提取的视觉特征作为全片视频分析的可扩展替代方案的有效性。
  • 探索将MPEG-7描述符与深度学习特征相结合以提升推荐质量的潜力。
  • 评估视觉风格对用户偏好的影响,表明风格可能比内容或语义特征更具影响力。

提出的方法

  • 使用MPEG-7标准提取场景视觉特征,包括从电影画面中提取的颜色、纹理和边缘信息。
  • 利用预训练的深度学习模型(如VGG或类似模型)从视频画面或预告片中提取高层次视觉表征。
  • 从电影预告片而非完整影片中计算特征向量,以降低计算负载,同时保持与全片特征的相关性。
  • 使用提取的视觉特征作为输入,训练并评估协同过滤与基于内容的过滤模型。
  • 通过早期融合或晚期融合策略融合MPEG-7与深度学习特征,以提升推荐性能。
  • 在大规模4K电影数据集上,使用标准指标(如精确率、召回率和NDCG)评估推荐质量。

实验结果

研究问题

  • RQ1从电影预告片中提取的场景视觉特征是否能提供优于传统人工生成特征(如类型和标签)的电影推荐?
  • RQ2与基于深度学习的视觉描述符相比,基于MPEG-7视觉描述符的推荐性能在Top-N排序质量方面如何?
  • RQ3MPEG-7与深度学习视觉特征的融合是否能带来优于单独使用任一特征集的推荐性能?
  • RQ4从电影预告片中提取的视觉特征在多大程度上能代表整部电影的风格特征?
  • RQ5是否有证据表明,用户的电影偏好更受视觉风格影响,而非语义或句法内容特征?

主要发现

  • 基于MPEG-7的视觉特征在Top-N推荐性能上始终优于类型和标签特征,实现了更高的精确率和NDCG得分。
  • 基于深度学习的视觉特征提供的推荐质量与人工生成属性(如类型和标签)相当,但未超越它们。
  • MPEG-7与深度学习视觉特征的融合实现了最佳的整体推荐性能,表明两种方法具有互补优势。
  • 从电影预告片中提取的视觉特征与从完整电影中提取的特征具有强烈相关性,验证了预告片作为特征提取可扩展替代方案的有效性。
  • 结果表明,用户偏好更受视觉风格(场景)影响,而非语义或句法内容,挑战了关于类型或剧情主导性的既有假设。
  • MPEG-7特征的低维性(774个元素)结合从预告片中自动提取的方式,为新物品推荐提供了一种可扩展、低成本且稳健的解决方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。