Skip to main content
QUICK REVIEW

[论文解读] Story Understanding in Video Advertisements

Keren Ye, Kyle Buettner|ArXiv.org|Jul 29, 2018
Cinema and Media Studies被引用 6
一句话总结

本文提出了一种新颖的框架,通过结合视觉、音频和语义上下文特征,利用无监督和有监督方法预测视频广告中的高潮,实现对视频广告中自动故事理解。通过将光流、镜头切分边界、音频振幅以及场景/物体/人脸特征整合到基于LSTM的情感模型中,该方法在最先进的方法基础上将情感预测性能提升了25%。

ABSTRACT

In order to resonate with the viewers, many video advertisements explore creative narrative techniques such as "Freytag's pyramid" where a story begins with exposition, followed by rising action, then climax, concluding with denouement. In the dramatic structure of ads in particular, climax depends on changes in sentiment. We dedicate our study to understand the dynamic structure of video ads automatically. To achieve this, we first crowdsource climax annotations on 1,149 videos from the Video Ads Dataset, which already provides sentiment annotations. We then use both unsupervised and supervised methods to predict the climax. Based on the predicted peak, the low-level visual and audio cues, and semantically meaningful context features, we build a sentiment prediction model that outperforms the current state-of-the-art model of sentiment prediction in video ads by 25%. In our ablation study, we show that using our context features, and modeling dynamics with an LSTM, are both crucial factors for improved performance.

研究动机与目标

  • 自动理解视频广告的动态叙事结构,特别是推动情感影响的高潮部分。
  • 通过建模时间动态和语义上下文,超越现有最先进模型,提升视频广告中的情感预测性能。
  • 验证高潮与戏剧性视觉和音频变化(如镜头切分边界和光流峰值)相关的假设。
  • 探究语义上下文(如场景类型、物体和面部表情)在塑造观众情感中的作用。
  • 开发一个统一框架,融合低层次动态与高层次语义信息,实现更准确的情感预测。

提出的方法

  • 在Video Ads Dataset中的1,149个视频上众包标注高潮,创建用于高潮检测的新基准。
  • 使用无监督方法基于光流、镜头切分边界和音频振幅的峰值(作为戏剧强度的代理)预测高潮。
  • 使用这些动态线索作为输入特征,训练有监督的高潮预测模型。
  • 每帧提取语义上下文特征,包括场景标签(places)、物体检测和面部表情预测。
  • 将所有特征(包括高潮预测和基于ResNet的视觉特征)整合到基于LSTM的循环模型中,实现序列情感预测。
  • 采用晚期融合策略整合多个特征流,并通过消融研究评估各组件的贡献。

实验结果

研究问题

  • RQ1无监督的视觉和音频动态(如光流、镜头切分边界、振幅)在多大程度上能有效预测视频广告中的高潮?
  • RQ2语义上下文特征(如场景、物体和面部表情)在多大程度上能提升视频广告中的情感预测性能?
  • RQ3结合高潮检测与语义上下文的联合建模方法,能否超越现有最先进视频广告情感预测模型?
  • RQ4哪些单个特征对情感预测的贡献最为显著,且其影响在不同情感类别中如何变化?
  • RQ5通过LSTM整合时间动态,相较于静态或非循环模型,如何显著提升情感预测性能?

主要发现

  • 所提出的基于LSTM的情感预测模型在情感预测准确率上比之前最先进模型高出25%,达到0.313的平均平均精度(mAP)。
  • 消融研究证实,同时使用上下文特征(场景、物体、面部表情)和通过LSTM建模动态对性能至关重要,移除任一因素均显著降低结果。
  • 特征'places'在预测'educated'情感时提供最大收益,与假设一致:教育类情感与特定环境(如教室)密切相关。
  • 特征'audio'使'angry'情感预测性能相比仅使用ResNet的基线提升43%,表明音频动态对某些情绪具有高度信息量。
  • 在定性示例中,该模型正确识别出'fashionable'和'amazed'情感,而基线模型失败,证明了语义和动态线索的价值。
  • 包含所有特征的完整模型在所有情感类别上的mAP达到0.094,显著优于仅使用ResNet的基线模型(0.074),且在所有单个情感类别中均观察到性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。