Skip to main content
QUICK REVIEW

[论文解读] Looking Beyond a Clever Narrative: Visual Context and Attention are Primary Drivers of Affect in Video Advertisements

Abhinav Shukla, Harish Katti|ePrints-IISc. (Indian Institute of Science Bangalore)|Aug 14, 2018
Emotion and Mood Recognition参考文献 55被引用 6
一句话总结

本文提出了一种新颖的视频广告分解方法,将其划分为不同的视觉信息通道——粗粒度场景结构、检测到的物体、物体统计信息以及通过眼动追踪识别出的关注对象,以研究其对情感预测的影响。结合眼动追踪与计算机视觉技术,研究发现粗粒度场景结构和主动关注的物体比叙事或物体层面的特征更能有效预测情感的正负性(valence)与唤醒度(arousal),挑战了叙事在广告情感感知中的主导地位。

ABSTRACT

Emotion evoked by an advertisement plays a key role in influencing brand recall and eventual consumer choices. Automatic ad affect recognition has several useful applications. However, the use of content-based feature representations does not give insights into how affect is modulated by aspects such as the ad scene setting, salient object attributes and their interactions. Neither do such approaches inform us on how humans prioritize visual information for ad understanding. Our work addresses these lacunae by decomposing video content into detected objects, coarse scene structure, object statistics and actively attended objects identified via eye-gaze. We measure the importance of each of these information channels by systematically incorporating related information into ad affect prediction models. Contrary to the popular notion that ad affect hinges on the narrative and the clever use of linguistic and social cues, we find that actively attended objects and the coarse scene structure better encode affective information as compared to individual scene objects or conspicuous background elements.

研究动机与目标

  • 理解视频广告的哪些视觉成分对诱发的情感(正负性与唤醒度)影响最大。
  • 将广告内容分解为可解释的信息通道,用于情感分析,包括场景结构、物体、物体统计信息以及关注区域。
  • 探究人类注意力(通过眼动追踪测量)与粗粒度场景上下文是否比语言或叙事线索更能预测情感反应。
  • 开发一种可扩展、可解释的情感驱动视频广告与广告设计框架。

提出的方法

  • 作者将视频广告分解为四个独立的视觉信息通道:粗粒度场景结构、检测到的场景物体、物体统计信息以及通过眼动追踪识别出的关注对象。
  • 利用观看者的眼动数据识别在广告播放过程中被主动关注的物体,从而提供视觉显著性的度量。
  • 分别在每个通道上使用人类评分者提供的正负性与唤醒度标注,训练情感预测模型。
  • 通过比较模型性能评估各通道的预测能力,并通过消融实验评估多个通道组合后的表现。
  • 该方法利用计算机视觉技术进行物体检测与场景分类,并整合眼动追踪数据以建模人类注意力机制。
  • 该框架设计为可扩展,并与现有的深度学习架构兼容,适用于计算广告领域。

实验结果

研究问题

  • RQ1视频广告的哪些视觉成分最能预测观众的正负性与唤醒度?
  • RQ2粗粒度场景结构是否比单个物体或背景元素传递更多情感信息?
  • RQ3通过眼动追踪测量的人类视觉注意力,与物体层面的特征相比,在预测情感反应方面表现如何?
  • RQ4与视觉上下文和注意力机制相比,叙事或语言线索在情感感知中占据多大主导地位?
  • RQ5是否可以仅使用低层次视觉描述符,从短时视频片段中可靠预测情感?

主要发现

  • 粗粒度场景结构是正负性与唤醒度最强的预测因子,优于单个物体、物体统计信息,甚至优于完整视频内容。
  • 通过眼动追踪识别出的主动关注对象也携带显著的情感信息,其预测能力仅次于场景结构。
  • 仅基于可检测到的所有物体训练的模型,其表现劣于仅使用关注物体的模型,表明视觉杂乱可能损害情感处理能力。
  • 情感可从短广告片段(例如10秒)中可靠预测,表明其在实时计算广告中的可行性。
  • 将场景上下文与关注对象相结合,可获得性能最佳的情感预测模型,优于基于叙事或语言特征的模型。
  • 原始或模糊的场景描述符已足够实现有效的情感识别,表明该方法计算复杂度低,适用于可扩展的广告系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。