Skip to main content
QUICK REVIEW

[論文レビュー] Looking Beyond a Clever Narrative: Visual Context and Attention are Primary Drivers of Affect in Video Advertisements

Abhinav Shukla, Harish Katti|ePrints-IISc. (Indian Institute of Science Bangalore)|Aug 14, 2018
Emotion and Mood Recognition参考文献 55被引用数 6
ひとこと要約

本稿では、感情予測に与える影響を調査するために、粗いシーン構造、検出された物体、物体統計、および眼動-trackingで特定された注目物体という、異なる視覚的情報チャネルに動画広告を新規に分解する手法を提案する。眼動-trackingとコンピュータビジョンを用いて、粗いシーン構造と積極的に注目された物体が、物語的要因や物体レベルの特徴よりも、価値と覚醒度の予測においてより強力な予測要因であることが判明した。これは、広告の感情認識において物語的要因の優位性を疑問視するものである。

ABSTRACT

Emotion evoked by an advertisement plays a key role in influencing brand recall and eventual consumer choices. Automatic ad affect recognition has several useful applications. However, the use of content-based feature representations does not give insights into how affect is modulated by aspects such as the ad scene setting, salient object attributes and their interactions. Neither do such approaches inform us on how humans prioritize visual information for ad understanding. Our work addresses these lacunae by decomposing video content into detected objects, coarse scene structure, object statistics and actively attended objects identified via eye-gaze. We measure the importance of each of these information channels by systematically incorporating related information into ad affect prediction models. Contrary to the popular notion that ad affect hinges on the narrative and the clever use of linguistic and social cues, we find that actively attended objects and the coarse scene structure better encode affective information as compared to individual scene objects or conspicuous background elements.

研究の動機と目的

  • 動画広告のどの視覚的要素が、誘発される感情(価値と覚醒度)に最も強く影響を与えるかを理解すること。
  • 感情分析のための解釈可能な情報チャネルとして、シーン構造、物体、物体統計、注目領域に広告コンテンツを分解すること。
  • 人間の注目(眼動-trackingによる測定)と粗いシーンコンテキストが、言語的または物語的ヒントよりも感情予測に優れているかどうかを調査すること。
  • 感情駆動型動画広告および広告デザインのためのスケーラブルで解釈可能なフレームワークを構築すること。

提案手法

  • 著者らは、動画広告を4つの独立した視覚的情報チャネルに分解した:粗いシーン構造、検出されたシーン内の物体、物体統計、眼動-trackingで特定された注目物体。
  • 視聴者の眼動-trackingデータを用いて、広告視聴中に注目された物体を特定し、視覚的顕著性の指標を提供した。
  • 人間のレーティングによる価値と覚醒度のアノテーションを用いて、各チャネルごとに感情予測モデルを別々に訓練した。
  • 各チャネルの予測力の比較のため、モデルを評価し、統合チャネル性能を評価するためのアブレーションスタディを実施した。
  • 本アプローチは、物体検出およびシーン分類のためのコンピュータビジョン技術を活用し、人間の注目をモデル化するために眼動-trackingデータを統合している。
  • このフレームワークは、計算広告に既存のディープラーニングアーキテクチャと互換性があり、スケーラブルであるように設計されている。

実験結果

リサーチクエスチョン

  • RQ1動画広告のどの視覚的要素が、視聴者における誘発された価値と覚醒度を最も強く予測するか?
  • RQ2粗いシーン構造は、個々の物体や背景要因よりも、感情的情報をより多く含むか?
  • RQ3眼動-trackingで測定された人間の視覚的注目度は、物体レベルの特徴と比較して、感情反応の予測にどの程度優れているか?
  • RQ4物語的または言語的ヒントが、感情認識において視覚的情報と注目度と比較して、どの程度支配的であるか?
  • RQ5低レベルの視覚的記述子のみを用いて、短い動画セグメントから感情を信頼性高く予測できるか?

主な発見

  • 粗いシーン構造が、個々の物体、物体統計、さらには完全な動画コンテンツよりも、価値と覚醒度の予測において最も強力な予測要因であった。
  • 眼動-trackingで特定された積極的に注目された物体も、重要な感情的情報を保持しており、シーン構造に次いで2番目に強い予測要因であった。
  • 検出可能なすべての物体を対象にしたモデルは、注目された物体のみを対象にしたモデルよりも性能が悪く、視覚的ごみが感情処理を妨げる可能性があることを示唆した。
  • 感情は短い広告セグメント(例:10秒)からも信頼性高く予測可能であり、リアルタイムの計算広告の実現可能性を示した。
  • シーンコンテキストと注目された物体を統合したモデルが、物語的または言語的特徴に基づくモデルを上回る最高の性能を示した。
  • 原始的またはぼやけたシーン記述子のみで効果的な感情認識が可能であるため、スケーラブルな広告システムにおいて、計算コストが低いことが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。