Skip to main content
QUICK REVIEW

[論文レビュー] Story Understanding in Video Advertisements

Keren Ye, Kyle Buettner|ArXiv.org|Jul 29, 2018
Cinema and Media Studies被引用数 6
ひとこと要約

本稿では、視覚的・音声的・意味的文脈特徴に基づき、教師ありおよび教師なし手法を組み合わせてクライマックスを予測することで、動画広告における自動的ストーリー理解のための新規フレームワークを提案する。光学フロー、ショット境界、音声レベル、シーン/物体/顔認識特徴をLSTMベースのセンチメントモデルに統合することで、最先端手法に比べ25%の性能向上を達成した。

ABSTRACT

In order to resonate with the viewers, many video advertisements explore creative narrative techniques such as "Freytag's pyramid" where a story begins with exposition, followed by rising action, then climax, concluding with denouement. In the dramatic structure of ads in particular, climax depends on changes in sentiment. We dedicate our study to understand the dynamic structure of video ads automatically. To achieve this, we first crowdsource climax annotations on 1,149 videos from the Video Ads Dataset, which already provides sentiment annotations. We then use both unsupervised and supervised methods to predict the climax. Based on the predicted peak, the low-level visual and audio cues, and semantically meaningful context features, we build a sentiment prediction model that outperforms the current state-of-the-art model of sentiment prediction in video ads by 25%. In our ablation study, we show that using our context features, and modeling dynamics with an LSTM, are both crucial factors for improved performance.

研究の動機と目的

  • 動画広告のダイナミックなナラティブ構造、特に感情的インパクトを生むクライマックスを自動的に理解すること。
  • 時間的ダイナミクスと意味的文脈をモデル化することで、既存の最先端モデルを上回る動画広告のセンチメント予測を改善すること。
  • クライマックスがショット境界や光学フローのピークといった、劇的変化と相関することを仮説検証すること。
  • シーンの種別、物体、顔の表情といった意味的文脈が視聴者のセンチメントに与える影響を調査すること。
  • 低レベルのダイナミクスと高レベルの意味的特徴を統合する包括的フレームワークを構築し、より正確なセンチメント予測を実現すること。

提案手法

  • Video Ads Datasetから1,149本の動画を対象に、クラウドソーシングを用いてクライマックスのアノテーションを取得し、クライマックス検出のための新ベンチマークを構築した。
  • 光学フロー、ショット境界、音声レベルのピークを、劇的強度の代理指標として用い、教師なし手法によりクライマックスを予測した。
  • これらの動的特徴を入力特徴として用い、教師ありのクライマックス予測モデルを訓練した。
  • 各フレームごとに、シーンラベル(Places)、物体検出、顔の表情予測といった意味的文脈特徴を抽出した。
  • クライマックス予測とResNetベースの視覚的特徴を含むすべての特徴を、順方向に処理するLSTMベースの再帰的モデルに統合し、順序付きセンチメント予測を実現した。
  • 複数の特徴ストリームを統合するためのラテナル融合戦略を採用し、アブレーションスタディを実施して個々のコンponentの寄与度を評価した。

実験結果

リサーチクエスチョン

  • RQ1視覚的・音声的ダイナミクス(例:光学フロー、ショット境界、レベル)を用いた教師なし手法が、動画広告のクライマックスをどの程度正確に予測できるか?
  • RQ2シーンの種別、物体、顔の表情といった意味的文脈特徴が、動画広告のセンチメント予測にどの程度向上効果をもたらすか?
  • RQ3クライマックス検出と意味的文脈を統合する共同モデリングアプローチが、既存の最先端センチメント予測モデルを上回る性能を達成できるか?
  • RQ4どの個々の特徴がセンチメント予測に最も寄与しており、感情クラスごとにその寄与度はどのように変化するか?
  • RQ5LSTMによる時間的ダイナミクスの統合は、静的または非再帰的モデルに比べ、センチメント予測をどの程度向上させるか?

主な発見

  • 提案されたLSTMベースのセンチメント予測モデルは、先行する最先端モデルに比べ25%の性能向上を達成し、平均平均適合率(mAP)は0.313を達成した。
  • アブレーションスタディの結果、文脈特徴(シーン、物体、顔の表情)とLSTMによるダイナミクスモデリングの両方が性能向上に不可欠であることが確認され、いずれかを削除すると著しく性能が低下した。
  • 特徴「Places」は『教育的』というセンチメントを予測する際に最も寄与し、教室のような特定の環境と強い関連があるという仮説と整合的であった。
  • 特徴「音声」は『怒り』のセンチメント予測を、ResNetのみのベースラインに比べ43%向上させ、音声ダイナミクスが特定の感情に対して非常に有用であることを示した。
  • 定性的な例では、本モデルは『ファッション』や『驚き』のセンチメントを正しく識別したが、ベースラインモデルは失敗しており、意味的および動的特徴の価値を示した。
  • すべての特徴を統合した完全なモデルは、全センチメントクラスでmAP 0.094を達成し、ResNetのみのベースライン(0.074)を著しく上回り、すべての個別センチメントクラスで改善が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。