Skip to main content
QUICK REVIEW

[論文レビュー] Ad-Net: Audio-Visual Convolutional Neural Network for Advertisement Detection In Videos

Shervin Minaee, Imed Bouazizi|arXiv (Cornell University)|Jun 22, 2018
Video Analysis and Summarization参考文献 18被引用数 6
ひとこと要約

本論文では、広告検出のための2ストリーム音声・視覚的畳み込みニューラルネットワークAd-Netを提案する。視覚的および音声的特徴を統合することで、82%の正確性を達成し、HOG+SVM(76.4%)やLBP+SVM(68.5%)といった手作業特徴抽出手法を著しく上回る。深層学習を活用することで、広告と通常のコンテンツとの間の視覚的類似性を克服する。

ABSTRACT

Personalized advertisement is a crucial task for many of the online businesses and video broadcasters. Many of today's broadcasters use the same commercial for all customers, but as one can imagine different viewers have different interests and it seems reasonable to have customized commercial for different group of people, chosen based on their demographic features, and history. In this project, we propose a framework, which gets the broadcast videos, analyzes them, detects the commercial and replaces it with a more suitable commercial. We propose a two-stream audio-visual convolutional neural network, that one branch analyzes the visual information and the other one analyzes the audio information, and then the audio and visual embedding are fused together, and are used for commercial detection, and content categorization. We show that using both the visual and audio content of the videos significantly improves the model performance for video analysis. This network is trained on a dataset of more than 50k regular video and commercial shots, and achieved much better performance compared to the models based on hand-crafted features.

研究の動機と目的

  • 広告セグメントがメタデータにマークされていない放送動画における広告検出の課題に対処すること。
  • スポーツ映像と製品広告の間で視覚的に類似するため、従来の視覚のみの手法が誤検出を引き起こすという、広告と通常のコンテンツとの視覚的類似性を克服すること。
  • 音声と視覚の両モodalを統合する深層学習フレームワークを開発し、検出正確性を向上させること。
  • ユーザーのプロファイルに基づいたコンテンツに適した置換を可能にするために、広告セグメントを検出し、ユーザーに応じた置換を可能にする。

提案手法

  • 2ストリーム畳み込みニューラルネットワークを採用:1つのストリームはRGB動画フレームを処理して視覚的表現を生成し、もう1つのストリームは音声スペクトログラムを処理して聴覚的特徴を抽出する。
  • 両ストリームで複数の畳み込み層およびプーリング層を経て高レベル表現を抽出し、ドロップアウトを適用した全結合層を介して正則化を実施する。
  • 視覚的および音声的埋め込みをネットワークの初期段階で統合することで、広告検出に適した音声・視覚的パターンの共同学習を可能にする。
  • 確率的ミニバッチ勾配降下法を用いて学習し、分類用の交差エントロピー損失関数とℓ₂正則化を組み合わせた損失関数を用いる。
  • 同じアーキテクチャを用いて、動画コンテンツ分類も行えるようにするマルチタスク学習の拡張を実施する。この際、追加の交差エントロピー損失項を導入する。
  • 検証性能に基づき、学習率の段階的減少スケジュール、バッチサイズ200、ℓ₂重み正則化係数0.0001などのハイパーパrameterを最適化する。

実験結果

リサーチクエスチョン

  • RQ1音声と視覚的特徴を共同で分析する深層学習モデルは、視覚的特徴のみに依存するモデルよりも、放送動画における広告検出をより正確に行えるか?
  • RQ2従来のHOGやLBPといった手作業特徴抽出手法と比較して、音声・視覚的CNNの広告検出性能はどのように異なるか?
  • RQ3視覚的コンテンツが広告と通常番組の間で曖昧である場合、音声と視覚的表現を統合することで、検出のロバスト性がどの程度向上するか?
  • RQ4提案されたアーキテクチャは、広告検出と動画コンテンツ分類の両タスクを同時に実行できるマルチタスク学習に拡張可能か?

主な発見

  • 提案された音声・視覚的CNNは、51,000本の動画および広告ショットから成るテストセットで82%の検出正確性を達成し、HOG+SVM(76.4%)やLBP+SVM(68.5%)を著しく上回った。
  • 音声と視覚的手がかりを効果的に活用することで、スポーツ映像や製品広告のように視覚的に類似するコンテンツの誤分類を低減し、優れた一般化性能とロバスト性を示した。
  • トレーニング曲線から、ドロップアウト(0.5)とℓ₂正則化(λ = 0.0001)を全結合層後に適用したことで、過学習が最小限に抑えられ、安定した収束が確認された。
  • 音声・視覚的統合戦略により、視覚のみのモデルに比べて、特に曖昧なケースで精度と再現率が向上した。
  • モデルのアーキテクチャはマルチタスク学習をサポートしており、共有特徴表現を用いて同時に広告検出とコンテンツ分類が可能である。
  • エンド・トゥ・エンドの深層学習モデルが大規模データセットで学習されることで、従来の手作業特徴抽出パイプラインよりも顕著に優れた性能を発揮することが、結果から裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。