Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Feature Fusion for Video Advertisements Tagging Via Stacking Ensemble

Qingsong Zhou, Hai Liang|arXiv (Cornell University)|Aug 2, 2021
Video Analysis and Summarization参考文献 34被引用数 4
ひとこと要約

本論文は、ビデオ広告タグ付けのためのスタッキングアンサンブルベースのマルチモーダル特徴融合フレームワークを提案する。視覚的、文書的、音声的特徴を統合することで、精度と耐障害性を向上させる。本手法は最先端の性能を達成し、2021年 Tencent Advertising Algorithm Competition で 82.63% の Global Average Precision (GAP) を記録し、1位となった。

ABSTRACT

Automated tagging of video advertisements has been a critical yet challenging problem, and it has drawn increasing interests in last years as its applications seem to be evident in many fields. Despite sustainable efforts have been made, the tagging task is still suffered from several challenges, such as, efficiently feature fusion approach is desirable, but under-explored in previous studies. In this paper, we present our approach for Multimodal Video Ads Tagging in the 2021 Tencent Advertising Algorithm Competition. Specifically, we propose a novel multi-modal feature fusion framework, with the goal to combine complementary information from multiple modalities. This framework introduces stacking-based ensembling approach to reduce the influence of varying levels of noise and conflicts between different modalities. Thus, our framework can boost the performance of the tagging task, compared to previous methods. To empirically investigate the effectiveness and robustness of the proposed framework, we conduct extensive experiments on the challenge datasets. The obtained results suggest that our framework can significantly outperform related approaches and our method ranks as the 1st place on the final leaderboard, with a Global Average Precision (GAP) of 82.63%. To better promote the research in this field, we will release our code in the final version.

研究の動機と目的

  • ビデオ広告タグ付けにおけるノイズが多く、矛盾するマルチモーダル特徴の課題に対処すること。
  • 視覚的、文書的、音声的モダリティからの補完的情報を効果的に統合することで、タグ付け性能を向上させること。
  • モダリティ固有のノイズや不一致の影響を低減する耐障害性の高い特徴統合戦略を開発すること。
  • 2021年 ACM Multimedia Multi-modal Ads Video Understanding Challenge でトップパフォーマンスを達成すること。
  • 広範なアブレーション実験および比較実験を通じて、提案フレームワークの有効性と一般化能力を示すこと。

提案手法

  • 視覚的、文書的、音声的モダリティごとに訓練された複数のベースモデルの予測を統合するスタッキングアンサンブルアプローチを採用する。
  • 深層ニューラルネットワーク(DNN)を用いて各モダリティからの特徴を抽出・分類する:視覚的特徴はCNNから、文書的特徴はOCRとASRから、音声的特徴は音声認識から得る。
  • アブレーションおよび比較の目的で、特徴レベルの統合戦略(連結、和プーリング、最大プーリング、アテンション機構)を適用する。
  • スタッキングアンサンブルにおけるメタラーナーを活用し、ベースモデルの予測を統合し、最適な重み付けを学習し、矛盾するモダリティ出力からのノイズを低減する。
  • アンサンブルモデルの学習中に過学習を防ぐためにドロップアウト正則化を適用する。
  • グローバル平均精度(GAP)を主評価指標として最適化し、信頼度スコアを予測順位付けに使用する。

実験結果

リサーチクエスチョン

  • RQ1スタッキングアンサンブルフレームワークは、視覚的・文書的・音声的特徴といったマルチモーダル特徴をどれほど効果的に統合し、ビデオ広告タグ付けのパフォーマンスを向上させることができるか?
  • RQ2各モダリティ(視覚的・文書的・音声的)が最終的なタグ付け精度およびGAPに果たす相対的寄与度は何か?
  • RQ3従来の統合手法(例:連結、アテンション、プーリング)と比較して、提案されたスタッキングベースの統合戦略は、耐障害性およびパフォーマンス面でどのように優れているか?
  • RQ4追加の特徴(例:TF-IDF、追加の埋め込み)の導入が、タグ付け結果にどの程度向上効果をもたらすか?
  • RQ5ノイズやモダリティの矛盾の程度が異なる多様なビデオ広告に対して、本フレームワークはどれほど一般化性能を発揮できるか?

主な発見

  • 提案されたスタッキングアンサンブルフレームワークは、グローバル平均精度(GAP)82.63%を達成し、2021年 ACM Multimedia チャレンジの最終順位表で1位となった。
  • 視覚的特徴のみで最高の個別GAP 79.636%を記録し、文書的(75.612%)および音声的(70.701%)モダリティを上回った。
  • TF-IDFおよび追加の埋め込みを含む視覚的・文書的・音声的特徴の統合が、最高のパフォーマンスをもたらし、93.34%の精度と82.641%のGAPを達成した。
  • スタッキングベースの統合手法は、すべてのベースライン統合戦略(連結:GAP 80.971%、和プーリング:80.197%、最大プーリング:80.511%、アテンション:81.295%)を上回った。
  • アブレーションスタディの結果、より多くのモダリティを追加することで性能が一貫して向上し、視覚的+文書的+音声的+TF-IDF+追加の特徴という完全な特徴セットが最高の精度とGAPを達成した。
  • 予測の可視化結果から、真の陽性タグが常に上位9件以内に順位付けされており、モデルの信頼性と精度が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。