[論文レビュー] Fusing Audio, Textual and Visual Features for Sentiment Analysis of News Videos
本稿では、音声、テキスト、視覚的特徴(顔の感情強度、音声の基本周波数、発声確率、音量、閉じた字幕からのセンチメントスコアなど)を統合するマルチモーダル手法を提案し、ニュース動画の緊張度(低/高)を分類する。520本のブラジルおよびアメリカのニュース動画で評価された結果、84%の正確性を達成し、メディアおよびジャーナリズム分析への応用可能性が顕著に示された。
This paper presents a novel approach to perform sentiment analysis of news videos, based on the fusion of audio, textual and visual clues extracted from their contents. The proposed approach aims at contributing to the semiodiscoursive study regarding the construction of the ethos (identity) of this media universe, which has become a central part of the modern-day lives of millions of people. To achieve this goal, we apply state-of-the-art computational methods for (1) automatic emotion recognition from facial expressions, (2) extraction of modulations in the participants' speeches and (3) sentiment analysis from the closed caption associated to the videos of interest. More specifically, we compute features, such as, visual intensities of recognized emotions, field sizes of participants, voicing probability, sound loudness, speech fundamental frequencies and the sentiment scores (polarities) from text sentences in the closed caption. Experimental results with a dataset containing 520 annotated news videos from three Brazilian and one American popular TV newscasts show that our approach achieves an accuracy of up to 84% in the sentiments (tension levels) classification task, thus demonstrating its high potential to be used by media analysts in several applications, especially, in the journalistic domain.
研究の動機と目的
- 口語的および非口語的サインを統合することで、ニュース動画のセミオトーディスティック分析を支援する計算的手法を開発すること。
- 既存の研究におけるギャップを埋めるために、音声、テキスト、視覚的モダリティを統合し、ニュース放送における感情的緊張を推定すること。
- 単一モダリティのセンチメント分析を上回る、ニュース動画における緊張度分類の正確性を向上させること。
- メディアアナリストやジャーナリストが、要約作成、コンテンツ整理、視聴者参加のための感情的高揚度コンテンツを特定するのを支援すること。
- 閉じた字幕からのセンチメントスコアが、高緊張度ニュースセグメントを検出するための主要なシグナルであることを検証すること。
提案手法
- 顔の表情認識を用いて視覚的特徴を抽出し、動画フレーム全体にわたり感情の強度(例:喜び、怒り、悲しみ)を定量化する。
- 音声特徴(音声の基本周波数、発声確率、音量)を分析し、緊張を示す声の変化を検出する。
- 最新のセンチメント分析を用いて閉じた字幕のテキストコンテンツを処理し、極性スコア(肯定的/否定的センチメント)を抽出する。
- 特徴レベルおよび意思決定レベルでマルチモーダル特徴を統合し、緊張推定への寄与度に応じて重み付けを行う。
- 動画全体の期間にわたり、すべてのマルチモーダル特徴の加重合計値に基づき、各ニュース動画を「低緊張」または「高緊張」と分類する。
- 4名の人的アノテーターによる投票メカニズムを用いて、真の緊張度を定義し、全動画および100%合意のサブセットで評価を実施する。
実験結果
リサーチクエスチョン
- RQ1音声、テキスト、視覚的特徴の統合は、単一モダリティ手法と比較して、ニュース動画における緊張度分類の正確性を向上させることができるか?
- RQ2閉じた字幕からのセンチメントスコアは、視覚的および音声的シグナルと比較して、高緊張度ニュースセグメントを特定するのにどの程度有効か?
- RQ3提案されたマルチモーダル統合手法は、低緊張度ニュース動画の分類において、個々の特徴セットを上回る性能を示すか?
- RQ4顔の表情と声の変化は、ジャーナリズム放送における認識された感情的緊張とどの程度相関しているか?
- RQ5自動緊張検出は、ニュース要約作成やメディアアナリティクスにおけるコンテンツ優先順位付けといった実用的応用を支援できるか?
主な発見
- 提案されたマルチモーダル統合手法は、520本のニュース動画から成るデータセットにおいて、緊張度(低/高)分類で84%の正確性を達成した。
- 人的アノテーター間の100%合意が得られた動画に限定した場合、手法の正確性は85%に上昇し、一貫性のあるアノテーションに対して高いロバストネスを示した。
- 閉じた字幕からのセンチメントスコアは、高緊張度ニュースを特定するための最も効果的な単一特徴であり、100%合意サブセットで83%の正確性を達成した。
- 提案手法は、感情的低緊張度動画の分類において、個々の特徴(例:フィールドサイズ、センチメントスコア)を上回る性能を示したが、センチメントスコア単体では性能が低かった。
- マルチモーダル特徴の統合は、単一モダリティ手法よりも顕著に性能を向上させ、95%信頼水準でのペアドt検定により統計的有意性が確認された。
- 本研究は、閉じた字幕のセンチメント分析が、特に感情的高揚度コンテンツを検出する文脈において、価値がありながらも未だ十分に活用されていない信号であることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。