[論文レビュー] Audio-Visual Sentiment Analysis for Learning Emotional Arcs in Movies
本稿では、映画の音声および視覚的感情分析に深層畳み込みニューラルネットワークを用いて、観客の関与度を予測する感情の変化曲線を構築する、マルチモーダル機械学習フレームワークを提案する。特定の感情の変化曲線の形状、特にピークで終わる(「最後に大爆発」)もの—が、オンライン動画コンテンツにおけるコメント数の上昇を統計的に有意に予測することが示された。
Stories can have tremendous power -- not only useful for entertainment, they can activate our interests and mobilize our actions. The degree to which a story resonates with its audience may be in part reflected in the emotional journey it takes the audience upon. In this paper, we use machine learning methods to construct emotional arcs in movies, calculate families of arcs, and demonstrate the ability for certain arcs to predict audience engagement. The system is applied to Hollywood films and high quality shorts found on the web. We begin by using deep convolutional neural networks for audio and visual sentiment analysis. These models are trained on both new and existing large-scale datasets, after which they can be used to compute separate audio and visual emotional arcs. We then crowdsource annotations for 30-second video clips extracted from highs and lows in the arcs in order to assess the micro-level precision of the system, with precision measured in terms of agreement in polarity between the system's predictions and annotators' ratings. These annotations are also used to combine the audio and visual predictions. Next, we look at macro-level characterizations of movies by investigating whether there exist `universal shapes' of emotional arcs. In particular, we develop a clustering approach to discover distinct classes of emotional arcs. Finally, we show on a sample corpus of short web videos that certain emotional arcs are statistically significant predictors of the number of comments a video receives. These results suggest that the emotional arcs learned by our approach successfully represent macroscopic aspects of a video story that drive audience engagement. Such machine understanding could be used to predict audience reactions to video stories, ultimately improving our ability as storytellers to communicate with each other.
研究の動機と目的
- 映画における感情の変化曲線を音声および視覚的感情分析を用いてモデル化し、物語の影響力の理解を向上させること。
- 30秒の動画クリップにおける人間によるアノテーションと比較することで、微視的レベルでの感情のピークおよび谷の予測精度を評価すること。
- 視覚的感情の変化曲線のクラスタリングを通じて、普遍的なマクロレベルの感情の変化曲線の族を発見すること。
- オンライン動画プラットフォームにおけるコメント数を指標として用い、特定の感情の変化曲線の形状が観客の関与度を予測できるかどうかを調査すること。
- 今後のマルチモーダル感情モデリング研究のため、音声特徴および感情アノテーション済みの動画クリップの公開データセットを提供すること。
提案手法
- 大規模な音声および視覚的感情分析データセットを用いて、深層畳み込みニューラルネットワークを訓練し、フレーム単位および音声スニペット単位の感情スコアを抽出する。
- 異なる映画間での感情の変化曲線の形状類似度を比較するために、Keoghの下限境界を用いた動的時間ワープングを適用する。
- シルエットに基づくエルボー法を用いたk-medoidsクラスタリングを用い、視覚的感情の変化曲線から明確な感情の変化曲線の族を同定する。
- 感情極性の予測精度を人間によるアノテーションとの一致度で評価しながら、音声と視覚の感情予測を重み付きモデルで統合する。
- 10%の動画セグメントにわたる双概念分類器の2番目に深い層の活性化を平均化し、10×1の特徴ベクトルに次元削減することで、映画の埋め込み表現を構築する。
- Vimeoのショート動画におけるコメント数を予測するために、メタデータおよびカテゴリカルなクラスタ割り当て(感情の変化曲線の族)を用いた回帰分析を実施する。

実験結果
リサーチクエスチョン
- RQ1人間アノテーターによる検証を経て、音声・視覚的感情分析は、映画クリップにおける微視的レベルの感情のピークおよび谷を正確にモデル化できるか?
- RQ2多様な映画およびショート動画に共通する、明確で普遍的な感情の変化曲線の族が存在するか?もしあるならば、どのようにして同定できるか?
- RQ3特定の感情の変化曲線の形状が、オンラインのコメント数という指標で測定された観客の関与度を統計的に有意に予測できるか?
- RQ4音声および視覚的感情特徴を組み込むことで、感情の変化曲線モデリングの精度と解釈可能性はどのように向上するか?
- RQ5感情の変化曲線の族は、映画のジャンルや物語構造とどの程度相関しているか?
主な発見
- 音声・視覚の統合モデルは、30秒の動画クリップにおける感情のピークおよび谷の極性を予測する精度が0.894に達し、人間アノテーターとの一致度が高かった。
- k-medoidsクラスタリング手法により、ショートフィルムコホートにおいて5つの明確な感情の変化曲線の族が同定され、その中で「Icarus」形状(上昇後下降)および「end-with-a-bang」曲線が関与度の有意な予測要因であった。
- k=8のクラスタリングにおいて、「end-with-a-bang」曲線族はコメント数の統計的有意な予測要因であった(p < 0.05)、観客の関与度と正の相関を示した。
- 「Icarus」曲線(上昇後下降)およびその他の2つのピーク終了型(ピーク前の上昇または平坦)も、複数のk値において高いコメント数を予測する有意な要因であった。
- 視覚的感情から導出された映画の埋め込み表現は、ジャンル別に明確にクラスタリングされており、ロマンス、アドベンチャー、ファンタジー、アニメーション映画が明確なグループを形成していた。
- 音声・視覚の統合は、データのスパarsityと小さな真値カバー範囲のため、視覚のみの曲線に比べてクラスタの明確さが劣った。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。