Skip to main content
QUICK REVIEW

[論文レビュー] MuSe 2020 -- The First International Multimodal Sentiment Analysis in Real-life Media Challenge and Workshop

Lukas Stappen, Alice Baird|arXiv (Cornell University)|Apr 30, 2020
Sentiment Analysis and Opinion Mining参考文献 52被引用数 5
ひとこと要約

MuSe 2020 は、実生活のメディアにおけるマルチモーダルセンチメント分析の最初の国際的チャレンジを提供し、実際の車のレビューを収集した MuSe-CaR データセットを用いて、3つのサブチャレンジ—連続的感情予測(MuSe-Wild)、感情-ターゲット関与検出(MuSe-Topic)、信頼性予測(MuSe-Trust)—を評価する。本研究では、音声、視覚、テキスト特徴量のマルチモーダル統合を用いて最先端のベースラインを確立した。主な結果として、感情予測には生の音声特徴量が最も優れた性能を示し、感情の価値と覚醒度の信号を組み込むことで信頼性予測の性能が向上したことが示された。

ABSTRACT

Multimodal Sentiment Analysis in Real-life Media (MuSe) 2020 is a Challenge-based Workshop focusing on the tasks of sentiment recognition, as well as emotion-target engagement and trustworthiness detection by means of more comprehensively integrating the audio-visual and language modalities. The purpose of MuSe 2020 is to bring together communities from different disciplines; mainly, the audio-visual emotion recognition community (signal-based), and the sentiment analysis community (symbol-based). We present three distinct sub-challenges: MuSe-Wild, which focuses on continuous emotion (arousal and valence) prediction; MuSe-Topic, in which participants recognise domain-specific topics as the target of 3-class (low, medium, high) emotions; and MuSe-Trust, in which the novel aspect of trustworthiness is to be predicted. In this paper, we provide detailed information on MuSe-CaR, the first of its kind in-the-wild database, which is utilised for the challenge, as well as the state-of-the-art features and modelling approaches applied. For each sub-challenge, a competitive baseline for participants is set; namely, on test we report for MuSe-Wild a combined (valence and arousal) CCC of .2568, for MuSe-Topic a score (computed as 0.34$\cdot$ UAR + 0.66$\cdot$F1) of 76.78 % on the 10-class topic and 40.64 % on the 3-class emotion prediction, and for MuSe-Trust a CCC of .4359.

研究の動機と目的

  • 信号ベースの音声・視覚的感情認識コミュニティと、シンボルベースのセンチメント分析コミュニティの間のギャップを埋めるために、実世界の環境におけるマルチモーダル統合を促進すること。
  • ユーザー生成の実生活のメディアにおける連続的感情(価値と覚醒度)予測、感情-ターゲット関与検出、信頼性検出のためのマルチモーダルアプローチを評価・比較すること。
  • 大規模かつ現実的なマルチモーダルコーパスとしての MuSe-CaR データセットを用いてベンチマークを確立し、モダリティを跨いで透明かつ再現可能な評価を可能にすること。
  • 自然主義的環境における感情計算のため、言語、音声、視覚信号を統合する統一的でマルチモーダルなモデルの開発を促進すること。
  • 再現可能性と公平な比較を可能にするために、オープンソースの特徴量、コード、データを提供することで、マルチモーダル統合技術におけるイノベーションを奨励すること。

提案手法

  • チャレンジは、価値、覚醒度、トピック、信頼性のマルチモーダルアノテーションが付与された、35時間にわたる実生活の車のレビュー動画のコレクションである MuSe-CaR データセットを用いる。
  • MuSe-Wild では、生の音声、顔のランドマーク(dlib)、テキスト埋め込み(FastText、BERT)の特徴量を用いて、連続的価値と覚醒度を予測するモデルを構築する。
  • MuSe-Topic では、テキスト(BERT)、音声(eGeMAPS)、視覚(Xception、VGGface)特徴量のマルチモーダル統合を用いて、10のドメイン固有トピックと3段階の感情強度(低/中/高)を分類する。
  • MuSe-Trust では、マルチモーダル特徴量を用いて連続的信頼性を予測するが、アブレーションスタディにより、価値と覚醒度の予測を補助信号として追加した場合の影響を評価する。
  • ベースラインシステムは、ラテントまたはイ早めの統合戦略を用いたエンドツーエンド学習を採用し、最良の性能を示したモデルは FastText、VGGface、生の音声特徴量を組み合わせたものであった。
  • すべてのベースラインはオープンソースツールを用いて実装されており、トレーニング、開発、テスト分割が公開されており、再現可能性と透明性を確保している。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダルモデルは、実生活のユーザー生成動画コンテンツにおいて、連続的価値と覚醒度をどれほど正確に予測できるか?
  • RQ2自然な会話における特定のトピックに対して、マルチモーダル統合は感情-ターゲット関与検出の性能をどの程度向上させるか?
  • RQ3価値と覚醒度の予測を含めることで、マルチモーダルシステムにおける信頼性推定の性能は向上するか?
  • RQ4制御されていない実生活環境において、感情予測に最も寄与するのはどのモダリティ(テキスト、音声、視覚)か?
  • RQ5最新のディーブラーニングアーキテクチャ(例:BERT、Xception、VGGface)が、手作業で抽出された音声特徴量(eGeMAPS)と組み合わされた場合、マルチモーダルセンチメント分析においてどの程度効果的か?

主な発見

  • MuSe-Wild のエンドツーエンドベースラインは、テストセットにおいて価値と覚醒度予測の合算で 0.2568 のコンcordance相関係数(CCC)を達成した。
  • MuSe-Topic において、最良のベースラインは 10 クラスのトピック予測で 76.78%(計算式:0.34×UAR + 0.66×F1)のスコア、3 クラスの感情強度予測で 40.64% のスコアを達成した。
  • MuSe-Trust のベースラインはテストセットで CCC 0.4359 を達成し、価値と覚醒度の信号を補助入力として追加した場合、さらに 0.4119 まで向上した。
  • 連続的感情予測において、生の音声特徴量が視覚的・テキスト的特徴量を個別に用いる場合よりも優れた性能を示した。
  • トピック検出において、NLP特化モデル(微調整された BERT(Albert))が他のアーキテクチャを大きく上回り、トピック認識において言語モデリングの優位性が示された。
  • 価値と覚醒度の予測を補助信号として組み込むことで、信頼性推定の性能が向上した。これは、マルチモーダル感情計算におけるクロスタスク知識移譲の価値を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。