Skip to main content
QUICK REVIEW

[論文レビュー] The MuSe 2021 Multimodal Sentiment Analysis Challenge: Sentiment, Emotion, Physiological-Emotion, and Stress

Lukas Stappen, Alice Baird|arXiv (Cornell University)|Apr 14, 2021
Emotion and Mood Recognition被引用数 9
ひとこと要約

本論文は、音声・映像・テキスト・生物学的信号を用いた、連続的およびカテゴリカルな感情・感情認識、生理的・感情認識、ストレス検出を焦点とした4つのサブチャレンジを含む、MuSe 2021マルチモーダル感情分析チャレンジを提示する。MuSe-CaRおよびUlm-TSSTデータセットを用いて、LSTMベースのマルチモーダル統合をベースラインモデルとすると、生理的・感情認識においてテストCCCが0.4908に達し、低レベルの生理的信号と感情状態を統合する課題の難易度が浮き彫りになった。

ABSTRACT

Multimodal Sentiment Analysis (MuSe) 2021 is a challenge focusing on the tasks of sentiment and emotion, as well as physiological-emotion and emotion-based stress recognition through more comprehensively integrating the audio-visual, language, and biological signal modalities. The purpose of MuSe 2021 is to bring together communities from different disciplines; mainly, the audio-visual emotion recognition community (signal-based), the sentiment analysis community (symbol-based), and the health informatics community. We present four distinct sub-challenges: MuSe-Wilder and MuSe-Stress which focus on continuous emotion (valence and arousal) prediction; MuSe-Sent, in which participants recognise five classes each for valence and arousal; and MuSe-Physio, in which the novel aspect of `physiological-emotion' is to be predicted. For this years' challenge, we utilise the MuSe-CaR dataset focusing on user-generated reviews and introduce the Ulm-TSST dataset, which displays people in stressful depositions. This paper also provides detail on the state-of-the-art feature sets extracted from these datasets for utilisation by our baseline model, a Long Short-Term Memory-Recurrent Neural Network. For each sub-challenge, a competitive baseline for participants is set; namely, on test, we report a Concordance Correlation Coefficient (CCC) of .4616 CCC for MuSe-Wilder; .4717 CCC for MuSe-Stress, and .4606 CCC for MuSe-Physio. For MuSe-Sent an F1 score of 32.82 % is obtained.

研究の動機と目的

  • リアルワールドおよびストレス状態下での音声・映像・テキスト・生物学的信号モダリティを統合することで、マルチモーダル感情および感情分析を前進させること。
  • EDAとアーザルのアノテーションを統合した新しいサブチャレンジを導入することで、生理的・感情認識におけるギャップを埋めること。
  • MuSe-CaRおよびUlm-TSSTデータセットを用いた標準化されたベンチマークを提供し、特徴抽出およびベースラインモデルを透明でオープンソースとする。
  • 統一的で明確なチャレンジフレームワークを通じて、感情計算、感情分析、ヘルスインフォーマティクスのコミュニティ間の協力を促進すること。

提案手法

  • チャレンジでは2つのデータセットを用いる:MuSe-CaRは、野生的でユーザー生成の車両レビューを対象とし、Ulm-TSSTは、ストレス誘発的なトライアール・ソーシャル・ストレス・テスト(Trier Social Stress Test)のシナリオを対象とする。
  • レーティング・アライメント・アノテーション・ウェイト(RAAW)を用いて連続的 emotions のアノテーションを統合し、レーティング間の一致度と反応時間のアライメントを考慮する。
  • すべてのサブチャレンジにおいて、LSTMベースの再帰的ニューラルネットワークをベースラインモデルとして用い、音声・視覚・テキスト特徴のラテント統合を行う。
  • 各モダリティから、最先端の特徴セットを抽出する:音声にはDeepSpectrum、映像にはVGGface、テキストにはBERT、生物学的信号には1 kHzでサンプリングされた生の信号(EDA、ECG、RESP、BPM)を用いる。
  • 生理的・感情認識のため、EDAとアーザルをRAAWで統合し、モデルは連続的な生理的アーザルレベルを予測する。
  • ベースラインの性能は、回帰タスクには一致相関係数(CCC)を、分類タスクにはF1スコアを用い、明確な訓練/開発/テスト分割を厳密に適用して評価する。

実験結果

リサーチクエスチョン

  • RQ1音声・視覚・テキスト信号を用いて、リアルワールドで非スクリプトな動画レビューにおいて、連続的な価値とアーザルを予測できるマルチモーダルモデルの性能はどの程度か?
  • RQ2EDAなどの生理的信号は、従来のモダリティと比較して、高ストレス状況下での感情およびストレス認識の精度を向上させることができるか?
  • RQ3音声・視覚・テキスト・生物学的信号が、マルチモーダル環境下での連続的およびカテゴリカルな感情状態の予測に果たす相対的寄与度は何か?
  • RQ4レーティング・アライメント・アノテーション・ウェイト(RAAW)を用いることで、多様なデータセットにおける連続的感情アノテーションの質と信頼性はどの程度向上するか?
  • RQ5オープンソースで透明な特徴抽出パイプラインを用いた場合、単純なLSTMベースの統合モデルが、マルチモーダル感情認識で強力な性能を達成できるか、その程度はいかほどか?

主な発見

  • ベースラインモデルは、連続的感情予測のためのMuSe-Wilderサブチャレンジにおいて、テストCCCが0.4616に達した。
  • MuSe-Sent分類タスクでは、ベースラインがテストセットでF1スコア32.82%を達成した。視覚とテキストのラテント統合が最も優れた性能を示した。
  • MuSe-Stressサブチャレンジでは、最良のモデルがテストセットでCCC 0.5088を達成した。音声と視覚特徴のラテント統合が、個々のモダリティを上回った。
  • 新規のMuSe-Physioサブチャレンジでは、最良のベースラインが、最高の音声(DeepSpectrum)と視覚(VGGface)特徴を統合することで、テストセットでCCC 0.4908を達成した。
  • テキスト特徴(BERT)は、音声および視覚特徴に比べて著しく劣り、MuSe-Physioでは開発セットで0.2583のCCC、テストセットで0.1604のCCCを記録した。
  • 生物学的信号のみを用い、4層のLSTMを適用した場合、生理的・感情認識のテストセットでCCC 0.3328を達成した。これは、今後の改善の可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。