[論文レビュー] The MuSe 2022 Multimodal Sentiment Analysis Challenge: Humor, Emotional Reactions, and Stress
本論文は、ユーモア検出、感情反応強度予測、連続的ストレス感情回帰のための3つの新しいデータセットを導入するMuSe 2022マルチモーダルセンチメント分析チャレンジを提示する。マルチモーダル特徴量とLSTMベースのモデルを用いて、強力なベースライン結果を確立し、ユーモア検出でAUC 0.8480、感情反応で平均ピアソン相関係数0.2801、ストレス予測でアーザルのCCC 0.4931を達成した。
The Multimodal Sentiment Analysis Challenge (MuSe) 2022 is dedicated to multimodal sentiment and emotion recognition. For this year's challenge, we feature three datasets: (i) the Passau Spontaneous Football Coach Humor (Passau-SFCH) dataset that contains audio-visual recordings of German football coaches, labelled for the presence of humour; (ii) the Hume-Reaction dataset in which reactions of individuals to emotional stimuli have been annotated with respect to seven emotional expression intensities, and (iii) the Ulm-Trier Social Stress Test (Ulm-TSST) dataset comprising of audio-visual data labelled with continuous emotion values (arousal and valence) of people in stressful dispositions. Using the introduced datasets, MuSe 2022 2022 addresses three contemporary affective computing problems: in the Humor Detection Sub-Challenge (MuSe-Humor), spontaneous humour has to be recognised; in the Emotional Reactions Sub-Challenge (MuSe-Reaction), seven fine-grained `in-the-wild' emotions have to be predicted; and in the Emotional Stress Sub-Challenge (MuSe-Stress), a continuous prediction of stressed emotion values is featured. The challenge is designed to attract different research communities, encouraging a fusion of their disciplines. Mainly, MuSe 2022 targets the communities of audio-visual emotion recognition, health informatics, and symbolic sentiment analysis. This baseline paper describes the datasets as well as the feature sets extracted from them. A recurrent neural network with LSTM cells is used to set competitive baseline results on the test partitions for each sub-challenge. We report an Area Under the Curve (AUC) of .8480 for MuSe-Humor; .2801 mean (from 7-classes) Pearson's Correlations Coefficient for MuSe-Reaction, as well as .4931 Concordance Correlation Coefficient (CCC) and .4761 for valence and arousal in MuSe-Stress, respectively.
研究の動機と目的
- ユーモア、感情反応、ストレスの3つの新しい多様なデータセットの導入を通じて、マルチモーダルセンチメントおよび感情認識の発展を図ること。
- 現在の感情計算分野の課題に取り組むこと:自然発話におけるユーモア検出、微細な感情強度の予測、連続的ストレスレベルの回帰。
- 実世界の自然な状況、すなわち脚本なしの状況において、音声、映像、テキスト、生理的信号のマルチモーダル統合技術のベンチマークを提供すること。
- オープンアクセスのデータと特徴量を提供することで、音声・映像感情認識、ヘルスインフォマティクス、記号的センチメント分析分野の研究を支援すること。
- 今後の手法開発のための透明性と再現可能性を確保するため、ディープラーニングとマルチモーダル特徴量統合を用いたベースラインを確立すること。
提案手法
- チャレンジは3つの異なるデータセットを用いる:ユーモア検出のためのPassau-SFCH、感情反応強度予測のためのHume-Reaction、連続的ストレスレベル回帰のためのUlm-TSST。
- オープンソースツールを用いて、音声(eGeMAPS、DeepSpectrum)、映像(VGGface2、顔面行動単位)、テキスト(BERT)、生理的信号(BPM、ECG、RESP)から特徴量を抽出する。
- すべてのサブチャレンジに共通して、LSTMセルを備えた再帰的ニューラルネットワークをベースラインモデルとして採用し、一貫性と比較可能性を確保する。
- ラテン融合戦略により、音声、映像、テキストモダリティを統合し、個別および統合された特徴量セットを用いて別々のモデルを学習させ、性能最適化を図る。
- MuSe-Stressでは、生理的信号(EDA、ECG、RESP、BPM)を入力とし、一貫性を保つためにMuSe-Physio 2021チャレンジからのラベルを用いる。
- ベースラインモデルは訓練分割で学習され、開発およびテストセットで評価され、標準指標(AUC、ピアソン相関係数ρ、一致相関係数CCC)を用いて性能が報告される。
実験結果
リサーチクエスチョン
- RQ1自然発話のフットボール記者会見において、マルチモーダル特徴量は、自発的ユーモアを効果的に検出できるか?
- RQ2感情刺激に対する自己録画された音声・映像反応から、微細な感情反応強度(例:面白さ、恐怖、驚き)をどの程度正確に予測できるか?
- RQ3マルチモーダルおよび生理的信号を用いて、ストレス誘発的社交状況における連続的価値とアーザルレベルをどの程度正確に予測できるか?
- RQ4音声、映像、テキスト、生理的信号のどの組み合わせが、マルチモーダルセンチメントおよび感情認識タスクで最も高いパフォーマンスを発揮するか?
- RQ5ノイズや品質にばらつきがある多様な実世界の録音条件において、ベースラインモデルはどの程度頑健か?
主な発見
- MuSe-Humorサブチャレンジでは、VGGface2特徴量を用いて、受容器作動曲線(AUC)が0.8480に達し、自発的コーチ会見におけるユーモア検出の優れた性能を示した。
- MuSe-Reactionサブチャレンジでは、7つの感情クラスにおける平均ピアソン相関係数(ρ)が0.2801に達し、FAU特徴量が競争力のある性能を示した。
- MuSe-Stressサブチャレンジでは、音声とテキスト特徴量のラテン統合を用いて、アーザルのCCCが0.4931、価値のCCCが0.4761に達した。
- 音声と映像モダリティのラテン統合は、MuSe-Stressで最高のパフォーマンス(価値のCCC = 0.6914)を達成し、個別モダリティのベースラインを上回った。
- 生理的信号(BPM、ECG、RESP)の使用は、MuSe-Stressのベースライン結果を向上させ、統合された生理的特徴量を用いた価値のCCCが0.4361に達した。
- 公開リポジトリに生データ、抽出特徴量、コードを含めることで、再現可能性が確保され、今後のマルチモーダル感情計算分野の研究を促進した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。