Skip to main content
QUICK REVIEW

[論文レビュー] Joyful: Joint Modality Fusion and Graph Contrastive Learning for Multimodal Emotion Recognition

Dongyuan Li, Yusong Wang|arXiv (Cornell University)|Nov 18, 2023
Emotion and Mood Recognition被引用数 6
ひとこと要約

Joyful は、マルチモーダル感情認識のための統合最適化フレームワークを提案し、マルチモーダル融合、グラフ対照学習(GCL)、エンドツーエンドの感情分類を統合する。新たな融合メカニズムを導入して、グローバルな文脈的特徴とモダリティ固有の特徴を両方保持し、内部および外部ビュー間の対照学習を用いて過剰平滑化を軽減し、表現の識別性を向上させ、3つのベンチマークデータセットで最先端の性能を達成した。

ABSTRACT

Multimodal emotion recognition aims to recognize emotions for each utterance of multiple modalities, which has received increasing attention for its application in human-machine interaction. Current graph-based methods fail to simultaneously depict global contextual features and local diverse uni-modal features in a dialogue. Furthermore, with the number of graph layers increasing, they easily fall into over-smoothing. In this paper, we propose a method for joint modality fusion and graph contrastive learning for multimodal emotion recognition (Joyful), where multimodality fusion, contrastive learning, and emotion recognition are jointly optimized. Specifically, we first design a new multimodal fusion mechanism that can provide deep interaction and fusion between the global contextual and uni-modal specific features. Then, we introduce a graph contrastive learning framework with inter-view and intra-view contrastive losses to learn more distinguishable representations for samples with different sentiments. Extensive experiments on three benchmark datasets indicate that Joyful achieved state-of-the-art (SOTA) performance compared to all baselines.

研究の動機と目的

  • 既存のグラフベース手法がマルチモーダル感情認識において抱える課題、特に過剰平滑化とグローバル特徴およびユニモーダル特徴の劣化した統合を解消すること。
  • 融合表現をグラフモデリングの前に固定する二段階パイプラインの性能が不十分であるという問題を克服すること。
  • マルチモーダル融合、グラフ対照学習、感情認識を同時に最適化することで表現の識別性を向上させること。
  • トピックに配慮した融合メカニズムを通じて、モダリティ固有の意味を保持しつつ、グローバルな文脈情報を統合すること。
  • グラフ増強および対照学習戦略を用いて、ロバスト性と一般化性能を向上させること。

提案手法

  • グローバル文脈表現とユニモーダル固有の特徴を別々にモデル化する新しいマルチモーダル融合メカニズムを提案し、トピック関連ベクトルを用いて文脈の安定性を時間的に維持する。
  • ユニモーダル特徴を共有部分空間に射影することで、意味的豊かさを保持するとともに、クロスマodalの整合性を維持する。
  • 類似した感情サンプルと異なる感情サンプルの間の識別能を向上させるために、外部ビューおよび内部ビューの対照損失を備えたグラフ対照学習フレームワークを導入する。
  • ロバスト性と一般化性能を向上させるために、グラフ増強戦略(例:ノードマスキング、エッジドロップ)を適用する。
  • 統一された目的関数を用いてマルチモーダル融合、GCL、感情認識をエンドツーエンドで最適化し、グローバル最適化を達成する。
  • 動的に更新されるトピック関連ベクトルを用いて、会話の各ターンにおけるグローバル文脈表現の一貫性を維持する。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダル融合、グラフ対照学習、感情認識の統合最適化は、逐次的または二段階パイプラインよりも性能を向上させるか?
  • RQ2提案された新しい融合メカニズムは、マルチモーダル会話においてグローバル文脈的特徴とモダリティ固有の特徴をどれほど効果的に保持できるか?
  • RQ3グラフ対照学習は、マルチモーダル感情認識における深層GNNの過剰平滑化をどの程度軽減できるか?
  • RQ4提案手法は多様なマルチモーダル感情認識ベンチマークでどの程度一般化できるか?
  • RQ5グラフ増強および対照学習は、リソースが限られたまたはノイジーなモダリティ環境下での表現識別性にどのような影響を与えるか?

主な発見

  • Joyful は、マルチモーダル感情認識の3つのベンチマークデータセットで最先端の性能を達成し、既存のSOTA手法を上回った。
  • 融合、対照学習、感情認識の統合最適化により、二段階ベースラインと比較して表現品質が向上し、過剰平滑化が軽減された。
  • 提案された融合メカニズムは、グローバル文脈的特徴とモダリティ固有の特徴の両方を効果的に保持し、特徴の豊かさと整合性を向上させた。
  • 外部ビューおよび内部ビューの損失を用いたグラフ対照学習により、類似した感情クラスと異なる感情クラスの表現の識別性が顕著に向上した。
  • 特にノイジーまたは曖昧なモダリティ条件下でも、効果的なグラフ増強戦略により、モデルはロバスト性と一般化性能を示した。
  • MSA タスクでは、他のモデルがテキストモダリティに強く焦点を当てているため、SOTAベースラインに劣ったが、MERC タスクでは優れた結果を達成し、会話レベルの感情認識に向けた設計の有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。