Skip to main content
QUICK REVIEW

[論文レビュー] GraphCFC: A Directed Graph Based Cross-Modal Feature Complementation Approach for Multimodal Conversational Emotion Recognition

Jiang Li, Xiaoping Wang|arXiv (Cornell University)|Jul 6, 2022
Sentiment Analysis and Opinion Mining参考文献 41被引用数 9
ひとこと要約

本稿では、GNNを用いた複数の部分空間抽出器とペアワイズクロスモダリティ補完(PairCC)戦略を備えた有向グラフベースのクロスモダリティ特徴補完フレームワーク、GraphCFCを提案する。このフレームワークは、長距離の文脈的依存関係とモダリティ間相互作用をモデル化することで、マルチモーダル会話感情認識を向上させる。IEMOCAPおよびMELDデータセットにおいて最先端の性能を達成し、3感情分類設定下でMELDにおいてMMGCNを0.61%の精度および1.20%のF1スコアで上回った。

ABSTRACT

Emotion Recognition in Conversation (ERC) plays a significant part in Human-Computer Interaction (HCI) systems since it can provide empathetic services. Multimodal ERC can mitigate the drawbacks of uni-modal approaches. Recently, Graph Neural Networks (GNNs) have been widely used in a variety of fields due to their superior performance in relation modeling. In multimodal ERC, GNNs are capable of extracting both long-distance contextual information and inter-modal interactive information. Unfortunately, since existing methods such as MMGCN directly fuse multiple modalities, redundant information may be generated and diverse information may be lost. In this work, we present a directed Graph based Cross-modal Feature Complementation (GraphCFC) module that can efficiently model contextual and interactive information. GraphCFC alleviates the problem of heterogeneity gap in multimodal fusion by utilizing multiple subspace extractors and Pair-wise Cross-modal Complementary (PairCC) strategy. We extract various types of edges from the constructed graph for encoding, thus enabling GNNs to extract crucial contextual and interactive information more accurately when performing message passing. Furthermore, we design a GNN structure called GAT-MLP, which can provide a new unified network framework for multimodal learning. The experimental results on two benchmark datasets show that our GraphCFC outperforms the state-of-the-art (SOTA) approaches.

研究の動機と目的

  • 会話感情認識(ERC)における単モダリティおよび直接融合型マルチモーダル手法の限界、特に多様な情報の損失と特徴融合における重複を解消すること。
  • テキスト、音声、ビジュアル入力間のモダリティ間の非均質性を低減し、動的で補完的な特徴学習を可能にするために、モダリティ間の動的補完を可能にする。
  • 従来のGNNベース手法(例:MMGCN)と比較して、長距離の文脈的依存関係とモダリティ間相互作用をより効果的にモデル化すること。
  • 会話システムにおける強固なマルチモーダル表現学習を可能にする統合的GNNアーキテクチャ、GAT-MLPを設計すること。
  • 感情のシフト問題を軽減し、微細または曖昧な感情状態の認識を向上させることで、ベンチマークデータセットにおける性能を向上させること。

提案手法

  • ノードが発話を表し、エッジがモダリティ内(文脈的)およびモダリティ間(対話的)な関係を符号化する有向グラフを構築する。
  • 異なるモダリティを共有されたが異なる低次元空間に投影する複数の部分空間抽出器を適用し、モダリティの非均質性を低減する。
  • 1つのモダリティからの特徴が、他のモダリティの欠落または曖昧な信号を補完できるように、明示的にモデル化するペアワイズクロスモダリティ補完(PairCC)戦略を実装する。
  • グラフアテンション機構と多層パーセプトロンを組み合わせたGAT-MLPアーキテクチャを設計し、モダリティおよび会話履歴全体にわたる動的でアテンション重み付き表現を学習する。
  • グラフ内のメッセージパッシングを用いて表現を伝搬・精錬し、長距離の依存関係および発話者間ダイナミクスを捉える。
  • マルチモーダル会話データにおける多クラス感情分類のための交差エントロピー損失を用いて、エンドツーエンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1従来のGNNと比較して、有向グラフベースのアプローチは、マルチモーダル会話における文脈的および対話的情報をより効果的にモデル化できるか?
  • RQ2クロスモダリティ特徴補完は、感情認識におけるテキスト、音声、ビジュアルモダリティ間の非均質性ギャップをどの程度低減できるか?
  • RQ3GraphCFCは、単モダリティおよび早期融合モデルに共通する感情のシフト問題をどの程度軽減できるか?
  • RQ4提案されたGAT-MLPアーキテクチャは、先行するGNNベースのモデルと比較して、より効果的で統合的なマルチモーダル学習フレームワークを提供するか?
  • RQ5GraphCFCは、粗い(3感情)と細かめ(6または7感情)のラベルスキームの両方において一般化可能か?

主な発見

  • IEMOCAPデータセットにおいて、3感情設定下で88.48%の精度および80.20%の加重F1スコアを達成し、MMGCNを0.61%の精度および1.20%のF1スコアで上回った。
  • MELDデータセットでは、75.12%の精度および68.12%の加重F1スコアを達成し、MMGCNと比較して精度で0.61%、F1スコアで1.20%の絶対的向上を示した。
  • 事例研究では、単一モダリティまたは早期融合モデルが『ニュートラル』として誤分類する『エキサイトド』や『サッド』といった感情が強い発話を正しく同定していることを示した。
  • モデルは、連続するニュートラル発話後に『ニュートラル』にデフォルトする傾向があるMMGCNなどのモデルと比較して、クロスモダリティの手がかりを活用することで感情のシフトエラーを効果的に低減した。
  • PairCC戦略および複数の部分空間抽出器は、1つのモダリティが曖昧またはノイジーな場合に特に特徴補完を向上させた。
  • GAT-MLPアーキテクチャは、IEMOCAPおよびMELDデータセットの両方で一貫した性能向上を示しており、より優れた表現学習を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。